Teradata-vejledning: Database Architecture & typer

⚡ Smart opsummering

Teradata SQL kører på en massivt parallel relationsdatabase bygget til data warehousing i virksomhedsskala. Denne side forklarer Parsing Engine, BYNET og AMP-arkitekturen, de understøttede DDL-, DCL- og DML-kommandosæt samt praktiske forretningsapplikationer.

  • 🏛️ Kernedefinition: Teradata er et kommercielt relationelt databasehåndteringssystem bygget på Massively Parallel Processing, ikke en open source-motor.
  • 🇧🇷 Tre komponenter: Parsing Engine planlægger forespørgsler, BYNET flytter rækker, og Access Module-processorer søger på deres egne diske.
  • 📈 Lineær skalerbarhed: Tilføjelse af noder øger gennemløbshastigheden proportionalt, fordi et design med delt ingenting fjerner konflikt mellem parallelitetsenheder.
  • 🧾 Kommandodækning: DDL opretter objekter, DCL tildeler rettigheder, og DML vælger, opdaterer og sletter rækker.
  • ☁️ Moderne platform: Vantage, VantageCloud og ClearScape Analytics udvider motoren til cloud- og maskinlæring i databaser.

Teradata tutorial

Hvad er Teradata?

Teradata er et kommercielt relationelt databasehåndteringssystem til udviklingping storstilede data warehousing-applikationer. Dette værktøj understøtter flere data warehouse-operationer samtidigt ved hjælp af parallelisme-konceptet. Teradata er et massivt parallelt behandlingssystem, der understøtter Unix/Linux/Windows server platforme.

Teradata software er udviklet af Teradata Corporation, som er et amerikansk it-firma. Det er en leverandør af analytiske dataplatforme, applikationer og andre relaterede tjenester. Firmaet udvikler et produkt til at konsolidere data fra forskellige kilder og gøre dataene tilgængelige for analyse.

Hvorfor Teradata?

  • Teradata tilbyder en komplet pakke af tjenester, der fokuserer på Datavarehousing
  • Systemet er bygget på åben arkitektur. Så hver gang hurtigere enheder stilles til rådighed, kan de indarbejdes i den allerede opbyggede arkitektur.
  • Teradata understøtter 50+ petabyte data.
  • Enkeltbetjeningsvisning for et stort Teradata multi-node system ved hjælp af Service Workstation
  • Kompatibel med en bred vifte af BI værktøj at hente data.
  • Det kan fungere som et enkelt kontrolpunkt for DBA til at styre Database.
  • Høj ydeevne, forskellige forespørgsler, analyse i databasen og sofistikeret styring af arbejdsbelastning
  • Teradata giver dig mulighed for at få de samme data på flere implementeringsmuligheder

Disse fordele blev opbygget over fire årtier, som tidslinjen nedenfor viser.

Teradatas historie

Teradata blev stiftet i 1979 af Caltech-forskere, der arbejdede sammen med Citibank. NCR Corporation opkøbte det i 1991, og Teradata blev udskilt som et uafhængigt børsnoteret selskab i oktober 2007 med Michael Koehler som dets første administrerende direktør. Virksomheden har hovedkontor i San Diego og har været ledet af præsident og administrerende direktør Steve McMillan siden 2020.

Teradata Corporations milepæle:

  • 1979 – Teradata blev inkorporeret
  • 1984 – Frigivelse af første databasecomputer DBC/1012
  • 1986 - Fortune magazine erklærede Teradata som 'Årets produkt'
  • 1991 – NCR Corporation opkøber Teradata
  • 1999 – Største database bygget ved hjælp af Teradata med 130 Terabyte
  • 2002 – Teradata V2R5 versionsudgivelse med komprimering og Partition Primary
  • 2006 – Lancering af Teradata Master Data Management-løsning
  • 2007 – Teradata udskilles fra NCR og børsnoteres som et uafhængigt selskab
  • 2008 – Teradata 13.0 udgivet med Active Data Warehousing
  • 2011 – Køber Teradata Aster og kaster sig ud i Advanced Analytics Space
  • 2012 – Teradata 14.0 introduceret
  • 2014 – Teradata 15.0 introduceret
  • 2015 – Teradata køber app-marketingplatformen Appoxee
  • 2017 – Teradata opkøber San Diegos StackIQ
  • 2018 – Teradata Vantage lanceres som en samlet analyseplatform
  • 2022 – VantageCloud Lake udgivet til cloud-native analyser
  • 2023 – ClearScape Analytics tilføjer AI og maskinlæring i databasen i stor skala
  • 2024 – Tilføjer understøttelse af åbne tabelformater for Apache Iceberg og Delta Lake, og udgiver Teradata AI Unlimited på AWS og Azure markedspladser
  • 2025 – Lancerer Enterprise Vector Store, en open source MCP-server, og AgentBuilder til at understøtte agentiske AI-arbejdsbelastninger
  • 2026 – Teradata Autonomous Knowledge Platform annonceret i maj og bliver generelt tilgængelig i juli på tværs af cloud-, on-premise- og hybridimplementeringer.

Næste i denne Teradata-tutorial lærer vi om funktionerne i Teradata.

Funktioner i Teradata SQL

Teradata tilbyder følgende kraftfulde funktioner:

  • Lineær skalerbarhed: Tilbyder lineær skalerbarhed ved håndtering af store mængder data ved at tilføje noder for at øge systemets ydeevne.
  • Ubegrænset parallelisme: Teradata er baseret på MPP (Massively Parallel Processing). Architecture). Så det er designet til at være parallelt siden begyndelsen. Den kan dele en stor opgave op i mindre opgaver og køre dem parallelt
  • Mature Optimizer: Teradata Optimizer kan håndtere op til 64 joinforbindelser i en forespørgsel.
  • Lav TCO: Teradata har lave samlede ejeromkostninger. Det er nemt at opsætte, vedligeholde og administrere.
  • Indlæs og aflæs hjælpeprogrammer: Teradata leverer ind- og udlæsningsværktøjer til at flytte data ind i/fra Teradata System.
  • Tilslutning: Dette MPP-system kan oprette forbindelse til kanaltilknyttede systemer som en mainframe eller netværkstilsluttede systemer.
  • SQL: Teradata understøtter SQL at interagere med de data, der er gemt i tabeller. Det giver sin forlængelse.
  • Robuste hjælpeprogrammer: Teradata leverer robuste værktøjer til at importere/eksportere data fra/til Teradata-systemer som FastExport, FastLoad, MultiLoad og TPT.
  • Automatisk distribution: Teradata kan distribuere dataene til diskene automatisk uden manuel indgriben.

Næste i denne Teradata SQL-tutorial lærer vi om Teradata Architecture.

Teradata Architecture

Teradata-arkitektur er en massivt parallel behandling Architecture.

Tre vigtige komponenter i Teradata er:

  • Parsing Engine
  • BYNET
  • Access Module Processorer (AMP'er)

Teradata lagring Architecture Database ArchiTecture Diagram:

Teradata Architecture
Teradata Architecture diagram

Diagrammet ovenfor tracsender en anmodning fra parsing engine, via BYNET, ned til de AMP'er, der ejer diskene. De to underafsnit nedenfor følger denne sti i hver retning.

Teradata lagring Architecture

Parsing Engine:

Parsing Engine analyserer forespørgslerne og forbereder udførelsesplanen. Det administrerer sessioner for brugere. Det optimerer og sender en anmodning til brugerne.

Så når klienten udfører forespørgsler for at indsætte poster, sender Parsing Engine posterne til Message Passing-laget. Message passing layer eller BYNET er en software- og hardwarekomponent. Det tilbyder netværkskapacitet. Den henter også posterne og sender rækken til mål-AMP.

Amp:

AMP står for Access Module Processor. Det gemmer poster på disse diske. AMP udfører følgende aktiviteter:

  • Styrer en del af databasen
  • Styrer en del af hvert bord
  • Udfør alle de opgaver, der er forbundet med at generere resultatsæt, såsom sortering, aggregering og joinforbindelse
  • Udfør låse- og pladsstyring

Teradata-hentning Architecture

Når klienten kører forespørgsler for at hente poster, sender parsing-motoren en anmodning til BYNET. Derefter sender BYNET genfindingsanmodningen til passende AMP'er.

AMP'er søger parallelt på deres diske og genkender de nødvendige poster og sender dem til BYNET. BYNET sender posterne til Parsing Engine, som igen vil blive sendt til klienten.

Dernæst i denne Teradata Database-øvelse lærer vi om Teradata SQL-kommandoer.

Typer af Teradata SQL-kommandoer

Teradata Database understøtter følgende grundlæggende SQL-kommandoer:

  1. Data Definition Language (DDL) kommandoer
  2. Data Control Language (DCL) kommandoer
  3. Data Manipulation Language (DML) kommandoer

Kommandoer til datadefinitionssprog

KOMMANDO Beskrivelse
SKAB Opretter en ny database, tabel, bruger osv.
DROP Fjerner en ny database, tabel, bruger osv.
ÆNDRE Ændrer en tabel, kolonne, trigger osv.
MODIFICERE Ændrer en database eller brugerdefinition
OMDØB Ændrer navn på tabeller, visninger, makroer osv.

Kommandoer til datakontrolsprog

KOMMANDO Beskrivelse
TILDEL/ TILBAGETRÆKKE Bruges til at kontrollere privilegier for en bruger på et objekt
TILDEL LOGON/TILBAGE LOGON Bruges til at kontrollere logonrettigheder til en vært eller værtsgruppe
GIVE Bruges til at give et databaseobjekt til et andet databaseobjekt

Teradata Database SQL Data Manipulation Language-kommandoer

KOMMANDO Beskrivelse
SLET Fjerner en række fra tabellen
ECHO Bruges til at ekko en streng eller kommando til klienten
KONTROLPUNKT Definerer et gendannelsespunkt i journalen, der senere kan bruges til at gendanne tabelindholdet
SELECT Bruges til at returnere bestemte rækkedata i en tabelform
OPDATER Ændrer data i en eller flere rækker i en tabel

Teradata-produktpakke og implementeringsmuligheder

Disse kommandoer opfører sig identisk, uanset hvilken udgave der kører under, fordi Teradata leverer én motor på tværs af flere leveringsmodeller.

  • Teradata Vantage: Kerneplatformen, der kombinerer SQL-motoren, arbejdsbelastningsstyring og forbindelser til objektlagring.
  • VantageCloud Enterprise: En administreret implementering på AWS, Azure eller Google Cloud for lagre, der flytter ejet hardware.
  • VantageCloud-søen: En cloud-native, objektlagring-først-udgave med uafhængige beregningsklynger til elastiske arbejdsbelastninger.
  • ClearScape Analytics: Det databaseinterne lag, der kører maskinlæring og tidsseriefunktioner ved siden af ​​dataene.
  • On-premises IntelliFlex: Specialbygget hardware til regulerede arbejdsbelastninger, der skal forblive i et privat datacenter.

Fordi én SQL-sætning kører uændret på tværs af disse udgaver, er hybride ejendomme almindelige.

Anvendelser af Teradata-databasen

Følgende er de populære Teradata-applikationer:

  • Kundedatahåndtering: Hjælper med at opretholde langvarige relationer med kunder.
  • Master Data Management: Hjælper med at udvikle et miljø, hvor masterdata kan bruges, synkroniseres og lagres.
  • Økonomi og resultatstyring: Hjælper organisationen med at forbedre hastigheden og kvaliteten af ​​finansiel rapportering. Det reducerer omkostningerne til finansieringsinfrastruktur og styrer virksomhedens ydeevne proaktivt.
  • Supply Chain Management: Forbedre forsyningskædedriften, som hjælper til forbedret kundeservice, reducerede cyklustider og lavere varebeholdninger.
  • Efterspørgselskædestyring: Hjælper med at øge kundeserviceniveauer og salg. Det hjælper også virksomheder med at forudsige efterspørgslen efter deres butiksvarer nøjagtigt.

Næste i denne Teradata for begyndere tutorial, vil vi lære om forskellen mellem Teradata og andre RDBMS.

Forskellen mellem Teradata og andre RDBMS

Parameter Teradata RDBMS
Architectures Følger Shared Nothing Architecture. Delte alt og tillader ressourcestrid.
Processer MIPS [Millioner af instruktioner/sek.] KIPS [Tusindvis af instruktioner/sek]
Indexes Bedre distribution og genfinding Tilbyder kun FASI Retrieval
parallelitet Understøtter ubetinget parallelisme. Parallelisme er betinget og uforudsigelig
Bulk belastning Teradata tillader bulk load. Tillader kun begrænset bulkbelastning.
Skalerbarhed Lineær skalerbarhed med en hældning på én Skalerbarhed med faldende afkast
Database buffer En enkelt databasebuffer brugt af alle UoP'er (en parallelitetsenhed). Et enkelt datalager, der tilgås af alle UoP'er. Query Controller sender funktioner til UoP'er, der ejer dataene
butikker Den lagrer TERABYTE [Billioner af rækker] GIGABYTE [Millioner af rækker]

Rækken "shared-nothing" ovenfor afhænger af den behandlingsmodel, der sammenlignes derefter.

MPP vs. SMP

MPP SMP
MPP – Massively Parallel Processing. Det er computersystem, som er knyttet til mange uafhængige aritmetiske enheder eller hele mikroprocessorer, der kører parallelt. Symmetrisk multi-behandling. I et SMP-behandlingssystem deler CPU'erne den samme hukommelse, og som et resultat kan kode, der kører i et system, påvirke den hukommelse, der bruges af et andet.
Databaser kan udvides ved at tilføje nye CPU'er. SMP-databaser bruger generelt én CPU til at udføre databasesøgninger.
I et MPP-miljø forbedres ydeevnen, fordi ingen ressourcer skal deles mellem fysiske computere. Arbejdsbyrden for et paralleljob er fordelt på tværs af processorerne i systemet.
Ydeevnen af ​​et massivt parallelt behandlingssystem er lineært. Det vil dog stige i forhold til antallet af noder. SMP-databaser kan køre på flere servere. Vil dog dele en anden ressource.

Ofte Stillede Spørgsmål

Det primære indeks bestemmer, hvilken AMP der gemmer hver række. Teradata hasher indekskolonnen og router rækken til den matchende AMP, så et velvalgt indeks spreder data jævnt og undgår skævhed.

Teradata Studio er den nuværende grafiske klient, der erstatter den ældre SQL Assistant. BTEQ håndterer scriptet batcharbejde fra en terminal, og standard ODBC- eller JDBC-drivere forbinder tredjepartsdata. BI værktøjer.

Produktionsplatformen er kommercielt licenseret, men Teradata tilbyder et gratis ClearScape Analytics Experience-miljø og prøveversioner for udviklere, som er nok til at øve SQL, indeksering og forespørgselsplanlægning.

ClearScape Analytics kører maskinlæring, scoring og tidsseriefunktioner som SQL direkte på gemte rækker.ping Modeller ved siden af ​​dataene fjerner eksporttrinnene og lader forudsigelser bruge hele lageret i stedet for en stikprøve.

AI-assistenter udarbejder forespørgsler og foreslår ændringer i indeks eller join, men optimeringsstatistikken og forretningsreglerne kræver stadig menneskelig gennemgang. Behandl genereret SQL som et startkladde, aldrig som en produktionsudgivelse.

Opsummer dette indlæg med: