Teradata-vejledning: Database Architecture & typer

โšก Smart opsummering

Teradata SQL kรธrer pรฅ en massivt parallel relationsdatabase bygget til data warehousing i virksomhedsskala. Denne side forklarer Parsing Engine, BYNET og AMP-arkitekturen, de understรธttede DDL-, DCL- og DML-kommandosรฆt samt praktiske forretningsapplikationer.

  • ๐Ÿ›๏ธ Kernedefinition: Teradata er et kommercielt relationelt databasehรฅndteringssystem bygget pรฅ Massively Parallel Processing, ikke en open source-motor.
  • ๐Ÿ‡ง๐Ÿ‡ท Tre komponenter: Parsing Engine planlรฆgger forespรธrgsler, BYNET flytter rรฆkker, og Access Module-processorer sรธger pรฅ deres egne diske.
  • ๐Ÿ“ˆ Lineรฆr skalerbarhed: Tilfรธjelse af noder รธger gennemlรธbshastigheden proportionalt, fordi et design med delt ingenting fjerner konflikt mellem parallelitetsenheder.
  • ๐Ÿงพ Kommandodรฆkning: DDL opretter objekter, DCL tildeler rettigheder, og DML vรฆlger, opdaterer og sletter rรฆkker.
  • โ˜๏ธ Moderne platform: Vantage, VantageCloud og ClearScape Analytics udvider motoren til cloud- og maskinlรฆring i databaser.

Teradata tutorial

Hvad er Teradata?

Teradata er et kommercielt relationelt databasehรฅndteringssystem til udviklingping storstilede data warehousing-applikationer. Dette vรฆrktรธj understรธtter flere data warehouse-operationer samtidigt ved hjรฆlp af parallelisme-konceptet. Teradata er et massivt parallelt behandlingssystem, der understรธtter Unix/Linux/Windows server platforme.

Teradata software er udviklet af Teradata Corporation, som er et amerikansk it-firma. Det er en leverandรธr af analytiske dataplatforme, applikationer og andre relaterede tjenester. Firmaet udvikler et produkt til at konsolidere data fra forskellige kilder og gรธre dataene tilgรฆngelige for analyse.

Hvorfor Teradata?

  • Teradata tilbyder en komplet pakke af tjenester, der fokuserer pรฅ Datavarehousing
  • Systemet er bygget pรฅ รฅben arkitektur. Sรฅ hver gang hurtigere enheder stilles til rรฅdighed, kan de indarbejdes i den allerede opbyggede arkitektur.
  • Teradata understรธtter 50+ petabyte data.
  • Enkeltbetjeningsvisning for et stort Teradata multi-node system ved hjรฆlp af Service Workstation
  • Kompatibel med en bred vifte af BI vรฆrktรธj at hente data.
  • Det kan fungere som et enkelt kontrolpunkt for DBA til at styre Database.
  • Hรธj ydeevne, forskellige forespรธrgsler, analyse i databasen og sofistikeret styring af arbejdsbelastning
  • Teradata giver dig mulighed for at fรฅ de samme data pรฅ flere implementeringsmuligheder

Disse fordele blev opbygget over fire รฅrtier, som tidslinjen nedenfor viser.

Teradatas historie

Teradata blev stiftet i 1979 af Caltech-forskere, der arbejdede sammen med Citibank. NCR Corporation opkรธbte det i 1991, og Teradata blev udskilt som et uafhรฆngigt bรธrsnoteret selskab i oktober 2007 med Michael Koehler som dets fรธrste administrerende direktรธr. Virksomheden har hovedkontor i San Diego og har vรฆret ledet af prรฆsident og administrerende direktรธr Steve McMillan siden 2020.

Teradata Corporations milepรฆle:

  • 1979 โ€“ Teradata blev inkorporeret
  • 1984 โ€“ Frigivelse af fรธrste databasecomputer DBC/1012
  • 1986 - Fortune magazine erklรฆrede Teradata som 'ร…rets produkt'
  • 1991 โ€“ NCR Corporation opkรธber Teradata
  • 1999 โ€“ Stรธrste database bygget ved hjรฆlp af Teradata med 130 Terabyte
  • 2002 โ€“ Teradata V2R5 versionsudgivelse med komprimering og Partition Primary
  • 2006 โ€“ Lancering af Teradata Master Data Management-lรธsning
  • 2007 โ€“ Teradata udskilles fra NCR og bรธrsnoteres som et uafhรฆngigt selskab
  • 2008 โ€“ Teradata 13.0 udgivet med Active Data Warehousing
  • 2011 โ€“ Kรธber Teradata Aster og kaster sig ud i Advanced Analytics Space
  • 2012 โ€“ Teradata 14.0 introduceret
  • 2014 โ€“ Teradata 15.0 introduceret
  • 2015 โ€“ Teradata kรธber app-marketingplatformen Appoxee
  • 2017 โ€“ Teradata opkรธber San Diegos StackIQ
  • 2018 โ€“ Teradata Vantage lanceres som en samlet analyseplatform
  • 2022 โ€“ VantageCloud Lake udgivet til cloud-native analyser
  • 2023 โ€“ ClearScape Analytics tilfรธjer AI og maskinlรฆring i databasen i stor skala
  • 2024 โ€“ Tilfรธjer understรธttelse af รฅbne tabelformater for Apache Iceberg og Delta Lake, og udgiver Teradata AI Unlimited pรฅ AWS og Azure markedspladser
  • 2025 โ€“ Lancerer Enterprise Vector Store, en open source MCP-server, og AgentBuilder til at understรธtte agentiske AI-arbejdsbelastninger
  • 2026 โ€“ Teradata Autonomous Knowledge Platform annonceret i maj og bliver generelt tilgรฆngelig i juli pรฅ tvรฆrs af cloud-, on-premise- og hybridimplementeringer.

Nรฆste i denne Teradata-tutorial lรฆrer vi om funktionerne i Teradata.

Funktioner i Teradata SQL

Teradata tilbyder fรธlgende kraftfulde funktioner:

  • Lineรฆr skalerbarhed: Tilbyder lineรฆr skalerbarhed ved hรฅndtering af store mรฆngder data ved at tilfรธje noder for at รธge systemets ydeevne.
  • Ubegrรฆnset parallelisme: Teradata er baseret pรฅ MPP (Massively Parallel Processing). Architecture). Sรฅ det er designet til at vรฆre parallelt siden begyndelsen. Den kan dele en stor opgave op i mindre opgaver og kรธre dem parallelt
  • Mature Optimizer: Teradata Optimizer kan hรฅndtere op til 64 joinforbindelser i en forespรธrgsel.
  • Lav TCO: Teradata har lave samlede ejeromkostninger. Det er nemt at opsรฆtte, vedligeholde og administrere.
  • Indlรฆs og aflรฆs hjรฆlpeprogrammer: Teradata leverer ind- og udlรฆsningsvรฆrktรธjer til at flytte data ind i/fra Teradata System.
  • Tilslutning: Dette MPP-system kan oprette forbindelse til kanaltilknyttede systemer som en mainframe eller netvรฆrkstilsluttede systemer.
  • SQL: Teradata understรธtter SQL at interagere med de data, der er gemt i tabeller. Det giver sin forlรฆngelse.
  • Robuste hjรฆlpeprogrammer: Teradata leverer robuste vรฆrktรธjer til at importere/eksportere data fra/til Teradata-systemer som FastExport, FastLoad, MultiLoad og TPT.
  • Automatisk distribution: Teradata kan distribuere dataene til diskene automatisk uden manuel indgriben.

Nรฆste i denne Teradata SQL-tutorial lรฆrer vi om Teradata Architecture.

Teradata Architecture

Teradata-arkitektur er en massivt parallel behandling Architecture.

Tre vigtige komponenter i Teradata er:

  • Parsing Engine
  • BYNET
  • Access Module Processorer (AMP'er)

Teradata lagring Architecture Database ArchiTecture Diagram:

Teradata Architecture
Teradata Architecture diagram

Diagrammet ovenfor tracsender en anmodning fra parsing engine, via BYNET, ned til de AMP'er, der ejer diskene. De to underafsnit nedenfor fรธlger denne sti i hver retning.

Teradata lagring Architecture

Parsing Engine:

Parsing Engine analyserer forespรธrgslerne og forbereder udfรธrelsesplanen. Det administrerer sessioner for brugere. Det optimerer og sender en anmodning til brugerne.

Sรฅ nรฅr klienten udfรธrer forespรธrgsler for at indsรฆtte poster, sender Parsing Engine posterne til Message Passing-laget. Message passing layer eller BYNET er en software- og hardwarekomponent. Det tilbyder netvรฆrkskapacitet. Den henter ogsรฅ posterne og sender rรฆkken til mรฅl-AMP.

Amp:

AMP stรฅr for Access Module Processor. Det gemmer poster pรฅ disse diske. AMP udfรธrer fรธlgende aktiviteter:

  • Styrer en del af databasen
  • Styrer en del af hvert bord
  • Udfรธr alle de opgaver, der er forbundet med at generere resultatsรฆt, sรฅsom sortering, aggregering og joinforbindelse
  • Udfรธr lรฅse- og pladsstyring

Teradata-hentning Architecture

Nรฅr klienten kรธrer forespรธrgsler for at hente poster, sender parsing-motoren en anmodning til BYNET. Derefter sender BYNET genfindingsanmodningen til passende AMP'er.

AMP'er sรธger parallelt pรฅ deres diske og genkender de nรธdvendige poster og sender dem til BYNET. BYNET sender posterne til Parsing Engine, som igen vil blive sendt til klienten.

Dernรฆst i denne Teradata Database-รธvelse lรฆrer vi om Teradata SQL-kommandoer.

Typer af Teradata SQL-kommandoer

Teradata Database understรธtter fรธlgende grundlรฆggende SQL-kommandoer:

  1. Data Definition Language (DDL) kommandoer
  2. Data Control Language (DCL) kommandoer
  3. Data Manipulation Language (DML) kommandoer

Kommandoer til datadefinitionssprog

KOMMANDO Beskrivelse
SKAB Opretter en ny database, tabel, bruger osv.
DROP Fjerner en ny database, tabel, bruger osv.
ร†NDRE ร†ndrer en tabel, kolonne, trigger osv.
MODIFICERE ร†ndrer en database eller brugerdefinition
OMDร˜B ร†ndrer navn pรฅ tabeller, visninger, makroer osv.

Kommandoer til datakontrolsprog

KOMMANDO Beskrivelse
TILDEL/ TILBAGETRร†KKE Bruges til at kontrollere privilegier for en bruger pรฅ et objekt
TILDEL LOGON/TILBAGE LOGON Bruges til at kontrollere logonrettigheder til en vรฆrt eller vรฆrtsgruppe
GIVE Bruges til at give et databaseobjekt til et andet databaseobjekt

Teradata Database SQL Data Manipulation Language-kommandoer

KOMMANDO Beskrivelse
SLET Fjerner en rรฆkke fra tabellen
ECHO Bruges til at ekko en streng eller kommando til klienten
KONTROLPUNKT Definerer et gendannelsespunkt i journalen, der senere kan bruges til at gendanne tabelindholdet
SELECT Bruges til at returnere bestemte rรฆkkedata i en tabelform
OPDATER ร†ndrer data i en eller flere rรฆkker i en tabel

Teradata-produktpakke og implementeringsmuligheder

Disse kommandoer opfรธrer sig identisk, uanset hvilken udgave der kรธrer under, fordi Teradata leverer รฉn motor pรฅ tvรฆrs af flere leveringsmodeller.

  • Teradata Vantage: Kerneplatformen, der kombinerer SQL-motoren, arbejdsbelastningsstyring og forbindelser til objektlagring.
  • VantageCloud Enterprise: En administreret implementering pรฅ AWS, Azure eller Google Cloud for lagre, der flytter ejet hardware.
  • VantageCloud-sรธen: En cloud-native, objektlagring-fรธrst-udgave med uafhรฆngige beregningsklynger til elastiske arbejdsbelastninger.
  • ClearScape Analytics: Det databaseinterne lag, der kรธrer maskinlรฆring og tidsseriefunktioner ved siden af โ€‹โ€‹dataene.
  • On-premises IntelliFlex: Specialbygget hardware til regulerede arbejdsbelastninger, der skal forblive i et privat datacenter.

Fordi รฉn SQL-sรฆtning kรธrer uรฆndret pรฅ tvรฆrs af disse udgaver, er hybride ejendomme almindelige.

Anvendelser af Teradata-databasen

Fรธlgende er de populรฆre Teradata-applikationer:

  • Kundedatahรฅndtering: Hjรฆlper med at opretholde langvarige relationer med kunder.
  • Master Data Management: Hjรฆlper med at udvikle et miljรธ, hvor masterdata kan bruges, synkroniseres og lagres.
  • ร˜konomi og resultatstyring: Hjรฆlper organisationen med at forbedre hastigheden og kvaliteten af โ€‹โ€‹finansiel rapportering. Det reducerer omkostningerne til finansieringsinfrastruktur og styrer virksomhedens ydeevne proaktivt.
  • Supply Chain Management: Forbedre forsyningskรฆdedriften, som hjรฆlper til forbedret kundeservice, reducerede cyklustider og lavere varebeholdninger.
  • Efterspรธrgselskรฆdestyring: Hjรฆlper med at รธge kundeserviceniveauer og salg. Det hjรฆlper ogsรฅ virksomheder med at forudsige efterspรธrgslen efter deres butiksvarer nรธjagtigt.

Nรฆste i denne Teradata for begyndere tutorial, vil vi lรฆre om forskellen mellem Teradata og andre RDBMS.

Forskellen mellem Teradata og andre RDBMS

Parameter Teradata RDBMS
Architectures Fรธlger Shared Nothing Architecture. Delte alt og tillader ressourcestrid.
Processer MIPS [Millioner af instruktioner/sek.] KIPS [Tusindvis af instruktioner/sek]
Indexes Bedre distribution og genfinding Tilbyder kun FASI Retrieval
parallelitet Understรธtter ubetinget parallelisme. Parallelisme er betinget og uforudsigelig
Bulk belastning Teradata tillader bulk load. Tillader kun begrรฆnset bulkbelastning.
Skalerbarhed Lineรฆr skalerbarhed med en hรฆldning pรฅ รฉn Skalerbarhed med faldende afkast
Database buffer En enkelt databasebuffer brugt af alle UoP'er (en parallelitetsenhed). Et enkelt datalager, der tilgรฅs af alle UoP'er. Query Controller sender funktioner til UoP'er, der ejer dataene
butikker Den lagrer TERABYTE [Billioner af rรฆkker] GIGABYTE [Millioner af rรฆkker]

Rรฆkken "shared-nothing" ovenfor afhรฆnger af den behandlingsmodel, der sammenlignes derefter.

MPP vs. SMP

MPP SMP
MPP โ€“ Massively Parallel Processing. Det er computersystem, som er knyttet til mange uafhรฆngige aritmetiske enheder eller hele mikroprocessorer, der kรธrer parallelt. Symmetrisk multi-behandling. I et SMP-behandlingssystem deler CPU'erne den samme hukommelse, og som et resultat kan kode, der kรธrer i et system, pรฅvirke den hukommelse, der bruges af et andet.
Databaser kan udvides ved at tilfรธje nye CPU'er. SMP-databaser bruger generelt รฉn CPU til at udfรธre databasesรธgninger.
I et MPP-miljรธ forbedres ydeevnen, fordi ingen ressourcer skal deles mellem fysiske computere. Arbejdsbyrden for et paralleljob er fordelt pรฅ tvรฆrs af processorerne i systemet.
Ydeevnen af โ€‹โ€‹et massivt parallelt behandlingssystem er lineรฆrt. Det vil dog stige i forhold til antallet af noder. SMP-databaser kan kรธre pรฅ flere servere. Vil dog dele en anden ressource.

Ofte Stillede Spรธrgsmรฅl

Det primรฆre indeks bestemmer, hvilken AMP der gemmer hver rรฆkke. Teradata hasher indekskolonnen og router rรฆkken til den matchende AMP, sรฅ et velvalgt indeks spreder data jรฆvnt og undgรฅr skรฆvhed.

Teradata Studio er den nuvรฆrende grafiske klient, der erstatter den รฆldre SQL Assistant. BTEQ hรฅndterer scriptet batcharbejde fra en terminal, og standard ODBC- eller JDBC-drivere forbinder tredjepartsdata. BI vรฆrktรธjer.

Produktionsplatformen er kommercielt licenseret, men Teradata tilbyder et gratis ClearScape Analytics Experience-miljรธ og prรธveversioner for udviklere, som er nok til at รธve SQL, indeksering og forespรธrgselsplanlรฆgning.

ClearScape Analytics kรธrer maskinlรฆring, scoring og tidsseriefunktioner som SQL direkte pรฅ gemte rรฆkker.ping Modeller ved siden af โ€‹โ€‹dataene fjerner eksporttrinnene og lader forudsigelser bruge hele lageret i stedet for en stikprรธve.

AI-assistenter udarbejder forespรธrgsler og foreslรฅr รฆndringer i indeks eller join, men optimeringsstatistikken og forretningsreglerne krรฆver stadig menneskelig gennemgang. Behandl genereret SQL som et startkladde, aldrig som en produktionsudgivelse.

Opsummer dette indlรฆg med: