Teradata-Tutorial: Datenbank Architektur & Typen

โšก Intelligente Zusammenfassung

Teradata SQL lรคuft auf einer massiv parallelen relationalen Datenbank, die fรผr Data Warehousing im UnternehmensmaรŸstab entwickelt wurde. Diese Seite erlรคutert die Parsing-Engine, die BYNET- und AMP-Architektur, die unterstรผtzten DDL-, DCL- und DML-Befehlssรคtze sowie praktische Geschรคftsanwendungen.

  • ๏ธ Kerndefinition: Teradata ist ein kommerzielles relationales Datenbankmanagementsystem, das auf massiv paralleler Verarbeitung basiert, keine Open-Source-Engine.
  • โš™๏ธ Drei Komponenten: Die Parsing-Engine plant Abfragen, BYNET verschiebt Zeilen, und die Zugriffsmodulprozessoren durchsuchen ihre eigenen Festplatten.
  • ๐Ÿ“ˆ Lineare Skalierbarkeit: Durch das Hinzufรผgen von Knoten wird der Durchsatz proportional erhรถht, da ein Shared-Nothing-Design Konflikte zwischen den Parallelisierungseinheiten beseitigt.
  • ๐Ÿงพ Befehlsabdeckung: DDL erstellt Objekte, DCL erteilt Berechtigungen und DML wรคhlt, aktualisiert und lรถscht Zeilen.
  • โ˜๏ธ Moderne Plattform: Vantage, VantageCloud und ClearScape Analytics erweitern die Engine um Cloud- und In-Database-Machine-Learning.

Teradata-Tutorial

Was ist Teradata?

Teradata ist ein kommerzielles relationales Datenbankmanagementsystem fรผr die Entwicklungping GroรŸ angelegte Data-Warehouse-Anwendungen. Dieses Tool unterstรผtzt die gleichzeitige Ausfรผhrung mehrerer Data-Warehouse-Operationen mithilfe des Konzepts der Parallelverarbeitung. Teradata ist ein massiv paralleles Verarbeitungssystem, das Unix/Linux unterstรผtzt.Windows Serverplattformen.

Teradata-Software wird von der Teradata Corporation entwickelt, einem amerikanischen IT-Unternehmen. Es ist ein Anbieter von Analysedatenplattformen, Anwendungen und anderen damit verbundenen Dienstleistungen. Das Unternehmen entwickelt ein Produkt, um Daten aus verschiedenen Quellen zu konsolidieren und fรผr die Analyse verfรผgbar zu machen.

Warum Teradata?

  • Teradata bietet ein umfassendes Servicepaket mit Schwerpunkt auf Data Warehousing
  • Das System basiert auf einer offenen Architektur. Wenn also schnellere Gerรคte verfรผgbar werden, kรถnnen diese in die bereits vorhandene Architektur integriert werden.
  • Teradata unterstรผtzt mehr als 50 Petabyte an Daten.
  • Einzelbetriebsansicht fรผr ein groรŸes Teradata-Mehrknotensystem mit Service Workstation
  • Kompatibel mit einer Vielzahl von BI-Tool um Daten abzurufen.
  • Es kann als zentraler Kontrollpunkt fรผr den DBA fungieren, um das zu verwalten Datenbank.
  • Hohe Leistung, vielfรคltige Abfragen, datenbankinterne Analysen und ausgefeiltes Workload-Management
  • Mit Teradata kรถnnen Sie dieselben Daten fรผr mehrere Bereitstellungsoptionen abrufen

Diese Vorteile wurden รผber vier Jahrzehnte aufgebaut, wie die nachstehende Zeitleiste zeigt.

Geschichte von Teradata

Teradata wurde 1979 von Forschern des Caltech in Zusammenarbeit mit der Citibank gegrรผndet. 1991 wurde das Unternehmen von der NCR Corporation รผbernommen und im Oktober 2007 als eigenstรคndige Aktiengesellschaft ausgegliedert. Michael Koehler wurde der erste CEO. Der Hauptsitz des Unternehmens befindet sich in San Diego, und seit 2020 wird es von Prรคsident und CEO Steve McMillan geleitet.

Meilensteine โ€‹โ€‹der Teradata Corporation:

  • 1979 โ€“ Teradata wurde gegrรผndet
  • 1984 โ€“ Verรถffentlichung des ersten Datenbankcomputers DBC/1012
  • 1986 โ€“ Das Fortune-Magazin erklรคrt Teradata zum โ€žProdukt des Jahresโ€œ
  • 1991 โ€“ Die NCR Corporation erwirbt Teradata.
  • 1999 โ€“ GrรถรŸte mit Teradata erstellte Datenbank mit 130 Terabyte
  • 2002 โ€“ Verรถffentlichung der Teradata V2R5-Version mit Komprimierung und primรคrer Partitionierung
  • 2006 โ€“ Einfรผhrung der Teradata Master Data Management-Lรถsung
  • 2007 โ€“ Teradata trennt sich von NCR und wird als unabhรคngiges Unternehmen an der Bรถrse notiert.
  • 2008 โ€“ Teradata 13.0 mit Active Data Warehousing verรถffentlicht
  • 2011 โ€“ รœbernahme von Teradata Aster und Einstieg in den Bereich Advanced Analytics
  • 2012 โ€“ Teradata 14.0 eingefรผhrt
  • 2014 โ€“ Teradata 15.0 eingefรผhrt
  • 2015 โ€“ Teradata kauft die App-Marketing-Plattform Appoxee
  • 2017 โ€“ Teradata รผbernimmt StackIQ aus San Diego.
  • 2018 โ€“ Teradata Vantage wird als einheitliche Analyseplattform eingefรผhrt.
  • 2022 โ€“ VantageCloud Lake fรผr Cloud-native Analysen verรถffentlicht
  • 2023 โ€“ ClearScape Analytics integriert KI und maschinelles Lernen direkt in die Datenbank โ€“ in groรŸem Umfang
  • 2024 โ€“ Fรผgt Unterstรผtzung fรผr das offene Tabellenformat fรผr Apache Iceberg hinzu und Delta Lake und verรถffentlicht Teradata AI Unlimited auf AWS und Azure Markt
  • 2025 โ€“ Einfรผhrung des Enterprise Vector Store, eines Open-Source-MCP-Servers, und des AgentBuilder zur Unterstรผtzung agentenbasierter KI-Workloads
  • 2026 โ€“ Die Teradata Autonomous Knowledge Platform wurde im Mai angekรผndigt und wird im Juli allgemein fรผr Cloud-, On-Premises- und Hybrid-Bereitstellungen verfรผgbar sein.

Als Nรคchstes lernen wir in diesem Teradata-Tutorial die Funktionen von Teradata kennen.

Funktionen von Teradata SQL

Teradata bietet die folgenden leistungsstarken Funktionen:

  • Lineare Skalierbarkeit: Bietet lineare Skalierbarkeit bei der Verarbeitung groรŸer Datenmengen durch Hinzufรผgen von Knoten, um die Leistung des Systems zu steigern.
  • Unbegrenzte Parallelitรคt: Teradata basiert auf MPP (Massively Parallel Processing). Archi(Textur). Es ist also von Anfang an auf Parallelitรคt ausgelegt. Es kann eine groรŸe Aufgabe in kleinere Aufgaben aufteilen und diese parallel ausfรผhren
  • Ausgereifter Optimierer: Teradata Optimizer kann bis zu 64 Verknรผpfungen in einer Abfrage verarbeiten.
  • Niedrige Gesamtbetriebskosten: Teradata zeichnet sich durch niedrige Gesamtbetriebskosten aus. Es ist einfach einzurichten, zu warten und zu administrieren.
  • Dienstprogramme laden und entladen: Teradata bietet Lade- und Entladeprogramme zum Verschieben von Daten in das/aus dem Teradata-System.
  • Konnektivitรคt: Dieses MPP-System kann mit kanalgebundenen Systemen wie einem Mainframe oder netzwerkgebundenen Systemen verbunden werden.
  • SQL: Teradata unterstรผtzt SQL um mit den in Tabellen gespeicherten Daten zu interagieren. Es bietet seine Erweiterung.
  • Robuste Dienstprogramme: Teradata bietet robuste Dienstprogramme zum Importieren/Exportieren von Daten aus/in Teradata-Systeme wie FastExport, FastLoad, MultiLoad und TPT.
  • Automatische Verteilung: Teradata kann die Daten automatisch und ohne manuellen Eingriff auf die Festplatten verteilen.

Als nรคchstes lernen wir in diesem Teradata SQL-Tutorial etwas รผber Teradata ArchiStruktur.

Teradata Architektur

Die Teradata-Architektur ist eine Massively Parallel Processing ArchiStruktur.

Drei wichtige Komponenten von Teradata sind:

  • Parsing-Engine
  • BYNET
  • Zugriffsmodulprozessoren (AMPs)

Teradatenspeicher Architecture-Datenbank ArchiStrukturdiagramm:

Teradata Architektur
Teradata ArchiStrukturdiagramm

Das obige Diagramm tracEs handelt sich um eine Anfrage der Parsing-Engine, die รผber BYNET an die AMPs (Verbundprozessoren) weitergeleitet wird, denen die Datentrรคger gehรถren. Die beiden folgenden Unterabschnitte folgen diesem Pfad in beide Richtungen.

Teradatenspeicher Architektur

Parsing-Engine:

Die Parsing Engine analysiert die Abfragen und bereitet den Ausfรผhrungsplan vor. Sie verwaltet Sitzungen fรผr Benutzer. Sie optimiert und sendet eine Anfrage an die Benutzer.

Wenn der Client also Abfragen zum Einfรผgen von Datensรคtzen ausfรผhrt, sendet die Parsing Engine die Datensรคtze an die Message Passing-Schicht. Message Passing Layer oder BYNET ist eine Software- und Hardwarekomponente. Es bietet Netzwerkfรคhigkeit. AuรŸerdem werden die Datensรคtze abgerufen und die Zeile an den Ziel-AMP gesendet.

AMPERE:

AMP steht fรผr Access Module Processor. Es speichert Datensรคtze auf diesen Festplatten. AMP fรผhrt folgende Aktivitรคten durch:

  • Verwaltet einen Teil der Datenbank
  • Verwaltet einen Teil jeder Tabelle
  • Fรผhren Sie alle mit der Generierung des Ergebnissatzes verbundenen Aufgaben aus, z. B. Sortieren, Aggregation und Verknรผpfung
  • Fรผhren Sie die Sperr- und Speicherplatzverwaltung durch

Teradata-Abruf Architektur

Wenn der Client Abfragen zum Abrufen von Datensรคtzen ausfรผhrt, sendet die Parsing-Engine eine Anfrage an BYNET. AnschlieรŸend sendet BYNET die Abrufanfrage an die entsprechenden AMPs.

AMPs durchsuchen parallel ihre Festplatten, erkennen die erforderlichen Datensรคtze und senden sie an BYNET. BYNET sendet die Datensรคtze an die Parsing Engine, die wiederum an den Client gesendet wird.

Als nรคchstes lernen wir in diesem Teradata-Datenbank-Tutorial etwas รผber Teradata-SQL-Befehle.

Arten von Teradata-SQL-Befehlen

Die Teradata-Datenbank unterstรผtzt die folgenden grundlegenden SQL-Befehle:

  1. DDL-Befehle (Data Definition Language).
  2. DCL-Befehle (Data Control Language).
  3. DML-Befehle (Data Manipulation Language).

Befehle der Datendefinitionssprache

COMMAND Beschreibung
CREATE Erstellt eine neue Datenbank, Tabelle, einen neuen Benutzer usw.
DROP Entfernt eine neue Datenbank, Tabelle, einen neuen Benutzer usw.
ALTER ร„ndert eine Tabelle, Spalte, einen Trigger usw.
ร„NDERN ร„ndert eine Datenbank oder Benutzerdefinition
UMBENENNEN ร„ndert Namen von Tabellen, Ansichten, Makros usw.

Befehle der Datensteuerungssprache

COMMAND Beschreibung
GEWร„HRUNG/WIDERRUFEN Wird verwendet, um die Berechtigungen eines Benutzers fรผr ein Objekt zu steuern
ANMELDUNG GEWร„HREN/ANMELDUNG WIDERRUFEN Wird zur Steuerung der Anmeldeberechtigungen fรผr einen Host oder eine Hostgruppe verwendet
GEBEN Wird verwendet, um ein Datenbankobjekt einem anderen Datenbankobjekt zuzuweisen

Teradata-Datenbank SQL-Befehle (Datenmanipulationssprache)

COMMAND Beschreibung
Lร–SCHEN Entfernt eine Zeile aus der Tabelle
ECHO Wird verwendet, um eine Zeichenfolge oder einen Befehl an den Client zurรผckzugeben
KONTROLLPUNKT Definiert einen Wiederherstellungspunkt im Journal, der spรคter zum Wiederherstellen des Tabelleninhalts verwendet werden kann
SELECT Wird verwendet, um bestimmte Zeilendaten in Tabellenform zurรผckzugeben
AKTUALISIEREN ร„ndert Daten in einer oder mehreren Zeilen einer Tabelle

Teradata-Produktpalette und Bereitstellungsoptionen

Diese Befehle verhalten sich unabhรคngig von der zugrunde liegenden Edition identisch, da Teradata eine einzige Engine fรผr verschiedene Bereitstellungsmodelle ausliefert.

  • Teradata Vantage: Die Kernplattform kombiniert die SQL-Engine, das Workload-Management und Konnektoren zur Objektspeicherung.
  • VantageCloud Enterprise: Eine verwaltete Bereitstellung auf AWS, Azureden Google Cloud fรผr Lagerhรคuser, die ihre eigene Hardware verkaufen.
  • VantageCloud Lake: Eine Cloud-native Edition mit Fokus auf Objektspeicherung und unabhรคngigen Rechenclustern fรผr elastische Workloads.
  • ClearScape Analytics: Die In-Database-Schicht, die Machine-Learning- und Zeitreihenfunktionen parallel zu den Daten ausfรผhrt.
  • IntelliFlex vor Ort: Speziell entwickelte Hardware fรผr regulierte Arbeitslasten, die in einem privaten Rechenzentrum verbleiben mรผssen.

Da eine SQL-Anweisung in all diesen Editionen unverรคndert ausgefรผhrt wird, sind hybride Systemumgebungen weit verbreitet.

Anwendungen der Teradata-Datenbank

Im Folgenden sind die beliebten Teradata-Anwendungen aufgefรผhrt:

  • Kundendatenmanagement: Trรคgt dazu bei, langfristige Kundenbeziehungen aufrechtzuerhalten.
  • Stammdatenverwaltung: Hilft dabei, eine Umgebung zu schaffen, in der Stammdaten genutzt, synchronisiert und gespeichert werden kรถnnen.
  • Finanz- und Leistungsmanagement: Hilft Unternehmen dabei, die Geschwindigkeit und Qualitรคt der Finanzberichterstattung zu verbessern. Es reduziert die Kosten fรผr die Finanzinfrastruktur und verwaltet die Unternehmensleistung proaktiv.
  • Leitung der Lieferkette: Verbessern Sie die Ablรคufe in der Lieferkette, um den Kundenservice zu verbessern, Durchlaufzeiten zu verkรผrzen und die Lagerbestรคnde zu senken.
  • Nachfragekettenmanagement: Trรคgt dazu bei, den Kundenservice und den Umsatz zu steigern. Es hilft Unternehmen auch dabei, die Nachfrage nach ihren Ladenartikeln genau vorherzusagen.

Als nรคchstes lernen wir in diesem Teradata-Tutorial fรผr Anfรคnger den Unterschied zwischen Teradata und anderen kennen RDBMS.

Unterschied zwischen Teradata und anderen RDBMS

Parameter Teradata RDBMS
Architekturen Folgt Shared Nothing ArchiStruktur. Alles geteilt und Ressourcenkonflikte zugelassen.
Prozesse MIPS [Millionen Anweisungen/Sek.] KIPS [Tausende von Anweisungen/Sekunde]
Indizes Bessere Verteilung und Abruf Bietet nur FASI-Abruf
Parallelitรคt Unterstรผtzt bedingungslose Parallelitรคt. Parallelitรคt ist bedingt und unvorhersehbar
GroรŸe Ladung Teradata ermรถglicht Massenladen. Ermรถglicht nur begrenztes Massenladen.
Skalierbarkeit Lineare Skalierbarkeit mit einer Steigung von eins Skalierbarkeit bei sinkenden Ertrรคgen
Datenbankpuffer Ein einziger Datenbankpuffer, der von allen UoPs (einer Einheit fรผr Parallelverarbeitung) genutzt wird. Ein einziger Datenspeicher, auf den alle UoPs zugreifen. Query Controller sendet Funktionen an UoPs, die Eigentรผmer der Daten sind
Boutiquen Es speichert Terabytes [BillIonen von Reihen] GIGABYTES [Millionen von Zeilen]

Die oben genannte Zeile, in der es um gemeinsames Nichts geht, hรคngt vom als nรคchstes verglichenen Verarbeitungsmodell ab.

MPP vs. SMP

MPP SMP
MPP โ€“ Massively Parallel Processing. Es handelt sich um ein Computersystem, das mit vielen unabhรคngigen Recheneinheiten oder ganzen Mikroprozessoren verbunden ist, die parallel laufen. Symmetrisches Multi-Processing. In einem SMP-Verarbeitungssystem teilen sich die CPUs denselben Speicher. Daher kann sich Code, der in einem System ausgefรผhrt wird, auf den von einem anderen System verwendeten Speicher auswirken.
Datenbanken kรถnnen durch das Hinzufรผgen neuer CPUs erweitert werden. SMP-Datenbanken verwenden im Allgemeinen eine CPU, um Datenbanksuchen durchzufรผhren.
In einer MPP-Umgebung wird die Leistung verbessert, da keine Ressourcen zwischen physischen Computern geteilt werden mรผssen. Die Arbeitslast fรผr einen parallelen Job wird auf die Prozessoren im System verteilt.
Die Leistung eines Massive-Parallelverarbeitungssystems ist linear. Sie wird jedoch proportional zur Anzahl der Knoten zunehmen. SMP-Datenbanken kรถnnen auf mehreren Servern laufen. Allerdings wird eine andere Ressource geteilt.

Hรคufig gestellte Fragen

Der Primรคrindex bestimmt, welcher AMP (Application Programming Processor) jede Zeile speichert. Teradata berechnet einen Hashwert der Indexspalte und leitet die Zeile an den entsprechenden AMP weiter. Ein gut gewรคhlter Index sorgt somit fรผr eine gleichmรครŸige Datenverteilung und vermeidet Datenverzerrungen.

Teradata Studio ist der aktuelle grafische Client und ersetzt den รคlteren SQL Assistant. BTEQ verarbeitet skriptgesteuerte Batch-Arbeiten รผber das Terminal, und Standard-ODBC- oder JDBC-Treiber verbinden Drittanbieter-Systeme. BI-Tools.

Die Produktionsplattform wird kommerziell lizenziert, aber Teradata bietet eine kostenlose ClearScape Analytics Experience-Umgebung und Entwicklertestversionen an, die ausreichen, um SQL, Indizierung und Abfrageplanung zu รผben.

ClearScape Analytics fรผhrt Funktionen fรผr maschinelles Lernen, Scoring und Zeitreihenanalyse als SQL direkt auf gespeicherten Zeilen aus. Keeping Modelle neben den Daten eliminieren Exportschritte und ermรถglichen es, Vorhersagen auf Basis des gesamten Data Warehouse und nicht nur einer Stichprobe durchzufรผhren.

KI-Assistenten erstellen Abfragen und schlagen Index- oder Join-ร„nderungen vor, die Optimierungsstatistiken und Geschรคftsregeln mรผssen jedoch weiterhin von einem Menschen geprรผft werden. Behandeln Sie generiertes SQL als ersten Entwurf, niemals als Produktionsversion.

Fassen Sie diesen Beitrag mit folgenden Worten zusammen: