Samouczek Teradata: Baza danych Architektura i typy

⚡ Inteligentne podsumowanie

Teradata SQL działa w oparciu o masowo równoległą relacyjną bazę danych, stworzoną do magazynowania danych w skali korporacyjnej. Na tej stronie opisano architekturę Parsing Engine, BYNET i AMP, obsługiwane zestawy poleceń DDL, DCL i DML oraz praktyczne zastosowania biznesowe.

  • 🏛️. Definicja podstawowa: Teradata to komercyjny system zarządzania relacyjnymi bazami danych oparty na technologii Massively Parallel Processing, a nie na silniku open source.
  • ⚙️ Trzy składniki: Silnik analizy składniowej planuje zapytania, BYNET przenosi wiersze, a procesory modułu dostępu przeszukują własne dyski.
  • 📈 Skalowalność liniowa: Dodawanie węzłów proporcjonalnie zwiększa przepustowość, ponieważ konstrukcja typu „nic współdzielonego” eliminuje rywalizację między jednostkami paralelizmu.
  • 🧾 Zasięg dowodzenia: DDL tworzy obiekty, DCL przyznaje uprawnienia, a DML wybiera, aktualizuje i usuwa wiersze.
  • ☁️. Nowoczesna platforma: Vantage, VantageCloud i ClearScape Analytics rozszerzają możliwości silnika o uczenie maszynowe w chmurze i bazie danych.

Poradnik Teradaty

Co to jest Teradata?

Teradane jest komercyjnym relacyjnym systemem zarządzania bazą danych dla deweloperówping Aplikacje do magazynowania danych na dużą skalę. To narzędzie zapewnia obsługę wielu operacji magazynowania danych jednocześnie, wykorzystując koncepcję paralelizmu. Teradata to masowo równoległy system przetwarzania, który obsługuje systemy Unix/Linux/Windows platformy serwerowe.

Oprogramowanie Teradata zostało opracowane przez Teradata Corporation, amerykańską firmę informatyczną. Jest dostawcą platform danych analitycznych, aplikacji i innych powiązanych usług. Firma rozwija produkt pozwalający konsolidować dane z różnych źródeł i udostępniać je do analizy.

Dlaczego Teradata?

  • Teradata oferuje pełny pakiet usług, który koncentruje się na Magazyn danych
  • System jest zbudowany na otwartej architekturze. Więc kiedykolwiek jakieś szybsze urządzenia są dostępne, można je włączyć do już zbudowanej architektury.
  • Teradata obsługuje ponad 50 petabajtów danych.
  • Pojedynczy widok operacyjny dla dużego systemu wielowęzłowego Teradata przy użyciu Service Workstation
  • Kompatybilny z szeroką gamą Narzędzie BI do pobrania danych.
  • Może działać jako pojedynczy punkt kontroli dla administratora danych w celu zarządzania Baza danych.
  • Wysoka wydajność, różnorodne zapytania, analityka w bazie danych i zaawansowane zarządzanie obciążeniem
  • Teradata umożliwia uzyskanie tych samych danych przy wielu opcjach wdrożenia

Jak pokazuje poniższa oś czasu, zalety te budowano przez cztery dekady.

Historia Teradaty

Firma Teradata została założona w 1979 roku przez naukowców z Caltech współpracujących z Citibank. W 1991 roku została przejęta przez NCR Corporation, a w październiku 2007 roku Teradata została wydzielona jako niezależna spółka publiczna, a jej pierwszym dyrektorem generalnym został Michael Koehler. Siedziba firmy znajduje się w San Diego, a od 2020 roku jej prezesem i dyrektorem generalnym jest Steve McMillan.

Kamienie milowe Teradata Corporation:

  • 1979 – zarejestrowano firmę Teradata
  • 1984 – Wypuszczenie pierwszego komputera bazodanowego DBC/1012
  • 1986 – Magazyn Fortune uznał Teradata za „Produkt Roku”
  • 1991 – NCR Corporation przejmuje Teradata
  • 1999 – Największa baza danych zbudowana przy użyciu Teradaty o wielkości 130 terabajtów
  • 2002 – wydanie wersji Teradata V2R5 z kompresją i partycją podstawową
  • 2006 – Wprowadzenie rozwiązania Teradata Master Data Management
  • 2007 – Teradata oddziela się od NCR i jest notowana jako niezależna firma
  • 2008 – wypuszczenie Teradata 13.0 z Active Data Warehousing
  • 2011 – nabywa Teradata Aster i zagłębia się w przestrzeń Advanced Analytics
  • 2012 – wprowadzenie Teradata 14.0
  • 2014 – wprowadzenie Teradata 15.0
  • 2015 – Teradata kupuje platformę do marketingu aplikacji Appoxee
  • 2017 – Teradata przejmuje firmę StackIQ z San Diego
  • 2018 – Wprowadzenie na rynek Teradata Vantage jako ujednoliconej platformy analitycznej
  • 2022 – udostępniono platformę VantageCloud Lake do analityki natywnej w chmurze
  • 2023 – ClearScape Analytics dodaje sztuczną inteligencję i uczenie maszynowe w bazie danych na dużą skalę
  • 2024 – Dodano obsługę otwartego formatu tabeli dla Apache Iceberg i Delta Lake i udostępnia Teradata AI Unlimited na platformie AWS i Azure targowiskach
  • 2025 – Uruchomienie Enterprise Vector Store, serwera MCP z otwartym kodem źródłowym i programu AgentBuilder w celu obsługi obciążeń agentów AI
  • 2026 – Platforma autonomicznej wiedzy Teradata została ogłoszona w maju i będzie ogólnie dostępna w lipcu w środowiskach chmurowych, lokalnych i hybrydowych

W dalszej części tego samouczka Teradata dowiemy się o funkcjach Teradata.

Funkcje Teradata SQL

Teradata oferuje następujące zaawansowane funkcje:

  • Skalowalność liniowa: Oferuje skalowalność liniową w przypadku dużych ilości danych poprzez dodanie węzłów w celu zwiększenia wydajności systemu.
  • Nieograniczona równoległość: Teradata opiera się na MPP (Massively Parallel Processing Architektura). Dlatego od początku zaprojektowano go równolegle. Potrafi podzielić duże zadanie na mniejsze zadania i wykonywać je równolegle
  • Dojrzały optymalizator: Teradata Optimizer może obsłużyć do 64 złączeń w zapytaniu.
  • Niski całkowity koszt posiadania: Teradata charakteryzuje się niskim całkowitym kosztem posiadania. Jest łatwa w konfiguracji, utrzymaniu i administrowaniu.
  • Załaduj i rozładuj narzędzia: Teradata zapewnia narzędzia do ładowania i rozładowywania umożliwiające przenoszenie danych do/z systemu Teradata.
  • Łączność: Ten system MPP można podłączyć do systemów podłączonych do kanału, takich jak komputery typu mainframe lub systemy podłączone do sieci.
  • SQL: Obsługuje Teradata SQL do interakcji z danymi przechowywanymi w tabelach. Zapewnia jego rozszerzenie.
  • Solidne narzędzia: Teradata zapewnia niezawodne narzędzia do importowania/eksportowania danych z/do systemów Teradata, takich jak FastExport, FastLoad, MultiLoad i TPT.
  • Automatyczna dystrybucja: Teradane może automatycznie dystrybuować dane na dyski, bez konieczności ręcznej interwencji.

W dalszej części tego samouczka Teradata SQL dowiemy się o Teradata Architektura.

Teradane Architektura

Architektura Teradata to masowo równoległa architektura przetwarzania Architektura.

Trzy ważne komponenty Teradata to:

  • Silnik analizujący
  • BYNET
  • Procesory modułów dostępowych (AMP)

Pamięć Teradanych ArchiBaza danych technologii Archischemat budowy:

Teradane Architektura
Teradane ArchiSchemat tecture

Powyższy diagram tracTo żądanie z Parsing Engine, poprzez BYNET, aż do AMP-ów, które są właścicielami dysków. Dwie poniższe podsekcje podążają tą ścieżką w każdym kierunku.

Pamięć Teradanych Architektura

Silnik analizujący:

Parsing Engine analizuje zapytania i przygotowuje plan wykonania. Zarządza sesjami dla użytkowników. Optymalizuje i wysyła żądanie do użytkowników.

Tak więc, gdy klient wykonuje zapytania o wstawienie rekordów, silnik analizujący wysyła rekordy do warstwy przekazywania komunikatów. Warstwa przekazująca komunikaty, czyli BYNET, to komponent oprogramowania i sprzętu. Oferuje możliwości pracy w sieci. Pobiera również rekordy i wysyła wiersz do docelowego AMP.

AMP:

AMP oznacza Access Module Processor. Przechowuje rekordy na tych dyskach. AMP wykonuje następujące czynności:

  • Zarządza częścią bazy danych
  • Zarządza częścią każdej tabeli
  • Wykonuj wszystkie zadania związane z generowaniem zestawu wyników, takie jak sortowanie, agregacja i łączenie
  • Zarządzaj blokadami i przestrzenią

Odzyskiwanie Teradanych Architektura

Gdy klient uruchamia zapytania w celu pobrania rekordów, aparat analizujący wysyła żądanie do BYNET. Następnie BYNET wysyła żądanie pobrania do odpowiednich AMP.

AMP przeszukują swoje dyski równolegle, rozpoznają wymagane rekordy i wysyłają je do BYNET. BYNET wysyła rekordy do silnika analizującego, który z kolei zostanie wysłany do klienta.

W dalszej części tego samouczka dotyczącego bazy danych Teradata dowiemy się o poleceniach Teradata SQL.

Typy poleceń SQL Teradata

Baza danych Teradata obsługuje następujące podstawowe polecenia SQL:

  1. Polecenia języka definicji danych (DDL).
  2. Polecenia języka kontroli danych (DCL).
  3. Polecenia języka manipulacji danymi (DML).

Polecenia języka definicji danych

COMMAND OPIS
TWORZENIE Tworzy nową bazę danych, tabelę, użytkownika itp.
DROP Usuwa nową bazę danych, tabelę, użytkownika itp.
ZMIANA Zmienia tabelę, kolumnę, wyzwalacz itp.
MODYFIKOWAĆ Zmienia bazę danych lub definicję użytkownika
PRZEMIANOWAĆ Zmienia nazwy tabel, widoków, makr itp.

Polecenia języka kontroli danych

COMMAND OPIS
PRZYZNAJ/ODWOŁAJ Służy do kontrolowania uprawnień użytkownika do obiektu
PRZYZNAJ LOGOWANIE/ODWOŁAJ LOGOWANIE Służy do kontrolowania uprawnień logowania do hosta lub grupy hostów
DAĆ Służy do przekazywania obiektu bazy danych innemu obiektowi bazy danych

Polecenia języka manipulacji danymi SQL w bazie danych Teradata

COMMAND OPIS
DELETE Usuwa wiersz z tabeli
ECHO Służy do wysyłania echa ciągu lub polecenia do klienta
PUNKT KONTROLNY Definiuje punkt odzyskiwania w dzienniku, który można później wykorzystać do przywrócenia zawartości tabeli
SELECT Służy do zwracania określonych danych wiersza w formie tabeli
Aktualizacja Modyfikuje dane w jednym lub większej liczbie wierszy tabeli

Pakiet produktów Teradata i opcje wdrożenia

Polecenia te zachowują się identycznie bez względu na wersję, w której działa oprogramowanie, ponieważ firma Teradata dostarcza jeden silnik w ramach kilku modeli dostaw.

  • Teradata Vantage: Podstawowa platforma łącząca silnik SQL, zarządzanie obciążeniem i łączniki do obiektowej pamięci masowej.
  • VantageCloud Enterprise: Zarządzane wdrożenie w AWS, Azurelub Google Cloud dla magazynów, do których trafia sprzęt będący własnością firmy.
  • Jezioro VantageCloud: Wydanie pierwsze natywne dla chmury, oferujące pamięć masową obiektów z niezależnymi klastrami obliczeniowymi do obsługi elastycznych obciążeń.
  • ClearScape Analytics: Warstwa bazy danych, w której oprócz danych uruchamiane są funkcje uczenia maszynowego i szeregów czasowych.
  • IntelliFlex lokalny: Sprzęt specjalnie zaprojektowany do obsługi regulowanych obciążeń, który musi znajdować się w prywatnym centrum danych.

Ponieważ we wszystkich edycjach jedno polecenie SQL jest niezmienne, powszechne jest stosowanie środowisk hybrydowych.

Zastosowania bazy danych Teradata

Poniżej przedstawiono popularne aplikacje Teradata:

  • Zarządzanie danymi klientów: Pomaga utrzymać długotrwałe relacje z klientami.
  • Zarządzanie danymi podstawowymi: Pomaga stworzyć środowisko, w którym dane podstawowe mogą być wykorzystywane, synchronizowane i przechowywane.
  • Zarządzanie finansami i wynikami: Pomaga organizacji poprawić szybkość i jakość raportowania finansowego. Zmniejsza koszty infrastruktury finansowej i aktywnie zarządza wydajnością przedsiębiorstwa.
  • Zarządzanie łańcuchem dostaw: Usprawnij działanie łańcucha dostaw, co przełoży się na lepszą obsługę klienta, skrócenie czasu cykli i obniżenie zapasów.
  • Zarządzanie łańcuchem popytu: Pomaga zwiększyć poziom obsługi klienta i sprzedaży. Pomaga także firmom dokładnie przewidzieć popyt na produkty w ich sklepie.

W dalszej części tego samouczka Teradata dla początkujących dowiemy się o różnicy między Teradata a innymi programami RDBMS.

Różnica między Teradata a innymi RDBMS

Parametr Teradane RDBMS
Archistruktury Obserwuje Shared Nothing Architektura. Udostępnij wszystko i umożliwia rywalizację o zasoby.
Procesy MIPS [miliony instrukcji/s] KIPS [tysiące instrukcji/sek.]
Indeksy Lepsza dystrybucja i odzyskiwanie Oferuje tylko pobieranie FASI
Równoległość Obsługuje bezwarunkową równoległość. Równoległość jest warunkowa i nieprzewidywalna
Obciążenie zbiorcze Teradata umożliwia ładowanie masowe. Umożliwia tylko ograniczone obciążenie masowe.
Skalowalność Skalowalność liniowa o nachyleniu jeden Skalowalność przy malejących zyskach
Bufor bazy danych Pojedynczy bufor bazy danych używany przez wszystkie UoP (jednostka paralelizmu). Pojedynczy magazyn danych, do którego dostęp mają wszystkie UoP. Query Controller dostarcza funkcje do UoP, które są właścicielami danych
Sklepy Przechowuje TERABAJTY [Billjony rzędów] GIGABAJTY [Miliony wierszy]

Wiersz powyżej „nic wspólnego” zależy od modelu przetwarzania porównywanego dalej.

MPP kontra SMP

MPP SMP
MPP – masowe przetwarzanie równoległe. Jest to system komputerowy, który jest podłączony do wielu niezależnych jednostek arytmetycznych lub całych mikroprocesorów, które działają równolegle. Symetryczne przetwarzanie wieloprocesowe. W systemie przetwarzającym SMP procesory korzystają z tej samej pamięci, w wyniku czego kod działający w jednym systemie może wpływać na pamięć używaną przez inny.
Bazy danych można rozbudowywać poprzez dodanie nowych procesorów. Bazy danych SMP zazwyczaj korzystają z jednego procesora do wykonywania przeszukiwań baz danych.
W środowisku MPP wydajność jest lepsza, ponieważ żadne zasoby nie muszą być współdzielone pomiędzy komputerami fizycznymi. Obciążenie zadania równoległego jest rozkładane na procesory w systemie.
Wydajność ogromnego systemu przetwarzania równoległego jest liniowa. Będzie jednak wzrastać proporcjonalnie do liczby węzłów. Bazy danych SMP mogą działać na wielu serwerach. Jednak udostępni inny zasób.

FAQ

Indeks główny decyduje, który serwer AMP przechowuje każdy wiersz. Teradata haszuje kolumnę indeksu i kieruje wiersz do pasującego serwera AMP, dzięki czemu dobrze dobrany indeks równomiernie rozprowadza dane i zapobiega przekosom.

Teradata Studio to obecny klient graficzny, zastępujący starszego Asystenta SQL. BTEQ obsługuje skryptowe zadania wsadowe z poziomu terminala, a standardowe sterowniki ODBC lub JDBC łączą się z aplikacjami innych firm. Narzędzia BI.

Platforma produkcyjna jest licencjonowana komercyjnie, ale Teradata oferuje bezpłatne środowisko ClearScape Analytics Experience i wersje próbne dla deweloperów, które wystarczają do ćwiczenia języka SQL, indeksowania i planowania zapytań.

ClearScape Analytics uruchamia funkcje uczenia maszynowego, punktacji i szeregów czasowych jako SQL bezpośrednio na zapisanych wierszach.ping modele obok danych usuwają kroki eksportu i umożliwiają prognozom wykorzystanie całego magazynu zamiast próbki.

Asystenci AI tworzą zapytania i sugerują zmiany indeksów lub sprzężeń, ale statystyki optymalizatora i reguły biznesowe nadal wymagają weryfikacji przez człowieka. Wygenerowany kod SQL należy traktować jako wersję roboczą, a nie jako wersję produkcyjną.

Podsumuj ten post następująco: