Teradata õpetus: andmebaas ArchiTektuur ja tüübid

⚡ Nutikas kokkuvõte

Teradata SQL töötab massiivselt paralleelsel relatsioonandmebaasil, mis on loodud ettevõtte tasemel andmeladudeks. See leht selgitab parsimismootorit, BYNET-i ja AMP-arhitektuuri, toetatud DDL-, DCL- ja DML-käskude komplekte ning praktilisi ärirakendusi.

  • 🏛️ Põhidefinitsioon: Teradata on kaubanduslik relatsioonandmebaaside haldussüsteem, mis on üles ehitatud massiivselt paralleelsele töötlemisele (MASS) ja mitte avatud lähtekoodiga mootor.
  • ⚙️ Kolm komponenti: Parsimismootor planeerib päringuid, BYNET liigutab ridu ja juurdepääsumooduli protsessorid otsivad oma ketastelt.
  • 📈 Lineaarne skaleeritavus: Sõlmede lisamine suurendab läbilaskevõimet proportsionaalselt, kuna jagatud-mitte-midagi-disain kõrvaldab paralleelsete üksuste vahelise konkurentsi.
  • 🧾 Käskude ulatus: DDL loob objekte, DCL annab õigusi ning DML valib, uuendab ja kustutab ridu.
  • ☁️ Kaasaegne platvorm: Vantage, VantageCloud ja ClearScape Analytics laiendavad mootorit pilve- ja andmebaasisisese masinõppe jaoks.

Teradata õpetus

Mis on Teradata?

Teradata on kommertslik relatsioonandmebaaside haldussüsteem arendajateleping suuremahulised andmelao rakendused. See tööriist pakub paralleelsuse kontseptsiooni abil tuge mitmele andmelao toimingule samaaegselt. Teradata on massiliselt paralleelne töötlussüsteem, mis toetab Unixi/Linuxit/Windows serveriplatvormid.

Teradata tarkvara on välja töötanud Teradata Corporation, mis on Ameerika IT-ettevõte. See on analüütiliste andmeplatvormide, rakenduste ja muude seotud teenuste müüja. Ettevõte töötab välja toote, et koondada erinevatest allikatest pärit andmed ja teha andmed analüüsimiseks kättesaadavaks.

Miks Teradata?

  • Teradata pakub täielikku teenuste komplekti, mis keskendub Andmete ladustamine
  • Süsteem on üles ehitatud avatud arhitektuurile. Nii et kui kiiremad seadmed kättesaadavaks tehakse, saab selle lisada juba ehitatud arhitektuuri.
  • Teradata toetab 50+ petabaiti andmeid.
  • Ühe toimingu vaade suurele Teradata mitme sõlmega süsteemile, mis kasutab Service Workstationit
  • Ühildub laia valikuga BI tööriist andmete toomiseks.
  • See võib toimida ühe kontrollpunktina, et DBA haldaks andmebaas.
  • Suur jõudlus, mitmekesised päringud, andmebaasisisene analüüs ja keerukas töökoormuse haldamine
  • Teradata võimaldab teil saada samu andmeid mitme juurutamisvaliku kohta

Need eelised on kogunenud nelja aastakümne jooksul, nagu näitab allolev ajajoon.

Teradata ajalugu

Teradata asutasid 1979. aastal Caltechi teadlased, kes tegid koostööd Citibankiga. NCR Corporation omandas selle 1991. aastal ja Teradata eraldati iseseisvaks börsiettevõtteks 2007. aasta oktoobris, mille esimeseks tegevjuhiks sai Michael Koehler. Ettevõtte peakontor asub San Diegos ning alates 2020. aastast on seda juhtinud president ja tegevjuht Steve McMillan.

Teradata Corporationi verstapostid:

  • 1979 – Teradata asutati
  • 1984 – esimese andmebaasiarvuti DBC/1012 väljalaskmine
  • 1986 – ajakiri Fortune kuulutas Teradata aasta tooteks
  • 1991 – NCR Corporation omandab Teradata
  • 1999 – suurim Teradata abil loodud andmebaas 130 terabaidiga
  • 2002 – Teradata V2R5 versiooni väljalase koos tihendamise ja partitsiooni primaarsega
  • 2006 – Teradata Master Data Management lahenduse turuletoomine
  • 2007 – Teradata eraldub NCR-ist ja noteeritakse iseseisva ettevõttena
  • 2008 – väljastati Teradata 13.0 koos Active Data Warehousingiga
  • 2011 – omandab Teradata Asteri ja sukeldub Advanced Analytics ruumi
  • 2012 – tutvustati Teradata 14.0
  • 2014 – tutvustati Teradata 15.0
  • 2015 – Teradata ostab rakenduste turundusplatvormi Appoxee
  • 2017 – Teradata omandab San Diego ettevõtte StackIQ
  • 2018 – Teradata Vantage lansseeritakse ühtse analüütikaplatvormina
  • 2022 – VantageCloud Lake avaldati pilvepõhise analüütika jaoks
  • 2023 – ClearScape Analytics lisab ulatuslikult andmebaasisisest tehisintellekti ja masinõpet
  • 2024 – Lisab Apache Icebergi ja avatud tabeli vormingu toe. Delta Lake'i ja avaldab Teradata AI Unlimitedi AWS-is ja Azure turgudel
  • 2025 – Käivitab avatud lähtekoodiga MCP-serveri Enterprise Vector Store'i ja AgentBuilderi agentide tehisintellekti töökoormuste toetamiseks.
  • 2026 – Teradata autonoomne teadmiste platvorm kuulutati välja mais ja see muutub üldiselt kättesaadavaks juulis pilve-, kohapealsete ja hübriidjuurutuste jaoks.

Järgmisena selles Teradata õpetuses õpime tundma Teradata funktsioone.

Teradata SQL-i omadused

Teradata pakub järgmisi võimsaid funktsioone:

  • Lineaarne skaleeritavus: Pakub lineaarset skaleeritavust suurte andmemahtude töötlemisel, lisades süsteemi jõudluse suurendamiseks sõlme.
  • Piiramatu paralleelsus: Teradata põhineb MPP-l (massively Parallel Processing Architektuur). Seega on see algusest peale loodud paralleelseks. See võib jagada suure ülesande väiksemateks ülesanneteks ja käivitada neid paralleelselt
  • Mature Optimizer: Teradata Optimizer saab päringus käsitleda kuni 64 liitumist.
  • Madal TCO: Teradata omamise kogukulud on madalad. Seda on lihtne seadistada, hooldada ja hallata.
  • Laadi ja maha utiliidid: Teradata pakub laadimis- ja mahalaadimisutiliite andmete teisaldamiseks Teradata süsteemi/süsteemist.
  • Ühenduvus: Seda MPP-süsteemi saab ühendada kanaliga ühendatud süsteemidega, nagu suurarvuti või võrguühendusega süsteemid.
  • SQL: Teradata toetab SQL tabelitesse salvestatud andmetega suhtlemiseks. See pakub selle laiendust.
  • Tugevad utiliidid: Teradata pakub tugevaid utiliite andmete importimiseks/eksportimiseks Teradata süsteemidest, nagu FastExport, FastLoad, MultiLoad ja TPT.
  • Automaatne levitamine: Teradata saab andmeid ketastele automaatselt jaotada ilma käsitsi sekkumiseta.

Järgmisena selles Teradata SQL-i õpetuses tutvume Teradataga Architektuur.

Teradata Architektuur

Teradata arhitektuur on massiliselt paralleelne töötlemine Architektuur.

Teradata kolm olulist komponenti on:

  • Mootori parsimine
  • BÜNET
  • Juurdepääsumooduli protsessorid (AMP)

Teradata salvestusruum Architecture andmebaas Architektuuri skeem:

Teradata Architektuur
Teradata Architektuuri diagramm

Ülaltoodud diagramm tracon päring parsimismootorilt BYNETi kaudu kettaid omavatele AMP-dele. Kaks allolevat alajaotust järgivad seda teed mõlemas suunas.

Teradata salvestusruum Architektuur

Mootori parsimine:

Parsimismootor parsib päringuid ja koostab täitmisplaani. See haldab kasutajate seansse. See optimeerib ja saadab kasutajatele päringu.

Seega, kui klient täidab päringuid kirjete sisestamiseks, saadab parsimismootor kirjed sõnumi edastamise kihti. Sõnumi edastamise kiht ehk BYNET on tarkvara- ja riistvarakomponent. See pakub võrguvõimalusi. Samuti hangib see kirjed ja saadab rea siht-AMP-le.

AMP:

AMP tähistab Access Module Processorit. See salvestab nendele ketastele kirjeid. AMP viib läbi järgmisi tegevusi:

  • Haldab osa andmebaasist
  • Haldab iga tabeli osa
  • Tehke kõik tulemuste komplekti genereerimisega seotud toimingud, nagu sortimine, koondamine ja ühendamine
  • Tehke luku- ja ruumihaldus

Teraandmete otsimine Architektuur

Kui klient käitab kirjete toomiseks päringuid, saadab parsimismootor päringu BYNETile. Seejärel saadab BYNET otsingupäringu sobivatele AMP-dele.

AMP-d otsivad paralleelselt oma kettaid ja tuvastavad vajalikud kirjed ning saadavad need BYNETi. BYNET saadab kirjed Parsing Engine'ile, mis omakorda saadetakse kliendile.

Järgmisena selles Teradata Database õpetuses õpime tundma Teradata SQL-i käske.

Teradata SQL-käskude tüübid

Teradata andmebaas toetab järgmisi põhilisi SQL-käske:

  1. Data Definition Language (DDL) käsud
  2. Data Control Language (DCL) käsud
  3. Data Manipulation Language (DML) käsud

Andmedefinitsioonikeele käsud

COMMAND Kirjeldus
LUUA Loob uue andmebaasi, tabeli, kasutaja jne.
DROP Eemaldab uue andmebaasi, tabeli, kasutaja jne.
VANUS Muudab tabelit, veergu, päästikut jne.
MUUTMA Muudab andmebaasi või kasutaja määratlust
RENAME Muudab tabelite, vaadete, makrode jne nimesid.

Andmehalduskeele käsud

COMMAND Kirjeldus
ANNA/TÜHISTADA Kasutatakse objektil kasutaja õiguste kontrollimiseks
ANNA SISSELOGIMISE / TÜHISTAKE SISSElogimise Kasutatakse hosti või hostirühma sisselogimisõiguste kontrollimiseks
aNNA Kasutatakse andmebaasiobjekti andmiseks teisele andmebaasiobjektile

Teradata andmebaasi SQL-andmete manipuleerimise keele käsud

COMMAND Kirjeldus
Kustuta Eemaldab tabelist rea
ECHO Kasutatakse stringi või käsu kordamiseks kliendile
KONTROLLIKOHT Määrab ajakirjas taastepunkti, mida saab hiljem kasutada tabeli sisu taastamiseks
SELECT Kasutatakse konkreetse rea andmete tagastamiseks tabeli kujul
UPDATE Muudab andmeid tabeli ühes või mitmes reas

Teradata tootekomplekt ja juurutamisvõimalused

Need käsud käituvad identselt olenemata sellest, milline versioon selle all töötab, kuna Teradata tarnib ühte mootorit mitme tarnemudeli kaudu.

  • Teradata Vantage: Põhiplatvorm, mis ühendab SQL-mootori, töökoormuse halduse ja konnektorid objektisalvestusega.
  • VantageCloudi ettevõte: Hallatud juurutus AWS-is Azurevõi Google Cloud ladudele, mis kolivad oma riistvarast ära.
  • VantageCloudi järv: Pilvepõhine, objektisalvestusele orienteeritud väljaanne sõltumatute arvutusklastritega elastsete töökoormuste jaoks.
  • ClearScape'i analüüs: Andmebaasisisene kiht, mis käitab andmete kõrval ka masinõpet ja aegridade funktsioone.
  • Kohapealne IntelliFlex: Spetsiaalselt ehitatud riistvara reguleeritud töökoormuste jaoks, mis peavad jääma privaatsesse andmekeskusesse.

Kuna üks SQL-lause töötab kõigis väljaannetes muutmata kujul, on hübriidsed pärandvarad levinud.

Teradata andmebaasi rakendused

Järgmised on populaarsed Teradata rakendused:

  • Kliendiandmete haldamine: Aitab hoida klientidega pikaajalisi suhteid.
  • Põhiandmete haldamine: Aitab luua keskkonda, kus põhiandmeid saab kasutada, sünkroonida ja salvestada.
  • Finants- ja tulemusjuhtimine: Aitab organisatsioonil parandada finantsaruandluse kiirust ja kvaliteeti. See vähendab finantsinfrastruktuuri kulusid ja haldab ennetavalt ettevõtte jõudlust.
  • Tarneahela juhtimine: Parandage tarneahela toiminguid, mis aitavad parandada klienditeenindust, lühendada tsükliaegu ja vähendada laoseisu.
  • Nõudlusahela juhtimine: Aitab tõsta klienditeeninduse taset ja müüki. Samuti aitab see ettevõtetel täpselt prognoosida nõudlust oma poekauba järele.

Järgmisena selles Teradata algajatele õpetuses saame teada, mis vahe on Teradata ja muu vahel RDBMS.

Erinevus Teradata ja teiste RDBMS-ide vahel

Parameeter Teradata RDBMS
Architektuurid Jälgib jagatud mittemidagi Architektuur. Jagas kõike ja võimaldab ressurssidega väitlust.
protsessid MIPS [miljoneid juhiseid sekundis] KIPS [Tuhanded juhised sekundis]
Indexes Parem levitamine ja kättesaamine Pakub ainult FASI allalaadimist
Paralleelsus Toetab tingimusteta paralleelsust. Paralleelsus on tingimuslik ja ettearvamatu
Masskoormus Teradata võimaldab hulgilaadimist. Lubab ainult piiratud puistekoormust.
Skaalautuvus Lineaarne skaleeritavus ühe kaldega Skaleeritavus kahaneva tuluga
Andmebaasi puhver Üks andmebaasi puhver, mida kasutavad kõik moodulid (paralleelsuse ühik). Üks andmehoidla, millele pääsevad ligi kõik moodulid. Päringukontroller saadab funktsioonid UoP-idele, kes omavad andmeid
Kauplused See salvestab TERABAITE [Billridade ioonid] GIGABAITE [Miljoneid ridu]

Ülaltoodud rida „jagamata midagi” sõltub järgmisena võrreldavast töötlemismudelist.

MPP vs SMP

MPP SMP
MPP – massiliselt paralleelne töötlemine. See on arvutisüsteem, mis on ühendatud paljude sõltumatute aritmeetikaüksuste või tervete mikroprotsessoritega, mis töötavad paralleelselt. Sümmeetriline mitmekordne töötlemine. SMP-töötlussüsteemis jagavad CPU-d sama mälu ja selle tulemusena võib ühes süsteemis töötav kood mõjutada teise kasutatavat mälu.
Andmebaase saab laiendada uute protsessorite lisamisega. SMP-andmebaasid kasutavad andmebaasiotsingu tegemiseks üldjuhul ühte CPU-d.
MPP-keskkonnas paraneb jõudlus, kuna füüsiliste arvutite vahel ei tohi ressursse jagada. Paralleeltöö töökoormus jaotatakse süsteemis olevate protsessorite vahel.
Massiivse paralleeltöötlussüsteemi jõudlus on lineaarne. See aga suureneb proportsionaalselt sõlmede arvuga. SMP andmebaasid võivad töötada mitmes serveris. Siiski jagab teist ressurssi.

KKK

Esmane indeks otsustab, milline AMP iga rida salvestab. Teradata räsib indeksi veeru ja suunab rea vastavasse AMP-sse, nii et hästi valitud indeks jaotab andmed ühtlaselt ja väldib moonutusi.

Teradata Studio on praegune graafiline klient, mis asendab vanemat SQL Assistantit. BTEQ haldab terminalist skriptitud partiitööd ja standardsed ODBC- või JDBC-draiverid ühendavad kolmanda osapoole tarkvara. BI tööriistad.

Tootmisplatvorm on ärilitsentsiga, kuid Teradata pakub tasuta ClearScape Analytics Experience'i keskkonda ja arendajatele mõeldud prooviversioone, mis on piisavad SQL-i, indekseerimise ja päringute planeerimise harjutamiseks.

ClearScape Analytics käitab masinõppe, hindamise ja aegridade funktsioone SQL-ina otse salvestatud ridadel. Keepping Andmete kõrval olevad mudelid eemaldavad ekspordietapid ja võimaldavad ennustustes kasutada kogu ladu, mitte valimit.

Tehisintellekti assistendid koostavad päringute mustandeid ja pakuvad välja indeksi või liitumise muudatusi, kuid optimeerija statistika ja ärireeglid vajavad ikkagi inimese ülevaatamist. Käsitle genereeritud SQL-i algse mustandina, mitte kunagi tootmisversioonina.

Võta see postitus kokku järgmiselt: