Adattárház Architecture, komponensek és diagram Concepts

⚡ Okos összefoglaló

Adattárház ArchiA struktúra meghatározza, hogyan szerveződnek a sok forrásból származó historikus és kumulatív adatok többszintű rétegekbe és összekapcsolt összetevőkbe, lehetővé téve a megbízható jelentéskészítést, elemzést és az igazság egységes verzióját a szervezeti döntéshozatalhoz és előrejelzéshez.

  • 🏛️ Fő cél: Az adattárház alany-orientált, integrált, időben változó és nem felejtő adatokat tárol az elemzés támogatására, a napi tranzakciófeldolgozás helyett.
  • 🧱 Többszintű tervezés: ArchiA struktúrák az egyszintűtől a széles körben használt háromszintű modellig terjednek, amely egy alsó adatbázist, egy középső OLAP-kiszolgálót és egy felső kliensréteget tartalmaz.
  • 🗄️ Alapvető adatbázis: A központi adattár egy RDBMS-en fut, amelyet gyakran párhuzamos adatbázisokkal, új indexstruktúrákkal és többdimenziós adatbázisokkal bővítenek a méretezhetőség és a sebesség érdekében.
  • 🔄 ETL-összetevők: A beszerzési, tisztítási és átalakítási eszközök egyetlen egységes formátumba konszolidálják az adatokat, és naprakészen tartják a raktárat.
  • 🏷️ Metaadat szerepkör: A technikai és üzleti metaadatok leírják az adatok forrását, jelentését és feldolgozását, a nyers értékeket felhasználható tudássá alakítva.
  • 📊 Lekérdezés- és OLAP-eszközök: A jelentéskészítés, a felügyelt lekérdezések, az alkalmazásfejlesztés, az adatbányászat és az OLAP eszközök lehetővé teszik a felhasználók számára, hogy számos nézőpontból felfedezzék az adattárházat.
  • Legjobb Gyakorlatok: Optimalizálja az adatmodellt a visszakereséshez, konszolidálja az adatokat egyetlen igaz verzióra, és szükség esetén vegye figyelembe az ODS vagy a 3NF modell használatát.

Adattárház ArchiEgy adattárház szintjeit és fő összetevőit bemutató szerkezeti ábra

Adattárház Concepts

A adattárház azért létezik, hogy a vállalatok számára az igazság egyetlen verzióját biztosítsa a döntéshozatalhoz és az előrejelzéshez. Ez egy olyan információs rendszer, amely egy vagy több forrásból származó historikus és kumulatív adatokat tárol.

Azáltal, hogy az adatokat tranzakciók helyett elemzésre rendszerezi, az adattárház leegyszerűsíti a teljes szervezet jelentéskészítési és elemzési munkáját.

Az adattárház jellemzői

Egy adattárháznak négy meghatározó jellemzője van, amelyek megkülönböztetik egy rutinszerű, működő adatbázistól:

  • Tárgy-orientált
  • Integrált
  • Idő-változat
  • Nem illékony

Tárgy-orientált

Az adattárház téma-orientált, mivel egy adott témáról, nem pedig egy vállalat folyamatban lévő működéséről nyújt információkat. Tipikus témák közé tartozik az értékesítés, a marketing és a disztribúció.

A napi feldolgozás helyett a raktár a döntéshozatalhoz szükséges modellezésre és elemzésre helyezi a hangsúlyt. Egyszerű, tömör áttekintést nyújt minden egyes témáról, és kihagyja azokat az adatokat, amelyek nem támogatják a döntési folyamatot.

Integrált

Az integráció szorosan kapcsolódik a tantárgyi orientációhoz. Egy adattárházban az integráció azt jelenti, hogy közös mértékegységet hozunk létre az összes hasonló adathoz, amelyek különböző adatbázisokból származnak, és ezeket az adatokat közös, univerzálisan elfogadható módon tároljuk.

Egy adattárházat különböző forrásokból, például nagyszámítógépekből, relációs adatbázisokból és egyszerű fájlokból származó adatok integrálásával építenek fel. Emellett következetes elnevezési konvenciókat, formátumokat és kódolást kell alkalmaznia.

Ez az elnevezési, attribútummérték- és kódolási struktúra következetessége teszi lehetővé a hatékony elemzést. Vegyük figyelembe a következő példát:

Adattárház integrációs példa, amely három alkalmazás nem, dátum és egyenleg mezőit szabványosítja

A fenti példában három, A, B és C címkével ellátott alkalmazás tárolja a nem, a dátum és az egyenleg adatait, de minden alkalmazás másképp tárolja ezeket:

  • Az A alkalmazás a nem mezőt logikai értékként tárolja, például M vagy N.
  • A B alkalmazás a nem mezőt numerikus értékként tárolja.
  • A C alkalmazás a nem mezőt karakterértékként tárolja.
  • Ugyanez a változás vonatkozik a Dátum és az Egyenleg mezőkre is.

Az átalakítási és tisztítási folyamat után az összes adatot egy közös formátumban tárolják az adattárházban.

Idő-változat

Egy adattárház időhorizontja sokkal szélesebb, mint egy operációs rendszeré. Az adatok egy adott időszakhoz kötődnek, és történeti nézőpontot kínálnak, így mindig hordoznak valamilyen időbeli elemet, akár explicit módon, akár implicit módon.

Ez az időbeli eltérés a rekordkulcs szerkezetében jelenik meg. A raktárban minden elsődleges kulcsnak tartalmaznia kell egy időelemet, például a napot, a hetet vagy a hónapot.

Az időbeli variancia egy másik aspektusa, hogy miután az adatokat beillesztették a raktárba, azokat nem lehet frissíteni vagy módosítani.

Nem illékony

Az adattárház nem felejtő, ami azt jelenti, hogy a korábbi adatok nem törlődnek új adatok érkezésekor. Az adatok csak olvashatók és rendszeresen frissülnek, ami segít az elemzőknek a historikus adatok tanulmányozásában és annak megértésében, hogy mi történt és mikor.

Mivel nincs szüksége tranzakciófeldolgozásra, helyreállításra vagy párhuzamosságvezérlésre, egy adattárház kihagyja a működő alkalmazásokban megszokott törlési, frissítési és beszúrási tevékenységeket. Az adattárházakban csak két adatműveletet hajtanak végre:

  1. Adatok betöltése
  2. Adat hozzáférés

Az alábbi táblázat néhány főbb különbséget emel ki egy működő alkalmazás és egy adattárház között:

Operanemzeti alkalmazás Adattárház
Az összetett programot kódolni kell annak biztosítására, hogy az adatfrissítési folyamatok megőrizzék a végtermék magas szintű integritását. Ez a fajta probléma nem fordul elő, mert az adatfrissítés nem történik meg.
Az adatok normalizált formában kerülnek elhelyezésre a minimális redundancia biztosítása érdekében. Az adatok tárolása nem normalizált formában történik.
A tranzakciók, az adat-helyreállítás, a visszagörgetés és a patthelyzetek feloldásának támogatásához szükséges technológia meglehetősen összetett. Viszonylagos technológiai egyszerűséget kínál.

Adattárház Architectúra

Adattárház ArchiA struktúra összetett, mivel a rendszer több forrásból származó historikus és kumulatív adatokat tárol. A raktárrétegek felépítésére három megközelítés létezik: egyszintű, kétszintű és háromszintű.

Egyszintű architektúra A redundancia eltávolításával a tárolt adatok mennyiségének minimalizálására törekszik. A gyakorlatban ritkán alkalmazzák.

Kétszintű architektúra elválasztja a fizikailag elérhető forrásokat az adattárháztól. Nem könnyen bővíthető, kevesebb végfelhasználót támogat, és a hálózati korlátok miatt kapcsolódási problémákba ütközhet.

Háromszintű architektúra az adattárházak legszélesebb körben használt kialakítása.

Felső, középső és alsó rétegekből áll:

  1. Alsó szint: A raktár adatbázisa az alsó réteg. Általában egy relációs adatbázis-rendszer, és az adatokat háttéreszközök segítségével tisztítják, alakítják át és töltik be ebbe a rétegbe.
  2. Középső szint: A középső réteg egy OLAP szerver, amelyet vagy ROLAP, vagy MOLAP modellel valósítottak meg. Abszolúttracaz adatbázis nézetét látja, és közvetítőként működik a végfelhasználó és az adatbázis között.
  3. Legfelső szint: A legfelső szint egy front-end kliens réteg. Ez tartalmazza azokat az eszközöket és API-kat, amelyek a tárházhoz való csatlakozáshoz és az adatok kinyeréséhez használatosak, például lekérdezőeszközöket, jelentéskészítő eszközöket, felügyelt lekérdezőeszközöket, elemzőeszközöket és adatbányászati ​​eszközöket.

Adattárház komponensek

Az adattárház összetevői és általános architektúrája az alábbi ábrán látható módon működnek együtt.

Adattárház architektúra komponensei, beleértve az adatbázist, az ETL eszközöket, a metaadatokat, a lekérdező eszközöket és az adattárházakat

Az adattárház egy RDBMS szerveren alapul, amely egy központi információtár, amelyet kulcsfontosságú komponensek vesznek körül, és amelyek biztosítják a teljes környezet funkcionális, kezelhető és hozzáférhetőségét.

Egy adattárház öt fő összetevőből áll, amelyeket az alábbiakban ismertetünk.

Adattárház adatbázis

A központi adatbázis a raktározási környezet alapja, és a következő helyen valósult meg: RDBMS technológia. Mivel egy hagyományos relációs adatbázis-kezelő rendszer (RDBMS) tranzakciófeldolgozásra van hangolva, nem pedig raktározásra, az erőforrás-igényes műveletek, mint például az eseti lekérdezések, a többtáblás illesztések és az aggregációk, lelassíthatják azt.

Emiatt alternatív adatbázis-megközelítéseket alkalmaznak:

  • A relációs adatbázisokat párhuzamosan telepítik a skálázhatóság érdekében, megosztott memóriájú vagy megosztott-semmi modelleket használva különféle többprocesszoros vagy masszívan párhuzamos konfigurációkon.
  • Az új indexstruktúrákat a relációs tábla-szkennelések megkerülésére és a sebesség javítására használják.
  • A többdimenziós adatbázisokat (MDDB-ket) a relációs adattárház modellek korlátainak leküzdésére használják. Erre példa az Essbase a következőből: Oracle.

Beszerzési, beszerzési, tisztítási és átalakítási eszközök (ETL)

Az adatforrás-, átalakítási és migrációs eszközök elvégzik az összes szükséges konverziót, összegzést és módosítást az adatok egységes adattárház-formátumba alakításához. Ezeket Ex-nek is nevezik.tract, Transform, and Load (ETL) eszközök.

Funkcionalitásuk a következőket foglalja magában:

  • Az adatok anonimizálása a jogszabályi előírásoknak megfelelően.
  • A nem kívánt adatokat a működési adatbázisokból a raktárba való betöltés előtt el kell távolítani.
  • Keressen és cseréljen általános neveket és definíciókat a különböző forrásokból érkező adatokhoz.
  • Összefoglalások és származtatott adatok kiszámítása.
  • Töltse ki a hiányzó adatokat az alapértelmezett értékekkel.
  • Szüntesse meg a több forrásból érkező ismétlődő adatok duplikációit.

Ezek ETL eszközök cron feladatokat, háttérfeladatokat, Cobol programokat és shell szkripteket generálhat, amelyek rendszeresen frissítik a raktárat és segítenek a metaadatok karbantartásában.

Mivel számos rendszerből merítenek, az ETL eszközöknek az adatbázisok és az adatok heterogenitásával is meg kell birkózniuk.

Metaadatok

A metaadatok bonyolultnak tűnhetnek, de ezek egyszerűen adatok az adatokról, amelyek meghatározzák a raktárat. Ezeket a raktár felépítésére, karbantartására és kezelésére használják.

Az architektúrán belül a metaadatok határozzák meg az adatok forrását, felhasználását, értékeit és jellemzőit, valamint azt, hogy az adatok hogyan módosíthatók és feldolgozhatók, így azok szorosan kapcsolódnak az adattárházhoz.

Például egy értékesítési adatbázisban egy sor tartalmazhatja a következőket:

4030 KJ732 299.90

Ez mindaddig értelmetlen, amíg a metaadatok nem magyarázzák el, hogy a modellszám 4030, az értékesítési ügynök azonosítója KJ732, a teljes értékesítési összeg pedig 299.90 USD.

A metaadatok ezért alapvető fontosságúak az adatok tudássá alakításában, és segítenek megválaszolni az olyan kérdéseket, mint:

  • Milyen táblákat, attribútumokat és kulcsokat tartalmaz a tárház?
  • Honnan származtak az adatok?
  • Hányszor töltődnek újra az adatok?
  • Milyen átalakításokat és tisztításokat alkalmaztak?

A metaadatok két kategóriába sorolhatók:

  1. Technikai metaadatok: Ez leírja a raktárat a tervezők és adminisztrátorok számára, akik megépítik és üzemeltetik.
  2. Üzleti metaadatok: Ezáltal a végfelhasználók könnyen megérthetik a raktárban tárolt információkat.

Lekérdező eszközök

Az adattárházak elsődleges célja, hogy a vállalkozások megkapják a stratégiai döntések meghozatalához szükséges információkat, a lekérdezőeszközök pedig azt jelentik, hogy a felhasználók hogyan lépnek interakcióba a rendszerrel.

Ezek az eszközök négy kategóriába sorolhatók:

  1. Lekérdező és jelentéskészítő eszközök
  2. Alkalmazásfejlesztő eszközök
  3. Adatbányászati ​​eszközök
  4. OLAP eszközök

Lekérdezési és jelentéskészítő eszközök

A lekérdezési és jelentéskészítő eszközök két csoportra oszthatók: jelentéskészítő eszközökre és felügyelt lekérdezési eszközökre.

Jelentési eszközök tovább oszlik termelési jelentéskészítő eszközökre és asztali jelentéskészítőkre:

  1. Jelentésírók: Ezeket a végfelhasználók számára tervezték, akik saját elemzéseket készítenek.
  2. Termelési jelentések: Ezek lehetővé teszik a szervezetek számára, hogy rendszeres működési jelentéseket készítsenek, és támogassák a nagy volumenű kötegelt feladatokat, például a nyomtatást és a számítást. Népszerű példák közé tartozik a Brio, a Business Objects, Oracle, a PowerSoft és a SAS Intézet.

Felügyelt lekérdező eszközök Segítsen a végfelhasználóknak egy metaréteg beillesztésével a felhasználó és az adatbázis közé, amely elrejti az SQL és az adatbázis-struktúra összetettségét.

Alkalmazásfejlesztő eszközök

Amikor a beépített grafikus és analitikai eszközök nem tudják kielégíteni egy szervezet analitikai igényeit, egyéni jelentéseket készítenek alkalmazásfejlesztő eszközökkel.

Adatbányászati ​​eszközök

Az adatbányászat jelentőségteljes új összefüggéseket, mintákat és trendeket fedez fel nagy mennyiségű adatban, az adatbányászati ​​eszközök pedig automatizálják ezt a felfedezést.

OLAP eszközök

OLAP Az eszközök egy többdimenziós adatbázisra épülnek, és lehetővé teszik a felhasználók számára az adatok elemzését bonyolult, többdimenziós nézeteken keresztül.

Adattárház busz Architectúra

Az adattárház busz határozza meg, hogyan áramlanak az adatok a tárházban. Ez az áramlás beáramlásra, feláramlásra, leáramlásra, kiáramlásra és metaáramlásra osztható.

A busz tervezésekor figyelembe kell venni az adattárházakat átszelő megosztott dimenziókat és tényeket.

Data Marts

A adatok mart egy hozzáférési réteg, amelyet az adatok felhasználókhoz juttatására használnak. Nagyobb raktárakhoz illik, mivel kevesebb időt és pénzt igényel a felépítése, bár az adattárháznak nincs egységes, elfogadott definíciója.

Egyszerűen fogalmazva, az adatmart az adattárház leányvállalata. Particionálja az adatokat egy adott felhasználói csoport számára, és tárolható ugyanabban az adatbázisban, mint az adattárház, vagy egy fizikailag különálló adatbázisban.

Adattárház Architecture Best Practices

Egy megbízható adattárház-architektúra megtervezéséhez kövesse az alábbi ajánlott gyakorlatokat:

  • Használjon olyan adattárház modelleket, amelyek optimalizáltak az információkereséshez, legyen szó akár egy dimenziós, denormalizált vagy hibrid megközelítés.
  • Válasszon egy megfelelő tervezési megközelítést, legyen az felülről lefelé vagy alulról felfelé irányuló.
  • Győződjön meg arról, hogy az adatokat gyorsan és pontosan feldolgozza, miközben egyetlen valósággá konszolidálja azokat.
  • Gondosan tervezze meg a raktár adatgyűjtési és -tisztítási folyamatát.
  • Tervezzen egy metaadat-architektúrát, amely lehetővé teszi a metaadatok megosztását a tárház komponensei között.
  • Vegyünk egy Operanacionalális adattár (ODS) modell, amikor a visszakeresési igények az adattár alján vannaktracciós piramis, vagy amikor több működési forráshoz kell hozzáférni.
  • Győződjön meg arról, hogy az adatmodell integrált, ne pedig pusztán konszolidált; ebben az esetben használjon 3NF adatmodellt, amely ideális az ETL és az adattisztító eszközök beszerzéséhez is.

GYIK

Egy működőképes adatbázis a tranzakciófeldolgozáshoz normalizált táblázatok segítségével kezeli a gyakori beszúrásokat, frissítéseket és törléseket. Az adattárház csak olvasható és nem felejtő, denormalizált struktúrákban tárolja a historikus adatokat, és a napi műveletek helyett lekérdezésre, jelentéskészítésre és elemzésre van optimalizálva.

Az adattárház egy vállalati szintű adattár, amely számos forrásból származó integrált adatokat tárol. adatok mart egy kisebb részhalmaz, amely egyetlen részlegre vagy témára, például értékesítésre vagy pénzügyre összpontosít, így gyorsabban és olcsóbban építhető fel, és könnyebben lekérdezhető.

Mindkettő dimenziós terv. A csillagséma egy központi ténytáblát helyez el, amely közvetlenül a denormalizált dimenziótáblákhoz kapcsolódik, egy csillagra hasonlítva. A hópehely séma ezeket a dimenziókat normalizálja kapcsolódó altáblákba. Lásd dimenziós modellezés a tények és dimenziók rendszerezésének módjáról.

A felhőalapú adattárház egy szolgáltató által üzemeltetett felügyelt analitikai adatbázis, például Amazon Vöröseltolódás, Google BigQuery, vagy Snowflake. Igény szerint skálázza a tárhelyet és a számítási feladatokat, csökkenti a hardver karbantartását, és ugyanazt a többszintű architektúrát és ETL-folyamatokat támogatja, mint a helyszíni adattárházak.

Az igazság egyetlen verziója azt jelenti, hogy minden felhasználó és jelentés egyetlen konzisztens, integrált adathalmazra támaszkodik. A különböző forrásokból származó értékek konszolidálásával és szabványosításával az adattárház eltávolítja az ütköző adatokat, így a döntések ugyanazon megbízható számokon alapulnak.

ETL extracts adatokat, átalakítja azokat egy átmeneti területen, majd betölti a raktárba. Az ELT először betölti a nyers adatokat, és a számítási kapacitását felhasználva átalakítja azokat a raktáron belül. További információért lásd: ETL folyamat magyarázat.

A mesterséges intelligencia és a gépi tanulási eszközök sématerveket javasolnak, automatizálják az ETL-térképetping, az adatminőségi anomáliákat észlelik, és indexeket vagy partíciókat javasolnak a lekérdezések felgyorsítására. Előre is tudják jelezni a tárhely növekedését. Egy mérnöknek minden javaslatot át kell tekintenie, mielőtt azt egy éles raktárra alkalmazná.

Igen. ChatGPT SQL-t, dimenzionális modelleket és ETL logikát tud vázlatolni egy leírásból, miközben GitHub másodpilóta automatikusan kiegészíti az átalakítási szkripteket a szerkesztőben. Mindig ellenőrizze a létrehozott sémákat és lekérdezéseket, mert a mesterséges intelligencia hivatkozhat elavult szintaxisra vagy alapértelmezett értékekre.

Foglald össze ezt a bejegyzést a következőképpen: