Mi az a dimenziós modellezés az adattárházban? Ismerje meg a típusokat

⚡ Okos összefoglaló

Az adattárházakban a dimenziós modell tény- és dimenziótáblákba rendezi az információkat, így az elemzők gyorsan lekérhetik és összegezhetik a numerikus mértékeket az ötlépéses Kimball-módszert követve, amely azonosítja az üzleti folyamatot, a szemcséket, a dimenziókat, a tényeket és a végső sémát.

  • 🎯 Fő cél: A dimenzionális modell a gyors olvasás és jelentéskészítés érdekében hangolja be az adattárházat, ellentétben a valós idejű tranzakciókhoz létrehozott relációs modellekkel.
  • 🧱 Építőkockák: A tények numerikus mértékeket tartalmaznak, míg a dimenziók és azok attribútumai adják meg az egyes tények ki, mit és hol kontextusát.
  • 🔑 Tény- és dimenziótáblázatok: A ténytábla a mértékeket és az idegen kulcsokat tárolja; a denormalizált dimenziótáblák a leíró attribútumokat és hierarchiákat.
  • 🪜 Ötlépéses módszer: Azonosítsa az üzleti folyamatot, határozza meg a részleteket, válassza ki a dimenziókat, válassza ki a tényeket, majd építse fel a sémát.
  • Sémaválasztás: A csillag sémák a sebesség érdekében denormalizált dimenziókat használnak, míg a hópehely sémák a tárhely megtakarítása érdekében normalizálják azokat.
  • 🚀 Fő előny: A szabványosított, üzletbarát dimenziók növelik a lekérdezések teljesítményét, és lehetővé teszik az új dimenziók hozzáadását minimális fennakadás nélkül.

Dimenziós modell egy adattárházban, amely tény- és dimenziótáblákat mutat

Mi az a dimenziós modellezés?

Dimenziós modellezés (DM) egy adattárházban történő adattárolásra optimalizált adatszerkezeti technika. Célja az adatbázis hangolása az adatok gyorsabb visszakeresése érdekében. A koncepciót Ralph Kimball fejlesztette ki, és két táblatípus köré épül: a „tény” és a „dimenzió” táblák.

Az adattárházakban található dimenzionális modellek numerikus információk, például értékek, egyenlegek, darabszámok és súlyok olvasására, összegzésére és elemzésére szolgálnak. Ezzel szemben a relációs modellek valós idejű online tranzakciófeldolgozó rendszerekben történő adatbevitelre, frissítésre és törlésre vannak optimalizálva.

Ezen megközelítések mindegyike a maga módján tárolja az adatokat, és mindegyikük eltérő előnyöket kínál.

Egy relációs modellben a normalizálás és az ER modellek csökkentik az adatredundanciát. Egy dimenzionális modell ehelyett úgy rendezi el az adatokat, hogy az információk könnyebben visszakereshetők és a jelentések könnyebben generálhatók legyenek.

Emiatt a dimenziós modellek alkalmasak adattárház rendszerek, nem pedig tranzakció-intenzív relációs rendszerek. Mivel a modell a tágabb értelemben vett adattárház architektúraaz alábbi szakaszok lebontják az elemeit, típusait és tervezési lépéseit.

A dimenziós adatmodell elemei

Tény

A tények az üzleti folyamatokból levont mérések vagy mérőszámok. Egy értékesítési folyamatban például a negyedéves értékesítési szám egy tény – az a számérték, amelyet a vállalkozás elemezni kíván.

Dimenzió

A dimenzió egy üzleti folyamat eseményét körülvevő kontextust biztosít. Egyszerűen fogalmazva, a dimenziók adják meg egy tény ki, mit és hol adatait. A „negyedéves értékesítési szám” tény esetében a dimenziók a következők lennének:

  • Ki – Ügyfélnevek
  • Hol – Helyszín
  • Mi – Termék neve

Más szóval, a dimenzió egy ablak, amelyen keresztül a tényekben rejlő információkat szemlélhetjük.

Attribútumok

Az attribútumok egy dimenzió különféle jellemzői egy dimenzionális adatmodellen belül.

Egy Hely dimenzióban az attribútumok a következők lehetnek:

  • Állami
  • Ország
  • Irányítószám

Az attribútumok a tények keresésére, szűrésére és osztályozására szolgálnak, és ezek az attribútumok a dimenziótáblákban találhatók.

Tények táblázat

A ténytábla a dimenzionális modell elsődleges táblája.

Egy ténytáblázat a következőket tartalmazza:

  1. Mérések vagy tények
  2. Idegen kulcsok dimenziótáblákhoz

Mérettáblázat

A dimenziótábla egy tény dimenzióit tartalmazza, és egy idegen kulcson keresztül kapcsolódik a ténytáblához. Főbb jellemzőit az alábbiakban soroljuk fel:

  • A mérettáblázatok denormalizált táblázatok.
  • A dimenzióattribútumok alkotják a tábla oszlopait.
  • A dimenziók a tények leíró jellemzőit kínálják az attribútumaikon keresztül.
  • A dimenziók számára nincs fix korlát.
  • Egy dimenzió egy vagy több hierarchikus kapcsolatot tartalmazhat.

Dimenziók típusai az adattárházban

A dimenziós modellezés többféle méretet használ, amelyek mindegyike egy adott tervezési igényhez igazodik. A fő dimenziótípusok egy adattárházban vannak:

  • Megfelelő dimenzió
  • Kitámasztó dimenzió
  • Zsugorított dimenzió
  • Szerepjáték dimenzió
  • Méret méret táblázat
  • Junk Dimenzió
  • Degenerált dimenzió
  • Cserélhető méret
  • Lépés dimenzió

A dimenziós modellezés lépései

A dimenzionális modellezés pontossága határozza meg az adattárház megvalósításának sikerét. Egy dimenzionális modell felépítéséhez öt lépés szükséges:

  1. Az üzleti folyamat azonosítása
  2. A szemcsék azonosítása (részletességi szint)
  3. A méretek azonosítása
  4. A tények azonosítása
  5. A séma felépítése

Összességében a kész modellnek le kell írnia az üzleti folyamat miértjét, mennyiségét, mikorját, holját, kijét és mit.

A dimenziós modellezés öt lépése egy adattárházban

1. lépés) Azonosítsa az üzleti folyamatot

Az első feladat annak meghatározása, hogy a raktárnak mely üzleti folyamatokat kell lefednie – marketing, értékesítés, HR stb. – a szervezet igényei alapján. adatelemzés igények és a rendelkezésre álló adatok minősége. Ez a legfontosabb lépés, mert egy itt elkövetett hiba kaszkádszerű, nehezen javítható hibákat eredményez.

Az üzleti folyamatok leírásához használhat sima szöveget, üzleti folyamatmodellezési jelölést (BPMN) vagy egységes modellezési nyelvet (UML).

2. lépés) Azonosítsa a gabonát

A részletgazdagság határozza meg az üzleti probléma részletességi szintjét – ez a táblázatban tárolt információk legalacsonyabb szintje.

Ha egy tábla minden napra vonatkozóan tartalmazza az eladásokat, akkor napi részletességgel rendelkezik; ha havi összesítéseket tartalmaz, akkor havi részletességgel rendelkezik.

Ebben a szakaszban olyan kérdésekre kell válaszolnod, mint például:

  1. Az összes elérhető terméket vagy csak néhány terméktípust kell-e a raktárnak tárolnia? Ez a kiválasztott üzleti folyamatoktól függ.
  2. A termékértékesítési adatokat havi, heti, napi vagy óránkénti bontásban kell tárolni? Ez a jelentésvezetők kérésétől függ.
  3. Hogyan befolyásolja ez a két választás az adatbázis méretét?

Példa a gabonára: Képzeljük el, hogy egy multinacionális vállalat vezérigazgatója látni szeretné bizonyos termékek eladásait különböző helyszíneken, naponta mérve.

Ebben az esetben a gabona „napi, helyszínenkénti termékértékesítési információvá” válik.

3. lépés) Határozza meg a méreteket

A dimenziók olyan főnevek, mint a dátum, az üzlet és a készlet, és leíró adatokat tartalmaznak.

Például egy dátumdimenzió tartalmazhat egy évet, egy hónapot és egy napot.

Méretek példája: ugyanaz a napi értékesítési igény határozza meg a dimenziók kiválasztását.

Ebben a forgatókönyvben a dimenziók a Termék, a Helyszín és az Idő.

A Termék dimenzió olyan attribútumokat tartalmaz, mint a termékkulcs (egy idegen kulcs), a név, a típus és a specifikációk.

A Helyszín dimenzió hierarchikus rendszerben van felépítve: ország, állam, város, utca és név.

4. lépés) A tények azonosítása

Ez a lépés szorosan kapcsolódik a rendszer üzleti felhasználóihoz, mivel meghatározza, hogy milyen adatokat használnak fel az adattárházból.

A legtöbb ténytábla sora numerikus értékeket tartalmaz, például egységárat vagy egységköltséget.

Tényekre példa: A napi eladási követelmény ismét meghatározza a kontextust.

Itt a tény a termék, a helyszín és az idő szerinti eladások összege.

5. lépés) Séma létrehozása

Ebben az utolsó lépésben implementáljuk a dimenzionális modellt. A séma egyszerűen az adatbázis-struktúra – a táblák elrendezése –, és két séma különösen gyakori.

Az első az csillag séma, amely könnyen megtervezhető és alakjáról kapta a nevét: egy központi ténytábla, amelynek dimenziótáblái kifelé sugároznak, mint egy csillag csúcsai.

Egy csillagsémában a ténytábla harmadik normálformában van, míg a dimenziótáblák denormalizáltak; ez csillagséma az adattárház modellezésében Az útmutató egy teljes példán keresztül működik.

A második a hópehely séma, a csillagséma kiterjesztése, amelyben minden dimenzió normalizált és további dimenziótáblázatokhoz kapcsolódik, ahogyan azt ebben a részben ismertetjük hópehely séma az adattárház modellben útmutató.

A dimenziós modellezés szabályai

A hatékony dimenziós modellezést a következő szabályok és elvek irányítják:

  • Atomi adatok betöltése a dimenziós struktúrákba.
  • Építsen dimenziós modelleket az üzleti folyamatok köré.
  • Győződjön meg arról, hogy minden ténytáblához tartozik egy dátumdimenzió-tábla.
  • Minden tényt egyetlen ténytáblázatban tároljon, azonos részletességgel vagy szemcsemérettel.
  • Jelentéscímkék és szűrőtartomány-értékek tárolása a dimenziótáblákban.
  • Adjon minden dimenziótáblához egy helyettesítő kulcsot.
  • Folyamatosan egyensúlyba kell hozni a követelményeket a valósággal, hogy olyan megoldást lehessen nyújtani, amely támogatja az üzleti döntéshozatalt.

A dimenziós modellezés előnyei

A dimenzionális modellezés számos gyakorlati előnnyel jár:

  • A szabványosított dimenziók lehetővé teszik az egyszerű és következetes jelentéskészítést az üzleti területeken.
  • A mérettáblázatok tárolják a méretinformációk történetét.
  • Új dimenziók bevezethetők a ténytábla jelentős megzavarása nélkül.
  • Az adatokat úgy tároljuk, hogy könnyebben visszakereshetők legyenek, miután bekerültek az adatbázisba.
  • A normalizált modellhez képest a dimenziós táblázatok könnyebben érthetők, mivel az információk egyértelmű üzleti kategóriákba vannak csoportosítva.
  • A modell üzleti kifejezéseken alapul, így a vállalkozás tudja, mit jelent az egyes tények, dimenziók vagy attribútumok.
  • Mivel a modell denormalizált, gyors lekérdezésre van optimalizálva, és számos relációs platform optimalizálja a végrehajtási terveit erre.
  • A séma nagy teljesítményt nyújt kevesebb illesztéssel és minimális adatredundanciával.
  • A dimenziós modellek könnyen kezelik a változásokat, mivel oszlopok adhatók hozzá a dimenziótáblákhoz anélkül, hogy befolyásolnák a meglévő üzletiintelligencia-alkalmazásokat.

Mi az a többdimenziós adatmodell az adattárházban?

A többdimenziós adatmodell adatkockákként ábrázolja az adatokat, lehetővé téve az adatok modellezését és megtekintését több dimenzió mentén, amelyeket dimenziók és tények határoznak meg. Egy ilyen modell általában egy központi téma köré szerveződik, és egy ténytábla ábrázolja, és ez képezi az alapját a következőknek: OLAP elemzés.

GYIK

A ténytábla egy üzleti folyamat numerikus mértékeit tárolja, valamint a dimenziókhoz tartozó idegen kulcsokat. A dimenziótábla leíró, denormalizált attribútumokat – például terméket, helyet vagy dátumot – tárol, amelyek megadják ezeknek a mértékeknek a szűréshez és csoportosításhoz szükséges kontextust.ping.

A tények lehetnek additívak, félig additívak vagy nem additívak. Az additív tények, például az értékesítési összeg, minden dimenzióban összegződnek. A félig additív tények, például a számlaegyenlegek, bizonyos dimenziókban összegződnek, de időben nem. A nem additív tények, például az arányok vagy százalékok, nem összegezhetők értelmesen.

A csillag séma Minden dimenziót egyetlen, denormalizált táblázatban tárol, ami egyszerűbb illesztéseket és gyorsabb lekérdezéseket eredményez. A hópehely séma normalizálja a dimenziókat kapcsolódó altáblákba, ami tárhelyet takarít meg, de illesztéseket és bonyolultságot okoz. A csillag sémák a gyakoribb analitikai választás.

A helyettesítő kulcs egy rendszer által generált egész szám, amelyet egy dimenzió elsődleges kulcsaként használnak a természetes üzleti kulcs helyett. Függetlenné teszi az adattárházat a forrás-rendszer változásaitól, felgyorsítja a csatlakozásokat, és lehetővé teszi a következőket: track történelmi változások egy dimenzión belül.

A lassan változó dimenzió olyan dimenzió, amelynek attribútumértékei idővel változnak, például egy ügyfél címe. Az általános stratégiák felülírják a régi értéket (1. típus), új sort adnak hozzá az előzmények mentéséhez (2. típus), vagy az előző értéket külön oszlopban tárolják (3. típus).

Ralph Kimball dimenzionális modellezése a raktárat alulról felfelé építi fel, csillag-séma adattárakból, amelyeket jelentéskészítésre optimalizáltak. Bill Az Inmon megközelítése először egy felülről lefelé irányuló, normalizált vállalati raktárat épít fel, majd innen származtatja a piacokat. A Kimball gyorsabban szállít, míg az Inmon a vállalat egészére kiterjedő konzisztenciát hangsúlyozza.

A mesterséges intelligencia eszközei képesek profilokat készíteni a forrásadatokról, javaslatokat tenni a lehetséges tényekre és dimenziókra, ajánlani a szemcseméretet, és megjelölni a redundáns attribútumokat. Felgyorsítják a tervezést és a dokumentációt, de egy adatmérnöknek minden tényt, dimenziót és hierarchiát validálnia kell, mielőtt a modell elérné az éles környezetet.

Igen. ChatGPT képes csillagrendszer-terveket készíteni és kompromisszumokat elmagyarázni, miközben GitHub másodpilóta automatikusan kiegészíti az SQL-t a tény- és dimenziótáblákhoz. RevFuttatás előtt ellenőrizze a kimenetüket a helyes grain, kulcsok és illesztések szempontjából.

Foglald össze ezt a bejegyzést a következőképpen: