Depozitul de date Architectură, componente și diagramă Concepts

⚡ Rezumat inteligent

Depozitul de date ArchiTextura definește modul în care datele istorice și cumulative din mai multe surse sunt organizate în straturi și componente conectate, permițând raportare fiabilă, analiză și o singură versiune a adevărului pentru luarea deciziilor și prognoză organizațională.

  • 🏛️ Scop principal: Un depozit de date stochează date orientate pe subiect, integrate, variante în timp și nevolatile pentru a sprijini analiza, mai degrabă decât procesarea tranzacțiilor zilnice.
  • 🧱 Design pe niveluri: ArchiStructurile variază de la modelul cu un singur nivel până la modelul cu trei niveluri, utilizat pe scară largă, al unei baze de date inferioare, un server OLAP intermediar și un strat client superior.
  • 🗄️ Baza de date principală: Depozitul central rulează pe un RDBMS, adesea extins cu baze de date paralele, noi structuri de indexare și baze de date multidimensionale pentru scalabilitate și viteză.
  • 🔄 Componente ETL: Instrumentele de aprovizionare, achiziție, curățare și transformare consolidează datele într-un format unificat și mențin depozitul actualizat.
  • 🏷️ Rolul metadatelor: Metadatele tehnice și de afaceri descriu sursa, semnificația și procesarea datelor, transformând valorile brute în cunoștințe utilizabile.
  • 📊 Instrumente de interogare și OLAP: Raportarea, interogarea gestionată, dezvoltarea de aplicații, extragerea de date și instrumentele OLAP permit utilizatorilor să exploreze depozitul de date din mai multe unghiuri.
  • Cele mai bune practici: Optimizați modelul de date pentru regăsire, consolidați într-o singură versiune a datelor și luați în considerare un model ODS sau 3NF atunci când este necesar.

Depozitul de date ArchiDiagramă structurală care prezintă nivelurile și componentele principale ale unui depozit de date

Depozitul de date Concepts

A depozit de date există pentru a oferi unei companii o singură versiune a adevărului pentru luarea deciziilor și prognoză. Este un sistem informațional care deține date istorice și cumulative extrase din una sau mai multe surse.

Prin organizarea datelor pentru analiză, mai degrabă decât pentru tranzacții, un depozit de date simplifică munca de raportare și analiză a unei întregi organizații.

Caracteristicile Data Warehouse

Un depozit de date are patru caracteristici definitorii care îl diferențiază de o bază de date operațională de rutină:

  • Orientat pe subiect
  • Integrat
  • Varianta de timp
  • Ne volatil

Orientat pe subiect

Un depozit de date este orientat pe subiecte, deoarece oferă informații despre o temă, mai degrabă decât despre operațiunile curente ale unei companii. Subiectele tipice includ vânzările, marketingul și distribuția.

În loc de procesarea zilnică, depozitul de date pune accent pe modelare și analiză pentru luarea deciziilor. Acesta oferă o imagine simplă și concisă a fiecărui subiect și omite datele care nu susțin procesul decizional.

Integrat

Integrarea este strâns legată de orientarea către subiect. Într-un depozit de date, integrarea înseamnă stabilirea unei unități de măsură comune pentru toate datele similare extrase din baze de date diferite și stocarea acestor date într-un mod comun, universal acceptabil.

Un depozit de date este construit prin integrarea datelor din diverse surse, cum ar fi un mainframe, baze de date relaționale și fișiere plate. De asemenea, trebuie să respecte convenții de denumire, formate și codare consecvente.

Această consecvență în denumire, măsuri de atribute și structură de codificare este ceea ce face posibilă o analiză eficientă. Luați în considerare următorul exemplu:

Exemplu de integrare a depozitului de date care standardizează câmpurile de gen, dată și sold din trei aplicații

În exemplul de mai sus, trei aplicații etichetate A, B și C stochează fiecare informații despre sex, dată și sold, dar fiecare aplicație le stochează într-un mod diferit:

  • Aplicația A stochează câmpul de gen ca valori logice, cum ar fi M sau F.
  • Aplicația B stochează câmpul de gen ca valoare numerică.
  • Aplicația C stochează câmpul de gen ca valoare de caracter.
  • Aceeași variație se aplică și câmpurilor Dată și Sold.

După procesul de transformare și curățare, toate aceste date sunt stocate într-un format comun în interiorul depozitului de date.

Varianta de timp

Orizontul de timp al unui depozit de date este mult mai larg decât cel al unui sistem operațional. Datele sunt recunoscute cu o anumită perioadă și oferă un punct de vedere istoric, deci poartă întotdeauna un element de timp, fie explicit, fie implicit.

Un loc în care apare această varianță temporală este în structura cheii de înregistrare. Fiecare cheie primară din depozit ar trebui să conțină un element de timp, cum ar fi ziua, săptămâna sau luna.

Un alt aspect al varianței în timp este acela că, odată ce datele sunt introduse în depozit, acestea nu pot fi actualizate sau modificate.

Ne volatil

Un depozit de date este, de asemenea, nevolatil, ceea ce înseamnă că datele anterioare nu sunt șterse atunci când sosesc date noi. Datele sunt doar pentru citire și actualizate periodic, ceea ce îi ajută pe analiști să studieze datele istorice și să înțeleagă ce s-a întâmplat și când.

Deoarece nu necesită procesarea tranzacțiilor, recuperare sau control al concurenței, un depozit de date omite activitățile de ștergere, actualizare și inserare comune într-o aplicație operațională. Doar două operațiuni de date sunt efectuate în depozitul de date:

  1. Încărcarea datelor
  2. Acces la date

Tabelul de mai jos evidențiază câteva diferențe majore dintre o aplicație operațională și un depozit de date:

OperaAplicație națională Depozitul de date
Programul complex trebuie să fie codificat pentru a se asigura că procesele de actualizare a datelor mențin o integritate ridicată a produsului final. Acest tip de problemă nu se întâmplă deoarece actualizarea datelor nu se efectuează.
Datele sunt plasate într-o formă normalizată pentru a asigura o redundanță minimă. Datele nu sunt stocate în formă normalizată.
Tehnologia necesară pentru a gestiona problemele legate de tranzacții, recuperarea datelor, revenirea la un proces anterior și rezolvarea blocajelor este destul de complexă. Oferă o simplitate relativă în tehnologie.

Depozitul de date Architectură

Depozitul de date ArchiStructura este complexă deoarece sistemul stochează date istorice și cumulative din mai multe surse. Există trei abordări pentru construirea straturilor de depozitare: cu un singur nivel, cu două niveluri și cu trei niveluri.

Arhitectură cu un singur nivel își propune să minimizeze cantitatea de date stocate prin eliminarea redundanței. Este rar utilizat în practică.

Arhitectură cu două niveluri separă sursele disponibile fizic de depozitul de date. Nu este ușor de extins, acceptă mai puțini utilizatori finali și se poate confrunta cu probleme de conectivitate din cauza limitărilor rețelei.

Arhitectură cu trei niveluri este cel mai utilizat design al unui depozit de date.

Se compune din nivelurile superior, mijlociu și inferior:

  1. Nivelul de jos: Baza de date a depozitului servește ca nivel inferior. De obicei, este un sistem de baze de date relaționale, iar datele sunt curățate, transformate și încărcate în acest nivel folosind instrumente back-end.
  2. Nivelul mediu: Nivelul intermediar este un server OLAP implementat folosind fie modelul ROLAP, fie modelul MOLAP. Prezintă o absoarbțietracvedere integrată a bazei de date și acționează ca mediator între utilizatorul final și baza de date.
  3. Nivel superior: Nivelul superior este un nivel client front-end. Acesta conține instrumentele și API-urile utilizate pentru conectarea și extragerea datelor din depozit, cum ar fi instrumente de interogare, instrumente de raportare, instrumente de interogare gestionate, instrumente de analiză și instrumente de data mining.

Componente Datawarehouse

Componentele și arhitectura generală a unui depozit de date funcționează împreună așa cum se arată în diagrama de mai jos.

Componente ale arhitecturii depozitului de date, inclusiv baze de date, instrumente ETL, metadate, instrumente de interogare și data marturi

Depozitul de date se bazează pe un server RDBMS, un depozit central de informații înconjurat de componente cheie care mențin întregul mediu funcțional, ușor de gestionat și accesibil.

Un depozit de date are cinci componente principale, descrise mai jos.

Baza de date Data Warehouse

Baza de date centrală este fundamentul mediului de depozitare și este implementată pe RDBMS tehnologie. Deoarece un RDBMS tradițional este optimizat pentru procesarea tranzacțiilor și nu pentru depozitare, operațiunile care consumă multe resurse, cum ar fi interogările ad-hoc, joncțiunile multi-tabel și agregatele, îl pot încetini.

Din acest motiv, se utilizează abordări alternative pentru bazele de date:

  • Bazele de date relaționale sunt implementate în paralel pentru a permite scalabilitatea, utilizând modele cu memorie partajată sau fără partajare pe diverse configurații multiprocesor sau masiv paralele.
  • Noile structuri de index sunt utilizate pentru a ocoli scanările tabelelor relaționale și a îmbunătăți viteza.
  • Bazele de date multidimensionale (MDDB) sunt utilizate pentru a depăși limitele modelelor de depozit relațional. Un exemplu este Essbase din Oracle.

Instrumente de aprovizionare, achiziție, curățare și transformare (ETL)

Instrumentele de aprovizionare, transformare și migrare a datelor efectuează toate conversiile, sumarizările și modificările necesare pentru a transforma datele într-un format de depozit unificat. Acestea sunt numite și ExtracInstrumente t, Transformare și Încărcare (ETL).

Funcționalitatea lor include următoarele:

  • Anonimizați datele conform prevederilor legale.
  • Eliminați datele nedorite din bazele de date operaționale înainte de încărcarea lor în depozit.
  • Căutați și înlocuiți numele și definițiile comune pentru datele care provin din surse diferite.
  • Calculați rezumate și date derivate.
  • Completați datele lipsă cu valori implicite.
  • Deduplicați datele repetate care sosesc din mai multe surse.

Acestea Instrumente ETL poate genera cron joburi, joburi în fundal, programe Cobol și scripturi shell care reîmprospătează periodic depozitul de date și ajută la menținerea metadatelor.

Deoarece se bazează pe numeroase sisteme, instrumentele ETL trebuie să facă față și eterogenității bazelor de date și a datelor.

Metadata

Metadatele pot părea complexe, dar sunt pur și simplu date despre date care definesc depozitul. Acestea sunt folosite pentru a construi, întreține și gestiona depozitul.

În cadrul arhitecturii, metadatele specifică sursa, utilizarea, valorile și caracteristicile datelor și definesc modul în care datele pot fi modificate și procesate, astfel încât acestea să rămână strâns conectate la depozit.

De exemplu, o linie dintr-o bază de date de vânzări poate conține:

4030 KJ732 299.90

Acest lucru este lipsit de sens până când metadatele nu explică faptul că reprezintă un număr de model 4030, un ID de agent de vânzări KJ732 și o valoare totală a vânzărilor de 299.90 USD.

Prin urmare, metadatele sunt un ingredient esențial în transformarea datelor în cunoștințe și ajută la răspunsuri la întrebări precum:

  • Ce tabele, atribute și chei conține depozitul?
  • De unde au venit datele?
  • De câte ori sunt reîncărcate datele?
  • Ce transformări și curățări au fost aplicate?

Metadatele se împart în două categorii:

  1. Metadate tehnice: Aceasta descrie depozitul pentru proiectanții și administratorii care îl construiesc și îl administrează.
  2. Metadate comerciale: Acest lucru oferă utilizatorilor finali o modalitate ușoară de a înțelege informațiile stocate în depozit.

Instrumente de interogare

Un obiectiv principal al depozitării de date este de a oferi companiilor informațiile de care au nevoie pentru a lua decizii strategice, iar instrumentele de interogare reprezintă modul în care utilizatorii interacționează cu sistemul.

Aceste instrumente se împart în patru categorii:

  1. Instrumente de interogare și raportare
  2. Instrumente de dezvoltare a aplicațiilor
  3. Instrumente de extragere a datelor
  4. instrumente OLAP

Instrumente de interogare și raportare

Instrumentele de interogare și raportare se împart în două grupuri: instrumente de raportare și instrumente de interogare gestionate.

Instrumente de raportare împărțit în continuare în instrumente de raportare a producției și instrumente de scriere a rapoartelor desktop:

  1. Redactorii de rapoarte: Acestea sunt concepute pentru utilizatorii finali care își construiesc propriile analize.
  2. Raportarea producției: Acestea permit organizațiilor să genereze rapoarte operaționale regulate și să suporte joburi în lot de volum mare, cum ar fi imprimarea și calcularea. Exemple populare includ Brio, Business Objects, Oracle, PowerSoft și Institutul SAS.

Instrumente de interogare gestionate ajută utilizatorii finali prin inserarea unui meta-strat între utilizator și baza de date, care ascunde complexitatea SQL și a structurii bazei de date.

Instrumente de dezvoltare a aplicațiilor

Când instrumentele grafice și analitice încorporate nu pot satisface nevoile analitice ale unei organizații, rapoartele personalizate sunt create cu instrumente de dezvoltare a aplicațiilor.

Instrumente de extragere a datelor

Mineritul de date descoperă noi corelații, modele și tendințe semnificative în volume mari de date, iar instrumentele de minerit de date automatizează această descoperire.

Instrumente OLAP

OLAP Instrumentele sunt construite pe o bază de date multidimensională și permit utilizatorilor să analizeze datele prin intermediul unor vizualizări elaborate, multidimensionale.

Magistrala depozitului de date Architectură

Magistrala de date determină modul în care datele circulă prin depozit. Fluxul respectiv poate fi clasificat ca flux de intrare, flux ascendent, flux descendent, flux de ieșire și meta-flux.

La proiectarea magistralei, trebuie să luați în considerare dimensiunile și faptele comune care acoperă pietele de date.

Data Marts

A date mart este un strat de acces utilizat pentru a livra date utilizatorilor. Este potrivit pentru depozitele mari, deoarece necesită mai puțin timp și bani pentru a fi construit, deși nu există o definiție unică, convenită, a unui data mart.

În termeni simpli, un data mart este o filială a unui depozit de date. Acesta partiționează datele pentru un anumit grup de utilizatori și poate locui în aceeași bază de date ca și depozitul sau într-una separată fizic.

Depozitul de date ArchiCele mai bune practici tehnice

Pentru a proiecta o arhitectură solidă de depozit de date, urmați cele mai bune practici de mai jos:

  • Utilizați modele de depozite de date optimizate pentru recuperarea informațiilor, fie că este vorba de dimensională, abordare denormalizată sau hibridă.
  • Alegeți o abordare de design adecvată, fie de sus în jos, fie de jos în sus.
  • Asigurați-vă că datele sunt procesate rapid și precis, consolidându-le totodată într-o singură versiune a adevărului.
  • Proiectați cu atenție procesul de achiziție și curățare a datelor pentru depozit.
  • Proiectați o arhitectură de metadate care permite partajarea metadatelor între componentele depozitului.
  • Luați în considerare un Operamodelul de stocare a datelor naționale (ODS) atunci când nevoile de recuperare sunt aproape de sfârșitul bazei de datetracpiramida țiunii sau când trebuie accesate mai multe surse operaționale.
  • Asigurați-vă că modelul de date este integrat, nu doar consolidat; în acest caz, utilizați un model de date 3NF, ideal și atunci când achiziționați instrumente ETL și de curățare a datelor.

Întrebări frecvente

O bază de date operațională gestionează inserări, actualizări și ștergeri frecvente cu tabele normalizate pentru procesarea tranzacțiilor. Un depozit de date este doar pentru citire și nevolatil, stochează date istorice în structuri denormalizate și este optimizat pentru interogare, raportare și analiză, mai degrabă decât pentru operațiuni zilnice.

Un depozit de date este un depozit la nivelul întregii întreprinderi care conține date integrate din mai multe surse. date mart este un subset mai mic axat pe un singur departament sau domeniu, cum ar fi vânzările sau finanțele, ceea ce îl face mai rapid și mai ieftin de construit și mai ușor de interogat.

Ambele sunt modele dimensionale. O schemă stea plasează un tabel central de fapte legat direct de tabele de dimensiuni denormalizate, asemănându-se cu o stea. O schemă fulg de zăpadă normalizează aceste dimensiuni în subtabele corelate. Vezi modelare dimensională pentru modul în care sunt organizate faptele și dimensiunile.

Un depozit de date în cloud este o bază de date analitică gestionată, găzduită de un furnizor, cum ar fi Amazon Tura roșie, Google BigQuery sau Snowflake. Scalează stocarea și calculul la cerere, reduce întreținerea hardware-ului și acceptă aceeași arhitectură pe niveluri și conducte ETL ca și depozitele locale.

O singură versiune a adevărului înseamnă că fiecare utilizator și raport se bazează pe un set de date consistent și integrat. Prin consolidarea și standardizarea valorilor din surse diferite, un depozit de date elimină cifrele contradictorii, astfel încât deciziile se bazează pe aceleași cifre de încredere.

ETL extracDatele ts, le transformă într-o zonă de așteptare, apoi le încarcă în depozit. ELT încarcă mai întâi datele brute și le transformă în interiorul depozitului folosind puterea sa de calcul. Aflați mai multe în Procesul ETL explicație.

Instrumentele de inteligență artificială și învățare automată sugerează modele de scheme, automatizează harta ETLping, detectează anomalii ale calității datelor și recomandă indexuri sau partiții care accelerează interogările. De asemenea, pot prognoza creșterea spațiului de stocare. Un inginer ar trebui să examineze fiecare recomandare înainte de a o aplica unui depozit de producție.

Da. Chat GPT poate redacta SQL, modele dimensionale și logică ETL dintr-o descriere, în timp ce Copilotul GitHub completează automat scripturile de transformare în editor. Validați întotdeauna schemele și interogările generate, deoarece inteligența artificială poate face referire la sintaxa sau valorile implicite învechite.

Rezumați această postare cu: