Depozitul de date Architectură, componente și diagramă Concepts
⚡ Rezumat inteligent
Depozitul de date ArchiTextura definește modul în care datele istorice și cumulative din mai multe surse sunt organizate în straturi și componente conectate, permițând raportare fiabilă, analiză și o singură versiune a adevărului pentru luarea deciziilor și prognoză organizațională.

Depozitul de date Concepts
A depozit de date există pentru a oferi unei companii o singură versiune a adevărului pentru luarea deciziilor și prognoză. Este un sistem informațional care deține date istorice și cumulative extrase din una sau mai multe surse.
Prin organizarea datelor pentru analiză, mai degrabă decât pentru tranzacții, un depozit de date simplifică munca de raportare și analiză a unei întregi organizații.
Caracteristicile Data Warehouse
Un depozit de date are patru caracteristici definitorii care îl diferențiază de o bază de date operațională de rutină:
- Orientat pe subiect
- Integrat
- Varianta de timp
- Ne volatil
Orientat pe subiect
Un depozit de date este orientat pe subiecte, deoarece oferă informații despre o temă, mai degrabă decât despre operațiunile curente ale unei companii. Subiectele tipice includ vânzările, marketingul și distribuția.
În loc de procesarea zilnică, depozitul de date pune accent pe modelare și analiză pentru luarea deciziilor. Acesta oferă o imagine simplă și concisă a fiecărui subiect și omite datele care nu susțin procesul decizional.
Integrat
Integrarea este strâns legată de orientarea către subiect. Într-un depozit de date, integrarea înseamnă stabilirea unei unități de măsură comune pentru toate datele similare extrase din baze de date diferite și stocarea acestor date într-un mod comun, universal acceptabil.
Un depozit de date este construit prin integrarea datelor din diverse surse, cum ar fi un mainframe, baze de date relaționale și fișiere plate. De asemenea, trebuie să respecte convenții de denumire, formate și codare consecvente.
Această consecvență în denumire, măsuri de atribute și structură de codificare este ceea ce face posibilă o analiză eficientă. Luați în considerare următorul exemplu:
În exemplul de mai sus, trei aplicații etichetate A, B și C stochează fiecare informații despre sex, dată și sold, dar fiecare aplicație le stochează într-un mod diferit:
- Aplicația A stochează câmpul de gen ca valori logice, cum ar fi M sau F.
- Aplicația B stochează câmpul de gen ca valoare numerică.
- Aplicația C stochează câmpul de gen ca valoare de caracter.
- Aceeași variație se aplică și câmpurilor Dată și Sold.
După procesul de transformare și curățare, toate aceste date sunt stocate într-un format comun în interiorul depozitului de date.
Varianta de timp
Orizontul de timp al unui depozit de date este mult mai larg decât cel al unui sistem operațional. Datele sunt recunoscute cu o anumită perioadă și oferă un punct de vedere istoric, deci poartă întotdeauna un element de timp, fie explicit, fie implicit.
Un loc în care apare această varianță temporală este în structura cheii de înregistrare. Fiecare cheie primară din depozit ar trebui să conțină un element de timp, cum ar fi ziua, săptămâna sau luna.
Un alt aspect al varianței în timp este acela că, odată ce datele sunt introduse în depozit, acestea nu pot fi actualizate sau modificate.
Ne volatil
Un depozit de date este, de asemenea, nevolatil, ceea ce înseamnă că datele anterioare nu sunt șterse atunci când sosesc date noi. Datele sunt doar pentru citire și actualizate periodic, ceea ce îi ajută pe analiști să studieze datele istorice și să înțeleagă ce s-a întâmplat și când.
Deoarece nu necesită procesarea tranzacțiilor, recuperare sau control al concurenței, un depozit de date omite activitățile de ștergere, actualizare și inserare comune într-o aplicație operațională. Doar două operațiuni de date sunt efectuate în depozitul de date:
- Încărcarea datelor
- Acces la date
Tabelul de mai jos evidențiază câteva diferențe majore dintre o aplicație operațională și un depozit de date:
| OperaAplicație națională | Depozitul de date |
|---|---|
| Programul complex trebuie să fie codificat pentru a se asigura că procesele de actualizare a datelor mențin o integritate ridicată a produsului final. | Acest tip de problemă nu se întâmplă deoarece actualizarea datelor nu se efectuează. |
| Datele sunt plasate într-o formă normalizată pentru a asigura o redundanță minimă. | Datele nu sunt stocate în formă normalizată. |
| Tehnologia necesară pentru a gestiona problemele legate de tranzacții, recuperarea datelor, revenirea la un proces anterior și rezolvarea blocajelor este destul de complexă. | Oferă o simplitate relativă în tehnologie. |
Depozitul de date Architectură
Depozitul de date ArchiStructura este complexă deoarece sistemul stochează date istorice și cumulative din mai multe surse. Există trei abordări pentru construirea straturilor de depozitare: cu un singur nivel, cu două niveluri și cu trei niveluri.
Arhitectură cu un singur nivel își propune să minimizeze cantitatea de date stocate prin eliminarea redundanței. Este rar utilizat în practică.
Arhitectură cu două niveluri separă sursele disponibile fizic de depozitul de date. Nu este ușor de extins, acceptă mai puțini utilizatori finali și se poate confrunta cu probleme de conectivitate din cauza limitărilor rețelei.
Arhitectură cu trei niveluri este cel mai utilizat design al unui depozit de date.
Se compune din nivelurile superior, mijlociu și inferior:
- Nivelul de jos: Baza de date a depozitului servește ca nivel inferior. De obicei, este un sistem de baze de date relaționale, iar datele sunt curățate, transformate și încărcate în acest nivel folosind instrumente back-end.
- Nivelul mediu: Nivelul intermediar este un server OLAP implementat folosind fie modelul ROLAP, fie modelul MOLAP. Prezintă o absoarbțietracvedere integrată a bazei de date și acționează ca mediator între utilizatorul final și baza de date.
- Nivel superior: Nivelul superior este un nivel client front-end. Acesta conține instrumentele și API-urile utilizate pentru conectarea și extragerea datelor din depozit, cum ar fi instrumente de interogare, instrumente de raportare, instrumente de interogare gestionate, instrumente de analiză și instrumente de data mining.
Componente Datawarehouse
Componentele și arhitectura generală a unui depozit de date funcționează împreună așa cum se arată în diagrama de mai jos.
Depozitul de date se bazează pe un server RDBMS, un depozit central de informații înconjurat de componente cheie care mențin întregul mediu funcțional, ușor de gestionat și accesibil.
Un depozit de date are cinci componente principale, descrise mai jos.
Baza de date Data Warehouse
Baza de date centrală este fundamentul mediului de depozitare și este implementată pe RDBMS tehnologie. Deoarece un RDBMS tradițional este optimizat pentru procesarea tranzacțiilor și nu pentru depozitare, operațiunile care consumă multe resurse, cum ar fi interogările ad-hoc, joncțiunile multi-tabel și agregatele, îl pot încetini.
Din acest motiv, se utilizează abordări alternative pentru bazele de date:
- Bazele de date relaționale sunt implementate în paralel pentru a permite scalabilitatea, utilizând modele cu memorie partajată sau fără partajare pe diverse configurații multiprocesor sau masiv paralele.
- Noile structuri de index sunt utilizate pentru a ocoli scanările tabelelor relaționale și a îmbunătăți viteza.
- Bazele de date multidimensionale (MDDB) sunt utilizate pentru a depăși limitele modelelor de depozit relațional. Un exemplu este Essbase din Oracle.
Instrumente de aprovizionare, achiziție, curățare și transformare (ETL)
Instrumentele de aprovizionare, transformare și migrare a datelor efectuează toate conversiile, sumarizările și modificările necesare pentru a transforma datele într-un format de depozit unificat. Acestea sunt numite și ExtracInstrumente t, Transformare și Încărcare (ETL).
Funcționalitatea lor include următoarele:
- Anonimizați datele conform prevederilor legale.
- Eliminați datele nedorite din bazele de date operaționale înainte de încărcarea lor în depozit.
- Căutați și înlocuiți numele și definițiile comune pentru datele care provin din surse diferite.
- Calculați rezumate și date derivate.
- Completați datele lipsă cu valori implicite.
- Deduplicați datele repetate care sosesc din mai multe surse.
Acestea Instrumente ETL poate genera cron joburi, joburi în fundal, programe Cobol și scripturi shell care reîmprospătează periodic depozitul de date și ajută la menținerea metadatelor.
Deoarece se bazează pe numeroase sisteme, instrumentele ETL trebuie să facă față și eterogenității bazelor de date și a datelor.
Metadata
Metadatele pot părea complexe, dar sunt pur și simplu date despre date care definesc depozitul. Acestea sunt folosite pentru a construi, întreține și gestiona depozitul.
În cadrul arhitecturii, metadatele specifică sursa, utilizarea, valorile și caracteristicile datelor și definesc modul în care datele pot fi modificate și procesate, astfel încât acestea să rămână strâns conectate la depozit.
De exemplu, o linie dintr-o bază de date de vânzări poate conține:
4030 KJ732 299.90
Acest lucru este lipsit de sens până când metadatele nu explică faptul că reprezintă un număr de model 4030, un ID de agent de vânzări KJ732 și o valoare totală a vânzărilor de 299.90 USD.
Prin urmare, metadatele sunt un ingredient esențial în transformarea datelor în cunoștințe și ajută la răspunsuri la întrebări precum:
- Ce tabele, atribute și chei conține depozitul?
- De unde au venit datele?
- De câte ori sunt reîncărcate datele?
- Ce transformări și curățări au fost aplicate?
Metadatele se împart în două categorii:
- Metadate tehnice: Aceasta descrie depozitul pentru proiectanții și administratorii care îl construiesc și îl administrează.
- Metadate comerciale: Acest lucru oferă utilizatorilor finali o modalitate ușoară de a înțelege informațiile stocate în depozit.
Instrumente de interogare
Un obiectiv principal al depozitării de date este de a oferi companiilor informațiile de care au nevoie pentru a lua decizii strategice, iar instrumentele de interogare reprezintă modul în care utilizatorii interacționează cu sistemul.
Aceste instrumente se împart în patru categorii:
- Instrumente de interogare și raportare
- Instrumente de dezvoltare a aplicațiilor
- Instrumente de extragere a datelor
- instrumente OLAP
Instrumente de interogare și raportare
Instrumentele de interogare și raportare se împart în două grupuri: instrumente de raportare și instrumente de interogare gestionate.
Instrumente de raportare împărțit în continuare în instrumente de raportare a producției și instrumente de scriere a rapoartelor desktop:
- Redactorii de rapoarte: Acestea sunt concepute pentru utilizatorii finali care își construiesc propriile analize.
- Raportarea producției: Acestea permit organizațiilor să genereze rapoarte operaționale regulate și să suporte joburi în lot de volum mare, cum ar fi imprimarea și calcularea. Exemple populare includ Brio, Business Objects, Oracle, PowerSoft și Institutul SAS.
Instrumente de interogare gestionate ajută utilizatorii finali prin inserarea unui meta-strat între utilizator și baza de date, care ascunde complexitatea SQL și a structurii bazei de date.
Instrumente de dezvoltare a aplicațiilor
Când instrumentele grafice și analitice încorporate nu pot satisface nevoile analitice ale unei organizații, rapoartele personalizate sunt create cu instrumente de dezvoltare a aplicațiilor.
Instrumente de extragere a datelor
Mineritul de date descoperă noi corelații, modele și tendințe semnificative în volume mari de date, iar instrumentele de minerit de date automatizează această descoperire.
Instrumente OLAP
OLAP Instrumentele sunt construite pe o bază de date multidimensională și permit utilizatorilor să analizeze datele prin intermediul unor vizualizări elaborate, multidimensionale.
Magistrala depozitului de date Architectură
Magistrala de date determină modul în care datele circulă prin depozit. Fluxul respectiv poate fi clasificat ca flux de intrare, flux ascendent, flux descendent, flux de ieșire și meta-flux.
La proiectarea magistralei, trebuie să luați în considerare dimensiunile și faptele comune care acoperă pietele de date.
Data Marts
A date mart este un strat de acces utilizat pentru a livra date utilizatorilor. Este potrivit pentru depozitele mari, deoarece necesită mai puțin timp și bani pentru a fi construit, deși nu există o definiție unică, convenită, a unui data mart.
În termeni simpli, un data mart este o filială a unui depozit de date. Acesta partiționează datele pentru un anumit grup de utilizatori și poate locui în aceeași bază de date ca și depozitul sau într-una separată fizic.
Depozitul de date ArchiCele mai bune practici tehnice
Pentru a proiecta o arhitectură solidă de depozit de date, urmați cele mai bune practici de mai jos:
- Utilizați modele de depozite de date optimizate pentru recuperarea informațiilor, fie că este vorba de dimensională, abordare denormalizată sau hibridă.
- Alegeți o abordare de design adecvată, fie de sus în jos, fie de jos în sus.
- Asigurați-vă că datele sunt procesate rapid și precis, consolidându-le totodată într-o singură versiune a adevărului.
- Proiectați cu atenție procesul de achiziție și curățare a datelor pentru depozit.
- Proiectați o arhitectură de metadate care permite partajarea metadatelor între componentele depozitului.
- Luați în considerare un Operamodelul de stocare a datelor naționale (ODS) atunci când nevoile de recuperare sunt aproape de sfârșitul bazei de datetracpiramida țiunii sau când trebuie accesate mai multe surse operaționale.
- Asigurați-vă că modelul de date este integrat, nu doar consolidat; în acest caz, utilizați un model de date 3NF, ideal și atunci când achiziționați instrumente ETL și de curățare a datelor.


