Data Warehousing ArchiStruktur, Komponenten und Diagramm Concepts

โšก Intelligente Zusammenfassung

Data Warehousing ArchiDie Tecture definiert, wie historische und kumulative Daten aus vielen Quellen in hierarchisch gestaffelte Ebenen und miteinander verbundene Komponenten organisiert werden, um zuverlรคssige Berichterstattung, Analyse und eine einheitliche Datenbasis fรผr organisatorische Entscheidungen und Prognosen zu ermรถglichen.

  • ๏ธ Hauptzweck: Ein Data Warehouse speichert themenbezogene, integrierte, zeitvariante und nichtflรผchtige Daten zur Unterstรผtzung von Analysen und nicht zur Verarbeitung alltรคglicher Transaktionen.
  • ๐Ÿงฑ Abgestuftes Design: ArchiDie Architekturen reichen von einschichtigen Systemen bis hin zum weit verbreiteten dreischichtigen Modell mit einer unteren Datenbank, einem mittleren OLAP-Server und einer oberen Client-Schicht.
  • ๐Ÿ—„๏ธ Kerndatenbank: Das zentrale Repository lรคuft auf einem RDBMS, das hรคufig um parallele Datenbanken, neue Indexstrukturen und mehrdimensionale Datenbanken erweitert wird, um Skalierbarkeit und Geschwindigkeit zu gewรคhrleisten.
  • ๐Ÿ”„ ETL-Komponenten: Tools fรผr Datenbeschaffung, -erwerb, -bereinigung und -transformation konsolidieren Daten in einem einheitlichen Format und halten das Data Warehouse aktuell.
  • ๐Ÿท๏ธ Rolle der Metadaten: Technische und geschรคftliche Metadaten beschreiben die Quelle, die Bedeutung und die Verarbeitung von Daten und wandeln Rohwerte in nutzbares Wissen um.
  • ๐Ÿ“Š Abfrage- und OLAP-Tools: Reporting, Managed Query, Anwendungsentwicklung, Data Mining und OLAP-Tools ermรถglichen es den Benutzern, das Data Warehouse aus verschiedenen Blickwinkeln zu erkunden.
  • โœ… Best Practices: Optimieren Sie das Datenmodell fรผr den Abruf, konsolidieren Sie es zu einer einzigen Version der Wahrheit und ziehen Sie bei Bedarf ein ODS- oder 3NF-Modell in Betracht.

Data Warehousing ArchiArchitekturdiagramm, das die Ebenen und Kernkomponenten eines Data Warehouse zeigt

Data Warehousing Concepts

A Data Warehouse Es dient dazu, einem Unternehmen eine einheitliche Datenbasis fรผr Entscheidungsfindung und Prognosen zu bieten. Es handelt sich um ein Informationssystem, das historische und kumulative Daten aus einer oder mehreren Quellen enthรคlt.

Indem ein Data Warehouse diese Daten fรผr Analysen statt fรผr Transaktionen organisiert, vereinfacht es die Berichts- und Analysearbeit einer gesamten Organisation.

Merkmale des Data Warehouse

Ein Data Warehouse besitzt vier charakteristische Merkmale, die es von einer herkรถmmlichen operativen Datenbank unterscheiden:

  • Subjektorientiert
  • Integriert
  • Zeitunterschied
  • Nicht flรผchtig

Subjektorientiert

Ein Data Warehouse ist themenorientiert, da es Informationen zu einem bestimmten Thema liefert und nicht zu den laufenden Geschรคftstรคtigkeiten eines Unternehmens. Typische Themen sind Vertrieb, Marketing und Distribution.

Statt der alltรคglichen Datenverarbeitung liegt der Schwerpunkt des Data Warehouse auf Modellierung und Analyse zur Entscheidungsfindung. Es bietet eine einfache, prรคgnante รœbersicht รผber jedes Thema und blendet Daten aus, die den Entscheidungsprozess nicht unterstรผtzen.

Integriert

Integration ist eng mit der Themenorientierung verknรผpft. In einem Data Warehouse bedeutet Integration, eine gemeinsame MaรŸeinheit fรผr alle รคhnlichen Daten aus unterschiedlichen Datenbanken festzulegen und diese Daten auf eine gemeinsame, allgemein akzeptable Weise zu speichern.

Ein Data Warehouse entsteht durch die Integration von Daten aus verschiedenen Quellen wie Mainframes, relationalen Datenbanken und Flatfiles. Dabei mรผssen auรŸerdem einheitliche Namenskonventionen, Formate und Codierungen eingehalten werden.

Diese Konsistenz in Benennung, Attributmessung und Kodierungsstruktur ermรถglicht eine effektive Analyse. Betrachten Sie folgendes Beispiel:

Beispiel fรผr die Integration eines Data Warehouse: Standardisierung der Felder Geschlecht, Datum und Kontostand aus drei Anwendungen

Im obigen Beispiel speichern drei Anwendungen mit den Bezeichnungen A, B und C jeweils Informationen zu Geschlecht, Datum und Kontostand, jedoch speichert jede Anwendung diese auf unterschiedliche Weise:

  • Anwendung A speichert das Geschlechtsfeld als logische Werte wie M oder F.
  • Anwendung B speichert das Feld โ€žGeschlechtโ€œ als numerischen Wert.
  • Anwendung C speichert das Feld โ€žGeschlechtโ€œ als Zeichenwert.
  • Die gleiche Variation gilt fรผr die Felder Datum und Saldo.

Nach der Transformation und Bereinigung werden alle diese Daten in einem einheitlichen Format im Data Warehouse gespeichert.

Zeitunterschied

Der Zeithorizont eines Data Warehouse ist wesentlich grรถรŸer als der eines operativen Systems. Die Daten werden einem bestimmten Zeitraum zugeordnet und bieten eine historische Perspektive, sodass sie immer ein Zeitelement beinhalten, sei es explizit oder implizit.

Eine Stelle, an der diese zeitliche Varianz auftritt, ist die Struktur des Datensatzschlรผssels. Jeder Primรคrschlรผssel im Data Warehouse sollte ein Zeitelement enthalten, wie beispielsweise Tag, Woche oder Monat.

Ein weiterer Aspekt der Zeitvarianz besteht darin, dass Daten, sobald sie in das Data Warehouse eingefรผgt sind, nicht mehr aktualisiert oder geรคndert werden kรถnnen.

Nicht flรผchtig

Ein Data Warehouse ist zudem nichtflรผchtig, das heiรŸt, รคltere Daten werden nicht gelรถscht, wenn neue Daten eintreffen. Die Daten sind schreibgeschรผtzt und werden regelmรครŸig aktualisiert, was Analysten hilft, historische Daten zu untersuchen und zu verstehen, was wann passiert ist.

Da ein Data Warehouse keine Transaktionsverarbeitung, Datenwiederherstellung oder Zugriffskontrolle benรถtigt, entfallen die in einer operativen Anwendung รผblichen Lรถsch-, Aktualisierungs- und Einfรผgevorgรคnge. Im Data Warehousing werden lediglich zwei Datenoperationen durchgefรผhrt:

  1. Daten werden geladen
  2. Datenzugriff

Die folgende Tabelle verdeutlicht einige wesentliche Unterschiede zwischen einer operativen Anwendung und einem Data Warehouse:

Operationelle Anwendung Data Warehousing
Um sicherzustellen, dass die Datenaktualisierungsprozesse die hohe Integritรคt des Endprodukts gewรคhrleisten, mรผssen komplexe Programme codiert werden. Dieses Problem tritt nicht auf, weil keine Datenaktualisierung durchgefรผhrt wird.
Die Daten werden in normalisierter Form abgelegt, um minimale Redundanz zu gewรคhrleisten. Die Daten werden nicht in normalisierter Form gespeichert.
Die zur Bewรคltigung von Problemen wie Transaktionen, Datenwiederherstellung, Rollback und Auflรถsung von Deadlocks benรถtigte Technologie ist recht komplex. Es bietet eine relativ einfache Technologie.

Data Warehousing Architektur

Data Warehousing ArchiDie Architektur ist komplex, da das System historische und kumulative Daten aus verschiedenen Quellen speichert. Es gibt drei Ansรคtze zum Aufbau der Data-Warehouse-Schichten: einschichtig, zweischichtig und dreischichtig.

Einschichtige Architektur Ziel ist es, die Menge der gespeicherten Daten durch die Beseitigung von Redundanz zu minimieren. In der Praxis wird es selten angewendet.

Zweischichtige Architektur Die physisch verfรผgbaren Datenquellen werden vom Data Warehouse getrennt. Das System ist nicht ohne Weiteres erweiterbar, unterstรผtzt weniger Endbenutzer und kann aufgrund von Netzwerkbeschrรคnkungen Verbindungsprobleme aufweisen.

Dreistufige Architektur ist das am weitesten verbreitete Design eines Data Warehouse.

Es besteht aus der oberen, mittleren und unteren Ebene:

  1. Untere Stufe: Die Datenbank des Data Warehouse bildet die unterste Ebene. รœblicherweise handelt es sich um ein relationales Datenbanksystem, und die Daten werden mithilfe von Backend-Tools bereinigt, transformiert und in diese Ebene geladen.
  2. Mittlere Stufe: Die mittlere Ebene ist ein OLAP-Server, der entweder nach dem ROLAP- oder dem MOLAP-Modell implementiert ist. Er stellt eine absolute Schnittstelle dar.tracSie bietet eine Sicht auf die Datenbank und fungiert als Vermittler zwischen dem Endbenutzer und der Datenbank.
  3. Oberste Stufe: Die oberste Ebene ist eine Frontend-Clientschicht. Sie enthรคlt die Tools und APIs, die zum Verbinden mit dem Data Warehouse und zum Abrufen von Daten verwendet werden, wie z. B. Abfragetools, Berichtstools, Tools fรผr verwaltete Abfragen, Analysetools und Data-Mining-Tools.

Datawarehouse-Komponenten

Die Komponenten und die Gesamtarchitektur eines Data Warehouse arbeiten wie im folgenden Diagramm dargestellt zusammen.

Architekturkomponenten fรผr Data Warehouses, einschlieรŸlich Datenbanken, ETL-Tools, Metadaten, Abfragetools und Data Marts.

Das Data Warehouse basiert auf einem RDBMS-Server, einem zentralen Informationsspeicher, der von Schlรผsselkomponenten umgeben ist, die dafรผr sorgen, dass die gesamte Umgebung funktionsfรคhig, verwaltbar und zugรคnglich bleibt.

Ein Data Warehouse besteht aus fรผnf Hauptkomponenten, die im Folgenden beschrieben werden.

Data Warehouse-Datenbank

Die zentrale Datenbank bildet die Grundlage der Lagerumgebung und wird implementiert auf RDBMS Technologie. Da ein traditionelles RDBMS eher auf Transaktionsverarbeitung als auf Data Warehousing ausgelegt ist, kรถnnen ressourcenintensive Operationen wie Ad-hoc-Abfragen, Joins รผber mehrere Tabellen und Aggregationen es verlangsamen.

Aus diesem Grund werden alternative Datenbankansรคtze verwendet:

  • Relationale Datenbanken werden parallel eingesetzt, um Skalierbarkeit zu ermรถglichen. Dabei kommen Shared-Memory- oder Shared-Nothing-Modelle auf verschiedenen Multiprozessor- oder massiv parallelen Konfigurationen zum Einsatz.
  • Neue Indexstrukturen werden verwendet, um relationale Tabellenscans zu umgehen und die Geschwindigkeit zu verbessern.
  • Multidimensionale Datenbanken (MDDBs) werden eingesetzt, um die Einschrรคnkungen relationaler Data-Warehouse-Modelle zu รผberwinden. Ein Beispiel hierfรผr ist Essbase. Oracle.

Beschaffungs-, Akquisitions-, Bereinigungs- und Transformationstools (ETL)

Die Tools fรผr Datenbeschaffung, -transformation und -migration fรผhren alle Konvertierungen, Zusammenfassungen und ร„nderungen durch, die erforderlich sind, um Daten in ein einheitliches Warehouse-Format zu รผberfรผhren. Sie werden auch als Ex bezeichnet.tract, Transform, and Load (ETL)-Tools.

Ihre Funktionalitรคt umfasst Folgendes:

  • Anonymisieren von Daten nach regulatorischen Vorgaben.
  • Entfernen Sie unerwรผnschte Daten aus den operativen Datenbanken, bevor Sie diese in das Lager laden.
  • Suchen und ersetzen Sie gebrรคuchliche Namen und Definitionen fรผr Daten aus verschiedenen Quellen.
  • Berechnen Sie Zusammenfassungen und abgeleitete Daten.
  • Fehlende Daten mit Standardwerten auffรผllen.
  • Doppelte Daten aus verschiedenen Quellen entfernen.

Diese ETL-Tools kann Cronjobs, Hintergrundprozesse, Cobol-Programme und Shell-Skripte generieren, die das Data Warehouse regelmรครŸig aktualisieren und zur Pflege der Metadaten beitragen.

Da ETL-Tools Daten aus vielen verschiedenen Systemen abrufen, mรผssen sie auch mit der Heterogenitรคt von Datenbanken und Daten zurechtkommen.

Metadaten

Metadaten klingen vielleicht kompliziert, sind aber einfach Daten รผber Daten, die das Data Warehouse definieren. Sie dienen dem Aufbau, der Pflege und der Verwaltung des Data Warehouse.

Innerhalb der Architektur spezifizieren Metadaten die Quelle, die Verwendung, die Werte und die Merkmale der Daten und definieren, wie die Daten geรคndert und verarbeitet werden kรถnnen, sodass sie eng mit dem Data Warehouse verbunden bleiben.

Eine Zeile in einer Verkaufsdatenbank kรถnnte beispielsweise Folgendes enthalten:

4030 KJ732 299.90

Dies ist bedeutungslos, solange die Metadaten nicht erklรคren, dass es sich um die Modellnummer 4030, die Vertriebsagenten-ID KJ732 und einen Gesamtumsatz von 299.90 US-Dollar handelt.

Metadaten sind daher ein wesentlicher Bestandteil bei der Umwandlung von Daten in Wissen und helfen bei der Beantwortung von Fragen wie:

  • Welche Tabellen, Attribute und Schlรผssel enthรคlt das Data Warehouse?
  • Woher kamen die Daten?
  • Wie oft werden die Daten neu geladen?
  • Welche Transformations- und Reinigungsprozesse wurden durchgefรผhrt?

Metadaten lassen sich in zwei Kategorien einteilen:

  1. Technische Metadaten: Dies beschreibt das Lager fรผr die Designer und Administratoren, die es aufbauen und betreiben.
  2. Geschรคftsmetadaten: Dies bietet den Endnutzern eine einfache Mรถglichkeit, die im Lager gespeicherten Informationen zu verstehen.

Abfragetools

Ein Hauptziel von Data Warehousing ist es, Unternehmen die Informationen bereitzustellen, die sie fรผr strategische Entscheidungen benรถtigen, und Abfragetools sind das Mittel, mit dem Benutzer mit dem System interagieren.

Diese Werkzeuge lassen sich in vier Kategorien einteilen:

  1. Abfrage- und Berichterstellungstools
  2. Tools zur Anwendungsentwicklung
  3. Data-Mining-Tools
  4. OLAP-Tools

Abfrage- und Berichtstools

Abfrage- und Berichtswerkzeuge lassen sich in zwei Gruppen unterteilen: Berichtswerkzeuge und verwaltete Abfragewerkzeuge.

Berichterstellungstools weiter unterteilt in Produktionsberichtswerkzeuge und Desktop-Berichtsersteller:

  1. Berichtsverfasser: Diese sind fรผr Endnutzer konzipiert, die ihre eigenen Analysen erstellen.
  2. Produktionsberichterstattung: Diese ermรถglichen es Unternehmen, regelmรครŸig Betriebsberichte zu erstellen und umfangreiche Stapelverarbeitungsaufgaben wie Drucken und Berechnen zu unterstรผtzen. Bekannte Beispiele sind Brio und Business Objects. Oracle, PowerSoft und SAS Institute.

Verwaltete Abfragetools Die Unterstรผtzung der Endbenutzer erfolgt durch das Einfรผgen einer Metaschicht zwischen Benutzer und Datenbank, welche die Komplexitรคt von SQL und Datenbankstruktur verbirgt.

Tools zur Anwendungsentwicklung

Wenn die integrierten grafischen und analytischen Werkzeuge einer Organisation deren analytische Bedรผrfnisse nicht erfรผllen kรถnnen, werden mithilfe von Anwendungsentwicklungswerkzeugen benutzerdefinierte Berichte erstellt.

Data-Mining-Tools

Data Mining entdeckt aussagekrรคftige neue Korrelationen, Muster und Trends in groรŸen Datenmengen, und Data-Mining-Tools automatisieren diesen Entdeckungsprozess.

OLAP-Tools

OLAP Die Tools basieren auf einer multidimensionalen Datenbank und ermรถglichen es den Benutzern, Daten mithilfe komplexer, multidimensionaler Ansichten zu analysieren.

Data Warehouse Bus Architektur

Der Data-Warehouse-Bus bestimmt den Datenfluss innerhalb des Data Warehouse. Dieser Fluss lรคsst sich in Zufluss, Aufwรคrtsfluss, Abwรคrtsfluss, Abwรคrtsfluss und Meta-Fluss kategorisieren.

Bei der Konzeption des Busses mรผssen die gemeinsamen Dimensionen und Fakten berรผcksichtigt werden, die sich รผber Data Marts erstrecken.

Datamarts

A Datamart Ein Data Mart ist eine Zugriffsschicht, die zur Bereitstellung von Daten fรผr Benutzer dient. Er eignet sich fรผr groรŸe Data-Warehouses, da sein Aufbau weniger Zeit und Kosten in Anspruch nimmt, obwohl es keine einheitliche Definition fรผr einen Data Mart gibt.

Vereinfacht ausgedrรผckt ist ein Data Mart ein Teilbereich eines Data Warehouse. Er partitioniert Daten fรผr eine bestimmte Benutzergruppe und kann sich in derselben Datenbank wie das Warehouse oder in einer physisch getrennten Datenbank befinden.

Data Warehousing Archistruktur Best Practices

Um eine solide Data-Warehouse-Architektur zu entwerfen, sollten Sie die folgenden Best Practices befolgen:

  • Verwenden Sie Data-Warehouse-Modelle, die fรผr den Informationsabruf optimiert sind, egal ob dimensional, denormalisierter oder hybrider Ansatz.
  • Wรคhlen Sie einen geeigneten Designansatz, ob Top-Down oder Bottom-Up.
  • Stellen Sie sicher, dass die Daten schnell und prรคzise verarbeitet und zu einer einzigen, verlรคsslichen Datenbasis zusammengefรผhrt werden.
  • Den Datenerfassungs- und -bereinigungsprozess fรผr das Data Warehouse sorgfรคltig konzipieren.
  • Entwerfen Sie eine Metadatenarchitektur, die es ermรถglicht, Metadaten zwischen den Komponenten des Data Warehouse auszutauschen.
  • Betrachten Sie eine OperaNationales Datenspeichermodell (ODS), wenn die Abrufanforderungen nahe am unteren Ende der Datenabstraktion liegentraction pyramidal oder wenn auf mehrere operative Quellen zugegriffen werden muss.
  • Stellen Sie sicher, dass das Datenmodell integriert und nicht nur konsolidiert wird; verwenden Sie in diesem Fall ein 3NF-Datenmodell, das sich auch ideal fรผr die Anschaffung von ETL- und Datenbereinigungstools eignet.

Hรคufig gestellte Fragen

Eine operative Datenbank verarbeitet hรคufige Einfรผgungen, Aktualisierungen und Lรถschungen mithilfe normalisierter Tabellen fรผr die Transaktionsverarbeitung. Ein Data Warehouse ist schreibgeschรผtzt und nichtflรผchtig, speichert historische Daten in denormalisierten Strukturen und ist fรผr Abfragen, Berichterstellung und Analyse optimiert, nicht jedoch fรผr den tรคglichen Betrieb.

Ein Data Warehouse ist ein unternehmensweites Repository, das integrierte Daten aus vielen Quellen enthรคlt. Datamart ist eine kleinere Teilmenge, die sich auf eine Abteilung oder ein Thema konzentriert, wie zum Beispiel Vertrieb oder Finanzen, wodurch die Erstellung schneller und kostengรผnstiger und die Abfrage einfacher wird.

Beide sind dimensionale Designs. Ein Sternschema platziert eine zentrale Faktentabelle, die direkt mit denormalisierten Dimensionstabellen verknรผpft ist und einem Stern รคhnelt. Ein Schneeflockenschema normalisiert diese Dimensionen in zugehรถrige Untertabellen. Siehe dimensionale Modellierung fรผr die Art und Weise, wie Fakten und Dimensionen organisiert sind.

Ein Cloud-Data-Warehouse ist eine verwaltete Analysedatenbank, die von einem Anbieter wie beispielsweise โ€ฆ gehostet wird. Amazon Rotverschiebung, Google BigQuery oder Snowflake. Es skaliert Speicher und Rechenleistung bedarfsgerecht, reduziert den Hardware-Wartungsaufwand und unterstรผtzt dieselbe mehrstufige Architektur und ETL-Pipelines wie lokale Data Warehouses.

Eine einheitliche Datenbasis bedeutet, dass alle Nutzer und Berichte auf einen konsistenten, integrierten Datensatz zurรผckgreifen. Durch die Konsolidierung und Standardisierung von Werten aus verschiedenen Quellen beseitigt ein Data Warehouse widersprรผchliche Zahlen, sodass Entscheidungen auf denselben, verlรคsslichen Daten beruhen.

ETL extracELT lรคdt die Rohdaten zunรคchst, transformiert sie in einem Zwischenspeicher und lรคdt sie anschlieรŸend ins Data Warehouse. ELT transformiert sie dann innerhalb des Data Warehouse mithilfe seiner Rechenleistung. Weitere Informationen finden Sie im Abschnitt [Link einfรผgen]. ETL-Prozess Erklรคrung.

KI- und Machine-Learning-Tools schlagen Schema-Designs vor und automatisieren die ETL-Zuordnung.pingSie erkennen Anomalien in der Datenqualitรคt und empfehlen Indizes oder Partitionen, die Abfragen beschleunigen. AuรŸerdem kรถnnen sie das Speicherwachstum prognostizieren. Ein Techniker sollte jede Empfehlung prรผfen, bevor sie in einem Produktivsystem angewendet wird.

Ja. ChatGPT kann SQL-Abfragen, dimensionale Modelle und ETL-Logik anhand einer Beschreibung entwerfen, GitHub-Copilot Die automatische Vervollstรคndigung von Transformationsskripten in Ihrem Editor ist ebenfalls verfรผgbar. รœberprรผfen Sie generierte Schemas und Abfragen stets, da die KI auf veraltete Syntax oder Standardwerte verweisen kann.

Fassen Sie diesen Beitrag mit folgenden Worten zusammen: