Data Warehousing ArchiStruktur, Komponenten und Diagramm Concepts
โก Intelligente Zusammenfassung
Data Warehousing ArchiDie Tecture definiert, wie historische und kumulative Daten aus vielen Quellen in hierarchisch gestaffelte Ebenen und miteinander verbundene Komponenten organisiert werden, um zuverlรคssige Berichterstattung, Analyse und eine einheitliche Datenbasis fรผr organisatorische Entscheidungen und Prognosen zu ermรถglichen.

Data Warehousing Concepts
A Data Warehouse Es dient dazu, einem Unternehmen eine einheitliche Datenbasis fรผr Entscheidungsfindung und Prognosen zu bieten. Es handelt sich um ein Informationssystem, das historische und kumulative Daten aus einer oder mehreren Quellen enthรคlt.
Indem ein Data Warehouse diese Daten fรผr Analysen statt fรผr Transaktionen organisiert, vereinfacht es die Berichts- und Analysearbeit einer gesamten Organisation.
Merkmale des Data Warehouse
Ein Data Warehouse besitzt vier charakteristische Merkmale, die es von einer herkรถmmlichen operativen Datenbank unterscheiden:
- Subjektorientiert
- Integriert
- Zeitunterschied
- Nicht flรผchtig
Subjektorientiert
Ein Data Warehouse ist themenorientiert, da es Informationen zu einem bestimmten Thema liefert und nicht zu den laufenden Geschรคftstรคtigkeiten eines Unternehmens. Typische Themen sind Vertrieb, Marketing und Distribution.
Statt der alltรคglichen Datenverarbeitung liegt der Schwerpunkt des Data Warehouse auf Modellierung und Analyse zur Entscheidungsfindung. Es bietet eine einfache, prรคgnante รbersicht รผber jedes Thema und blendet Daten aus, die den Entscheidungsprozess nicht unterstรผtzen.
Integriert
Integration ist eng mit der Themenorientierung verknรผpft. In einem Data Warehouse bedeutet Integration, eine gemeinsame Maรeinheit fรผr alle รคhnlichen Daten aus unterschiedlichen Datenbanken festzulegen und diese Daten auf eine gemeinsame, allgemein akzeptable Weise zu speichern.
Ein Data Warehouse entsteht durch die Integration von Daten aus verschiedenen Quellen wie Mainframes, relationalen Datenbanken und Flatfiles. Dabei mรผssen auรerdem einheitliche Namenskonventionen, Formate und Codierungen eingehalten werden.
Diese Konsistenz in Benennung, Attributmessung und Kodierungsstruktur ermรถglicht eine effektive Analyse. Betrachten Sie folgendes Beispiel:
Im obigen Beispiel speichern drei Anwendungen mit den Bezeichnungen A, B und C jeweils Informationen zu Geschlecht, Datum und Kontostand, jedoch speichert jede Anwendung diese auf unterschiedliche Weise:
- Anwendung A speichert das Geschlechtsfeld als logische Werte wie M oder F.
- Anwendung B speichert das Feld โGeschlechtโ als numerischen Wert.
- Anwendung C speichert das Feld โGeschlechtโ als Zeichenwert.
- Die gleiche Variation gilt fรผr die Felder Datum und Saldo.
Nach der Transformation und Bereinigung werden alle diese Daten in einem einheitlichen Format im Data Warehouse gespeichert.
Zeitunterschied
Der Zeithorizont eines Data Warehouse ist wesentlich grรถรer als der eines operativen Systems. Die Daten werden einem bestimmten Zeitraum zugeordnet und bieten eine historische Perspektive, sodass sie immer ein Zeitelement beinhalten, sei es explizit oder implizit.
Eine Stelle, an der diese zeitliche Varianz auftritt, ist die Struktur des Datensatzschlรผssels. Jeder Primรคrschlรผssel im Data Warehouse sollte ein Zeitelement enthalten, wie beispielsweise Tag, Woche oder Monat.
Ein weiterer Aspekt der Zeitvarianz besteht darin, dass Daten, sobald sie in das Data Warehouse eingefรผgt sind, nicht mehr aktualisiert oder geรคndert werden kรถnnen.
Nicht flรผchtig
Ein Data Warehouse ist zudem nichtflรผchtig, das heiรt, รคltere Daten werden nicht gelรถscht, wenn neue Daten eintreffen. Die Daten sind schreibgeschรผtzt und werden regelmรครig aktualisiert, was Analysten hilft, historische Daten zu untersuchen und zu verstehen, was wann passiert ist.
Da ein Data Warehouse keine Transaktionsverarbeitung, Datenwiederherstellung oder Zugriffskontrolle benรถtigt, entfallen die in einer operativen Anwendung รผblichen Lรถsch-, Aktualisierungs- und Einfรผgevorgรคnge. Im Data Warehousing werden lediglich zwei Datenoperationen durchgefรผhrt:
- Daten werden geladen
- Datenzugriff
Die folgende Tabelle verdeutlicht einige wesentliche Unterschiede zwischen einer operativen Anwendung und einem Data Warehouse:
| Operationelle Anwendung | Data Warehousing |
|---|---|
| Um sicherzustellen, dass die Datenaktualisierungsprozesse die hohe Integritรคt des Endprodukts gewรคhrleisten, mรผssen komplexe Programme codiert werden. | Dieses Problem tritt nicht auf, weil keine Datenaktualisierung durchgefรผhrt wird. |
| Die Daten werden in normalisierter Form abgelegt, um minimale Redundanz zu gewรคhrleisten. | Die Daten werden nicht in normalisierter Form gespeichert. |
| Die zur Bewรคltigung von Problemen wie Transaktionen, Datenwiederherstellung, Rollback und Auflรถsung von Deadlocks benรถtigte Technologie ist recht komplex. | Es bietet eine relativ einfache Technologie. |
Data Warehousing Architektur
Data Warehousing ArchiDie Architektur ist komplex, da das System historische und kumulative Daten aus verschiedenen Quellen speichert. Es gibt drei Ansรคtze zum Aufbau der Data-Warehouse-Schichten: einschichtig, zweischichtig und dreischichtig.
Einschichtige Architektur Ziel ist es, die Menge der gespeicherten Daten durch die Beseitigung von Redundanz zu minimieren. In der Praxis wird es selten angewendet.
Zweischichtige Architektur Die physisch verfรผgbaren Datenquellen werden vom Data Warehouse getrennt. Das System ist nicht ohne Weiteres erweiterbar, unterstรผtzt weniger Endbenutzer und kann aufgrund von Netzwerkbeschrรคnkungen Verbindungsprobleme aufweisen.
Dreistufige Architektur ist das am weitesten verbreitete Design eines Data Warehouse.
Es besteht aus der oberen, mittleren und unteren Ebene:
- Untere Stufe: Die Datenbank des Data Warehouse bildet die unterste Ebene. รblicherweise handelt es sich um ein relationales Datenbanksystem, und die Daten werden mithilfe von Backend-Tools bereinigt, transformiert und in diese Ebene geladen.
- Mittlere Stufe: Die mittlere Ebene ist ein OLAP-Server, der entweder nach dem ROLAP- oder dem MOLAP-Modell implementiert ist. Er stellt eine absolute Schnittstelle dar.tracSie bietet eine Sicht auf die Datenbank und fungiert als Vermittler zwischen dem Endbenutzer und der Datenbank.
- Oberste Stufe: Die oberste Ebene ist eine Frontend-Clientschicht. Sie enthรคlt die Tools und APIs, die zum Verbinden mit dem Data Warehouse und zum Abrufen von Daten verwendet werden, wie z. B. Abfragetools, Berichtstools, Tools fรผr verwaltete Abfragen, Analysetools und Data-Mining-Tools.
Datawarehouse-Komponenten
Die Komponenten und die Gesamtarchitektur eines Data Warehouse arbeiten wie im folgenden Diagramm dargestellt zusammen.
Das Data Warehouse basiert auf einem RDBMS-Server, einem zentralen Informationsspeicher, der von Schlรผsselkomponenten umgeben ist, die dafรผr sorgen, dass die gesamte Umgebung funktionsfรคhig, verwaltbar und zugรคnglich bleibt.
Ein Data Warehouse besteht aus fรผnf Hauptkomponenten, die im Folgenden beschrieben werden.
Data Warehouse-Datenbank
Die zentrale Datenbank bildet die Grundlage der Lagerumgebung und wird implementiert auf RDBMS Technologie. Da ein traditionelles RDBMS eher auf Transaktionsverarbeitung als auf Data Warehousing ausgelegt ist, kรถnnen ressourcenintensive Operationen wie Ad-hoc-Abfragen, Joins รผber mehrere Tabellen und Aggregationen es verlangsamen.
Aus diesem Grund werden alternative Datenbankansรคtze verwendet:
- Relationale Datenbanken werden parallel eingesetzt, um Skalierbarkeit zu ermรถglichen. Dabei kommen Shared-Memory- oder Shared-Nothing-Modelle auf verschiedenen Multiprozessor- oder massiv parallelen Konfigurationen zum Einsatz.
- Neue Indexstrukturen werden verwendet, um relationale Tabellenscans zu umgehen und die Geschwindigkeit zu verbessern.
- Multidimensionale Datenbanken (MDDBs) werden eingesetzt, um die Einschrรคnkungen relationaler Data-Warehouse-Modelle zu รผberwinden. Ein Beispiel hierfรผr ist Essbase. Oracle.
Beschaffungs-, Akquisitions-, Bereinigungs- und Transformationstools (ETL)
Die Tools fรผr Datenbeschaffung, -transformation und -migration fรผhren alle Konvertierungen, Zusammenfassungen und รnderungen durch, die erforderlich sind, um Daten in ein einheitliches Warehouse-Format zu รผberfรผhren. Sie werden auch als Ex bezeichnet.tract, Transform, and Load (ETL)-Tools.
Ihre Funktionalitรคt umfasst Folgendes:
- Anonymisieren von Daten nach regulatorischen Vorgaben.
- Entfernen Sie unerwรผnschte Daten aus den operativen Datenbanken, bevor Sie diese in das Lager laden.
- Suchen und ersetzen Sie gebrรคuchliche Namen und Definitionen fรผr Daten aus verschiedenen Quellen.
- Berechnen Sie Zusammenfassungen und abgeleitete Daten.
- Fehlende Daten mit Standardwerten auffรผllen.
- Doppelte Daten aus verschiedenen Quellen entfernen.
Diese ETL-Tools kann Cronjobs, Hintergrundprozesse, Cobol-Programme und Shell-Skripte generieren, die das Data Warehouse regelmรครig aktualisieren und zur Pflege der Metadaten beitragen.
Da ETL-Tools Daten aus vielen verschiedenen Systemen abrufen, mรผssen sie auch mit der Heterogenitรคt von Datenbanken und Daten zurechtkommen.
Metadaten
Metadaten klingen vielleicht kompliziert, sind aber einfach Daten รผber Daten, die das Data Warehouse definieren. Sie dienen dem Aufbau, der Pflege und der Verwaltung des Data Warehouse.
Innerhalb der Architektur spezifizieren Metadaten die Quelle, die Verwendung, die Werte und die Merkmale der Daten und definieren, wie die Daten geรคndert und verarbeitet werden kรถnnen, sodass sie eng mit dem Data Warehouse verbunden bleiben.
Eine Zeile in einer Verkaufsdatenbank kรถnnte beispielsweise Folgendes enthalten:
4030 KJ732 299.90
Dies ist bedeutungslos, solange die Metadaten nicht erklรคren, dass es sich um die Modellnummer 4030, die Vertriebsagenten-ID KJ732 und einen Gesamtumsatz von 299.90 US-Dollar handelt.
Metadaten sind daher ein wesentlicher Bestandteil bei der Umwandlung von Daten in Wissen und helfen bei der Beantwortung von Fragen wie:
- Welche Tabellen, Attribute und Schlรผssel enthรคlt das Data Warehouse?
- Woher kamen die Daten?
- Wie oft werden die Daten neu geladen?
- Welche Transformations- und Reinigungsprozesse wurden durchgefรผhrt?
Metadaten lassen sich in zwei Kategorien einteilen:
- Technische Metadaten: Dies beschreibt das Lager fรผr die Designer und Administratoren, die es aufbauen und betreiben.
- Geschรคftsmetadaten: Dies bietet den Endnutzern eine einfache Mรถglichkeit, die im Lager gespeicherten Informationen zu verstehen.
Abfragetools
Ein Hauptziel von Data Warehousing ist es, Unternehmen die Informationen bereitzustellen, die sie fรผr strategische Entscheidungen benรถtigen, und Abfragetools sind das Mittel, mit dem Benutzer mit dem System interagieren.
Diese Werkzeuge lassen sich in vier Kategorien einteilen:
- Abfrage- und Berichterstellungstools
- Tools zur Anwendungsentwicklung
- Data-Mining-Tools
- OLAP-Tools
Abfrage- und Berichtstools
Abfrage- und Berichtswerkzeuge lassen sich in zwei Gruppen unterteilen: Berichtswerkzeuge und verwaltete Abfragewerkzeuge.
Berichterstellungstools weiter unterteilt in Produktionsberichtswerkzeuge und Desktop-Berichtsersteller:
- Berichtsverfasser: Diese sind fรผr Endnutzer konzipiert, die ihre eigenen Analysen erstellen.
- Produktionsberichterstattung: Diese ermรถglichen es Unternehmen, regelmรครig Betriebsberichte zu erstellen und umfangreiche Stapelverarbeitungsaufgaben wie Drucken und Berechnen zu unterstรผtzen. Bekannte Beispiele sind Brio und Business Objects. Oracle, PowerSoft und SAS Institute.
Verwaltete Abfragetools Die Unterstรผtzung der Endbenutzer erfolgt durch das Einfรผgen einer Metaschicht zwischen Benutzer und Datenbank, welche die Komplexitรคt von SQL und Datenbankstruktur verbirgt.
Tools zur Anwendungsentwicklung
Wenn die integrierten grafischen und analytischen Werkzeuge einer Organisation deren analytische Bedรผrfnisse nicht erfรผllen kรถnnen, werden mithilfe von Anwendungsentwicklungswerkzeugen benutzerdefinierte Berichte erstellt.
Data-Mining-Tools
Data Mining entdeckt aussagekrรคftige neue Korrelationen, Muster und Trends in groรen Datenmengen, und Data-Mining-Tools automatisieren diesen Entdeckungsprozess.
OLAP-Tools
OLAP Die Tools basieren auf einer multidimensionalen Datenbank und ermรถglichen es den Benutzern, Daten mithilfe komplexer, multidimensionaler Ansichten zu analysieren.
Data Warehouse Bus Architektur
Der Data-Warehouse-Bus bestimmt den Datenfluss innerhalb des Data Warehouse. Dieser Fluss lรคsst sich in Zufluss, Aufwรคrtsfluss, Abwรคrtsfluss, Abwรคrtsfluss und Meta-Fluss kategorisieren.
Bei der Konzeption des Busses mรผssen die gemeinsamen Dimensionen und Fakten berรผcksichtigt werden, die sich รผber Data Marts erstrecken.
Datamarts
A Datamart Ein Data Mart ist eine Zugriffsschicht, die zur Bereitstellung von Daten fรผr Benutzer dient. Er eignet sich fรผr groรe Data-Warehouses, da sein Aufbau weniger Zeit und Kosten in Anspruch nimmt, obwohl es keine einheitliche Definition fรผr einen Data Mart gibt.
Vereinfacht ausgedrรผckt ist ein Data Mart ein Teilbereich eines Data Warehouse. Er partitioniert Daten fรผr eine bestimmte Benutzergruppe und kann sich in derselben Datenbank wie das Warehouse oder in einer physisch getrennten Datenbank befinden.
Data Warehousing Archistruktur Best Practices
Um eine solide Data-Warehouse-Architektur zu entwerfen, sollten Sie die folgenden Best Practices befolgen:
- Verwenden Sie Data-Warehouse-Modelle, die fรผr den Informationsabruf optimiert sind, egal ob dimensional, denormalisierter oder hybrider Ansatz.
- Wรคhlen Sie einen geeigneten Designansatz, ob Top-Down oder Bottom-Up.
- Stellen Sie sicher, dass die Daten schnell und prรคzise verarbeitet und zu einer einzigen, verlรคsslichen Datenbasis zusammengefรผhrt werden.
- Den Datenerfassungs- und -bereinigungsprozess fรผr das Data Warehouse sorgfรคltig konzipieren.
- Entwerfen Sie eine Metadatenarchitektur, die es ermรถglicht, Metadaten zwischen den Komponenten des Data Warehouse auszutauschen.
- Betrachten Sie eine OperaNationales Datenspeichermodell (ODS), wenn die Abrufanforderungen nahe am unteren Ende der Datenabstraktion liegentraction pyramidal oder wenn auf mehrere operative Quellen zugegriffen werden muss.
- Stellen Sie sicher, dass das Datenmodell integriert und nicht nur konsolidiert wird; verwenden Sie in diesem Fall ein 3NF-Datenmodell, das sich auch ideal fรผr die Anschaffung von ETL- und Datenbereinigungstools eignet.


