Co to jest modelowanie wymiarowe w hurtowni danych? Naucz się typów
⚡ Inteligentne podsumowanie
Model wymiarowy w projektowaniu hurtowni danych porządkuje informacje w tabelach faktów i wymiarów, dzięki czemu analitycy mogą szybko wyszukiwać i podsumowywać miary liczbowe, stosując pięcioetapową metodę Kimballa, która identyfikuje proces biznesowy, strukturę, wymiary, fakty i ostateczny schemat.

Co to jest modelowanie wymiarowe?
Modelowanie wymiarowe (DM) to technika strukturyzacji danych zoptymalizowana pod kątem przechowywania danych w hurtowniach danych. Jej celem jest dostrojenie bazy danych w celu szybszego pobierania danych. Koncepcja została opracowana przez Ralpha Kimballa i opiera się na dwóch typach tabel: tabelach „faktów” i tabelach „wymiarów”.
Model wymiarowy w hurtowni danych służy do odczytywania, podsumowywania i analizowania informacji liczbowych, takich jak wartości, salda, liczebności i wagi. Modele relacyjne są natomiast zoptymalizowane pod kątem dodawania, aktualizowania i usuwania danych w systemie przetwarzania transakcji online w czasie rzeczywistym.
Każde z tych podejść przechowuje dane na swój własny sposób i każde oferuje odmienne korzyści.
W modelu relacyjnym modele normalizacyjne i ER redukują redundancję danych. Model wymiarowy porządkuje dane w taki sposób, aby informacje były łatwiejsze do pobrania, a raporty łatwiejsze do wygenerowania.
Z tego powodu modele wymiarowe są odpowiednie magazyn danych systemów, a nie systemów relacyjnych opartych na transakcjach. Ponieważ model ten stanowi podstawę szerszego architektura magazynu danych, poniższe sekcje szczegółowo opisują jego elementy, typy i etapy projektowania.
Elementy wymiarowego modelu danych
Fakt
Fakty to pomiary lub metryki pochodzące z procesu biznesowego. Na przykład w procesie sprzedaży kwartalna wartość sprzedaży jest faktem – wartością liczbową, którą firma chce przeanalizować.
Wymiary
Wymiar zapewnia kontekst otaczający zdarzenie procesu biznesowego. Mówiąc prościej, wymiary dostarczają informacji o tym, kto, co i gdzie dotyczy faktu. W przypadku faktu „kwartalna liczba sprzedaży” wymiary wyglądałyby następująco:
- Kto – Nazwy klientów
- Gdzie – lokalizacja
- Co – Nazwa produktu
Innymi słowy, wymiar jest oknem, przez które można przeglądać informacje zawarte w faktach.
Atrybuty
Atrybuty to różne charakterystyki wymiaru w ramach modelu danych wymiarowych.
W wymiarze Lokalizacja atrybutami mogą być:
- Miasto
- Kraj
- Kod pocztowy
Atrybuty służą do wyszukiwania, filtrowania i klasyfikowania faktów, a tabele wymiarów to miejsce, w którym te atrybuty są przechowywane.
Tabela faktów
Tabela faktów jest tabelą podstawową w modelu wymiarowym.
Tabela faktów zawiera:
- Pomiary lub fakty
- Klucze obce do tabel wymiarów
Tabela wymiarów
Tabela wymiarów przechowuje wymiary faktu i łączy się z tabelą faktów za pomocą klucza obcego. Jej główne cechy przedstawiono poniżej:
- Tabele wymiarów są tabelami zdenormalizowanymi.
- Atrybuty wymiarów tworzą kolumny tabeli.
- Wymiary poprzez swoje atrybuty opisują fakty.
- Nie ma stałego limitu liczby wymiarów.
- Wymiar może zawierać jedną lub więcej relacji hierarchicznych.
Typy wymiarów w hurtowni danych
Modelowanie wymiarowe wykorzystuje kilka rodzajów wymiarów, z których każdy jest dostosowany do konkretnych potrzeb projektowych. Główne typy wymiarów w magazynie danych należą:
- Zgodny wymiar
- Wymiar wysięgnika
- Skurczony wymiar
- Wymiar odgrywania ról
- Wymiar do tabeli wymiarów
- Śmieciowy wymiar
- zdegenerowany wymiar
- Wymienny wymiar
- Wymiar kroku
Etapy modelowania wymiarowego
Dokładność modelowania wymiarowego decyduje o powodzeniu wdrożenia magazynu danych. Budowa modelu wymiarowego składa się z pięciu kroków:
- Zidentyfikuj proces biznesowy
- Określ ziarno (poziom szczegółowości)
- Określ wymiary
- Zidentyfikuj fakty
- Zbuduj schemat
Ogólnie rzecz biorąc, ukończony model powinien opisywać dlaczego, ile, kiedy, gdzie, kto i co dzieje się w Twoim procesie biznesowym.
Krok 1) Zidentyfikuj proces biznesowy
Pierwszym zadaniem jest określenie procesu biznesowego, który powinien obejmować magazyn — marketing, sprzedaż, zasoby ludzkie itd. — na podstawie organizacji analiza danych Potrzeby i jakość dostępnych danych. To najważniejszy krok, ponieważ błąd w tym miejscu powoduje kaskadowe, trudne do naprawienia defekty.
Do opisu procesu biznesowego można użyć zwykłego tekstu, notacji Business Process Modeling Notation (BPMN) lub Unified Modelling Language (UML).
Krok 2) Zidentyfikuj ziarno
Ziarno definiuje poziom szczegółowości problemu biznesowego — najniższy poziom informacji przechowywanych w dowolnej tabeli.
Jeśli tabela zawiera dane sprzedaży z każdego dnia, ma ona dokładność dzienną; jeśli zawiera sumy miesięczne, ma ona dokładność miesięczną.
Na tym etapie odpowiadasz na pytania takie jak:
- Czy magazyn powinien przechowywać wszystkie dostępne produkty, czy tylko kilka ich rodzajów? Zależy to od wybranych procesów biznesowych.
- Czy dane o sprzedaży produktów powinny być gromadzone w ujęciu miesięcznym, tygodniowym, dziennym czy godzinowym? Zależy to od raportów żądanych przez kadrę zarządzającą.
- Jak te dwie opcje wpływają na rozmiar bazy danych?
Przykład ziarna: Wyobraź sobie, że prezes międzynarodowej firmy chce zobaczyć dane dotyczące sprzedaży konkretnych produktów w różnych lokalizacjach, mierzone każdego dnia.
W tym scenariuszu ziarno staje się „informacją o sprzedaży produktu według lokalizacji na dany dzień”.
Krok 3) Określ wymiary
Wymiary to rzeczowniki, takie jak data, sklep i inwentarz, które zawierają dane opisowe.
Na przykład wymiar daty może zawierać rok, miesiąc i dzień tygodnia.
Przykład wymiarów: te same wymagania dotyczące dziennej sprzedaży determinują wybór wymiarów.
W tym scenariuszu wymiarami są Produkt, Lokalizacja i Czas.
Wymiar produktu zawiera atrybuty takie jak klucz produktu (klucz obcy), nazwę, typ i specyfikacje.
Wymiar lokalizacji jest zorganizowany hierarchicznie: kraj, województwo, miasto, adres i nazwa.
Krok 4) Zidentyfikuj fakty
Ten krok jest ściśle związany z użytkownikami biznesowymi systemu, ponieważ definiuje dane, które pobierają z magazynu danych.
Większość wierszy tabeli faktów to wartości liczbowe, takie jak cena lub koszt jednostkowy.
Przykład faktów: wymóg codziennej sprzedaży ponownie ustala kontekst.
W tym przypadku faktem jest suma sprzedaży według produktu, lokalizacji i czasu.
Krok 5) Zbuduj schemat
W tym ostatnim kroku wdrażasz model wymiarowy. Schemat to po prostu struktura bazy danych – układ tabel – a dwa schematy są szczególnie powszechne.
Pierwszym z nich jest schemat gwiazdy, który jest łatwy do zaprojektowania i nazwany tak ze względu na swój kształt: centralna tabela faktów z tabelami wymiarów rozchodzącymi się promieniście na zewnątrz niczym ramiona gwiazdy.
W schemacie gwiazdy tabela faktów znajduje się w trzeciej postaci normalnej, natomiast tabele wymiarów są zdenormalizowane; schemat gwiazdy w modelowaniu magazynu danych Przewodnik omawia kompletny przykład.
Drugi jest schemat płatka śniegurozszerzenie schematu gwiazdy, w którym każdy wymiar jest znormalizowany i powiązany z dalszymi tabelami wymiarów, jak wyjaśniono w tym schemat płatka śniegu w modelu magazynu danych przewodnik.
Zasady modelowania wymiarowego
Poniższe zasady i reguły stanowią podstawę efektywnego modelowania wymiarowego:
- Załaduj dane atomowe do struktur wymiarowych.
- Twórz modele wymiarowe wokół procesów biznesowych.
- Upewnij się, że każda tabela faktów ma skojarzoną tabelę wymiarów daty.
- Zachowaj wszystkie fakty w jednej tabeli faktów, zachowując ten sam poziom szczegółowości.
- Przechowuj etykiety raportów i filtruj wartości domen w tabelach wymiarów.
- Przypisz każdej tabeli wymiarów klucz zastępczy.
- Ciągłe równoważenie wymagań z rzeczywistością w celu dostarczenia rozwiązania wspierającego podejmowanie decyzji biznesowych.
Korzyści z modelowania wymiarowego
Modelowanie wymiarowe oferuje szereg praktycznych korzyści:
- Standaryzowane wymiary pozwalają na łatwe i spójne raportowanie w różnych obszarach działalności.
- Tabele wymiarów przechowują historię informacji o wymiarach.
- Nowe wymiary można wprowadzać bez większych zmian w tabeli faktów.
- Dane są przechowywane w taki sposób, aby można je było łatwiej pobrać, gdy już znajdą się w bazie danych.
- W porównaniu ze znormalizowanym modelem tabele wymiarowe są łatwiejsze do zrozumienia, ponieważ informacje są pogrupowane w przejrzyste kategorie biznesowe.
- Model ten opiera się na terminologii biznesowej, dzięki czemu firma wie, co oznacza każdy fakt, wymiar lub atrybut.
- Ponieważ model jest zdenormalizowany, jest zoptymalizowany pod kątem szybkiego wykonywania zapytań, a wiele platform relacyjnych optymalizuje swoje plany wykonania pod kątem tego parametru.
- Schemat zapewnia wysoką wydajność przy mniejszej liczbie połączeń i zminimalizowanej redundancji danych.
- Modele wymiarowe z łatwością dostosowują się do zmian, ponieważ kolumny można dodawać do tabel wymiarów bez wpływu na istniejące aplikacje Business Intelligence.
Co to jest wielowymiarowy model danych w hurtowni danych?
A wielowymiarowy model danych Reprezentuje dane jako kostki danych, umożliwiając modelowanie i przeglądanie danych w kilku wymiarach zdefiniowanych przez wymiary i fakty. Taki model jest zazwyczaj zorganizowany wokół centralnego tematu i reprezentowany przez tabelę faktów, stanowiąc podstawę OLAP analiza.

