Co to jest Data Mart w hurtowni danych? Typy i przykłady
⚡ Inteligentne podsumowanie
Projekt Data Mart dostarcza skoncentrowany podzbiór informacji z magazynu danych do jednego działu, obejmujący trzy typy data mart, pięć faz od projektu do zarządzania oraz najlepsze praktyki, które zapewniają szybkość, bezpieczeństwo i opłacalność dostarczania.
Magazyn danych zapewnia moc analityczną hurtownia danych do jednego zespołu. Koncentrując się na jednym obszarze tematycznym, pozwala działowi szybko analizować własne dane, bez konieczności czekania na obciążenia w całym przedsiębiorstwie. Poniższe sekcje wyjaśniają, czym jest hurtownia danych, dlaczego organizacje z niej korzystają, jakie są trzy dostępne typy oraz jak ją wdrożyć i zarządzać nią.
Co to jest Marta Danych?
Hurtownia danych skupia się na pojedynczym obszarze funkcjonalnym organizacji i zawiera podzbiór danych przechowywanych w Hurtownia danychJest to skondensowana wersja magazynu danych, przeznaczona do użytku przez konkretny dział, jednostkę lub grupę użytkowników — na przykład marketing, sprzedaż, kadry lub finanse.
Ponieważ magazyn danych pełni jedną funkcję, jest zazwyczaj kontrolowany przez jeden dział w organizacji. To skupienie sprawia, że jego zakres jest wąski, a właściciel jasny.
Hurtownia danych pobiera dane tylko z kilku źródeł, w przeciwieństwie do hurtowni danych, która integruje wiele. W rezultacie hurtownie danych są niewielkie i znacznie bardziej elastyczne niż pełne hurtownie danych.
Dlaczego potrzebujemy Data Mart?
Organizacje korzystają z hurtowni danych z kilku praktycznych powodów:
- Hurtownia danych skraca czas reakcji użytkowników poprzez redukcję objętości danych, które wyszukują.
- Zapewnia łatwy dostęp do często żądanych danych.
- Wdrożenie hurtowni danych jest prostsze i tańsze niż wdrożenie korporacyjnego magazynu danych.
- Jest zwinny: gdy model ulega zmianie, można szybko odbudować mniejszy magazyn danych.
- Definicję hurtowni danych tworzy pojedynczy ekspert w danej dziedzinie, natomiast definicję hurtowni danych tworzy zespół interdyscyplinarny. Dzięki temu hurtownia danych jest bardziej podatna na zmiany.
- Dane są partycjonowane, co umożliwia bardzo szczegółową kontrolę uprawnień dostępu.
- Dane mogą być segmentowane i przechowywane na różnych platformach sprzętowych i programowych.
Krótko mówiąc, ponieważ hurtownia danych przetwarza mniejszy, ściśle określony wycinek danych, jej utworzenie jest szybsze, jej eksploatacja tańsza, a zabezpieczenie łatwiejsze niż w przypadku korporacyjnego magazynu danych.
Nie wszystkie hurtownie danych są jednak zbudowane w ten sam sposób. Źródło, z którego korzysta hurtownia, decyduje o tym, z którym z trzech typów hurtowni danych pracujesz.
Rodzaje Data Mart
Istnieją trzy główne typy hurtowni danych, rozróżniane w zależności od źródła danych:
- Zależny: Zależne hurtownie danych czerpią dane bezpośrednio ze źródeł operacyjnych, źródeł zewnętrznych lub obu.
- Niezależny: Tworzy się niezależny magazyn danych bez centralnego magazynu danych.
- Hybrydowy: Hybrydowy magazyn danych może pobierać dane z magazynów danych lub systemów operacyjnych.
Zależny dział danych
Zależny magazyn danych pobiera dane organizacji z jednego magazynu danych, co daje mu korzyść centralizacji. Jeśli potrzebujesz zbudować jeden lub więcej fizycznych magazynów danych, skonfiguruj je jako zależne magazyny danych.
Zależny magazyn danych można zbudować na dwa sposoby: jeden, w którym użytkownicy uzyskują dostęp zarówno do magazynu danych, jak i do hurtowni danych w zależności od potrzeb, oraz drugi, w którym dostęp jest ograniczony tylko do magazynu danych. Drugie podejście nie jest optymalne, ponieważ może prowadzić do powstania „śmietnika danych” – danych, które pochodzą ze wspólnego źródła, a następnie są usuwane i w dużej mierze niewykorzystywane.

Niezależny Data Mart
Niezależny magazyn danych powstaje bez centralnego magazynu danych. Ten rodzaj magazynu danych jest idealnym rozwiązaniem dla mniejszych grup w organizacji.
Niezależny magazyn danych nie ma żadnego związku z korporacyjnym magazynem danych ani żadnym innym magazynem danych. Jego dane są ładowane i analizowane samodzielnie. Takie podejście jest sprzeczne z głównym celem budowy magazynu danych: spójnym, scentralizowanym magazynem danych przedsiębiorstwa, który może być analizowany przez wielu użytkowników o różnych zainteresowaniach.
Hybrydowy magazyn danych
Hybrydowy magazyn danych łączy dane ze źródeł spoza magazynu danych. Jest to pomocne, gdy potrzebna jest doraźna integracja — na przykład po dodaniu do organizacji nowej grupy lub produktu.
Doskonale nadaje się do środowisk z wieloma bazami danych i oferuje szybką implementację przy minimalnym nakładzie pracy związanym z oczyszczaniem danych. Hybrydowy magazyn danych obsługuje również duże struktury pamięci masowej i sprawdza się w mniejszych aplikacjach skoncentrowanych na danych.
Kroki we wdrażaniu datamartu
Wdrożenie hurtowni danych to satysfakcjonujący, ale skomplikowany proces. Obejmuje on pięć faz – projektowanie, tworzenie, wypełnianie, uzyskiwanie dostępu i zarządzanie – każdą z nich opisano poniżej.
Projektowanie
Projektowanie to pierwszy etap wdrażania hurtowni danych. Obejmuje on wszystkie zadania, od wstępnego wniosku o hurtownię danych, przez zebranie wymagań, aż po logiczny i fizyczny projekt hurtowni danych.
Etap projektowania obejmuje następujące zadania:
- Zbieranie wymagań biznesowych i technicznych oraz identyfikacja źródeł danych.
- Wybór odpowiedniego podzbioru danych.
- Projektowanie struktury logicznej i fizycznej hurtowni danych.
Dane można partycjonować na podstawie następujących kryteriów:
- Data
- Jednostka biznesowa lub funkcjonalna
- geografia
- Dowolna kombinacja powyższych
Dane można partycjonować na poziomie aplikacji lub systemu DBMS, choć partycjonowanie na poziomie aplikacji jest zalecane, ponieważ pozwala na stosowanie innego modelu danych każdego roku w miarę zmian w środowisku biznesowym. Większość hurtowni danych jest oparta na model wymiarowy, np. schemat gwiazdy, aby zapewnić szybkość zapytań.
Jakich produktów i technologii potrzebujesz?
Na tym etapie wystarczy zwykły długopis i papier. Narzędzia ułatwiające tworzenie diagramów UML lub diagramów związków encji mogą również dodawać metadane do projektów logicznych i fizycznych.
Konstruowanie
Konstruowanie to druga faza implementacji. Obejmuje ona stworzenie fizycznej bazy danych i struktur logicznych.
Ten krok obejmuje następujące zadanie:
- Implementacja fizycznej bazy danych zaprojektowanej we wcześniejszej fazie — na przykład utworzenie obiektów schematu, takich jak tabele, indeksy i widoki.
Jakich produktów i technologii potrzebujesz?
Do zbudowania hurtowni danych potrzebny jest system zarządzania relacyjnymi bazami danych (RDBMS). System RDBMS oferuje kilka funkcji, które są niezbędne do sukcesu hurtowni danych:
- Zarządzanie magazynem: System RDBMS przechowuje i zarządza danymi, umożliwiając tworzenie, dodawanie i usuwanie rekordów.
- Szybki dostęp do danych: Za pomocą zapytania SQL można łatwo pobierać dane na podstawie określonych warunków lub filtrów.
- Ochrona danych: System RDBMS potrafi odzyskać sprawność działania po awariach systemu, takich jak przerwy w dostawie prądu, a także przywrócić dane z kopii zapasowych w przypadku awarii dysku.
- Obsługa wielu użytkowników: Umożliwia równoczesny dostęp, dzięki czemu wielu użytkowników może odczytywać i modyfikować dane bez nadpisywania zmian wprowadzanych przez innych użytkowników.
- Bezpieczeństwo: Reguluje, którzy użytkownicy mają dostęp do poszczególnych obiektów i jakie operacje mogą wykonywać.
Zaludnianie
W trzeciej fazie dane są wprowadzane do hurtowni danych.
Etap zapełniania obejmuje następujące zadania:
- Mapaping dane źródłowe do danych docelowych.
- Extracting danych źródłowych.
- Czyszczenie i transformacja danych.
- Ładowanie danych do hurtowni danych.
- Tworzenie i przechowywanie metadanych.
Jakich produktów i technologii potrzebujesz?
Zadania te wykonujesz za pomocą ETL (np.tracNarzędzie „t”, „Transform, Load” (przekształcanie, ładowanie). Bada źródła danych, tworzy mapę źródło-celping, a następnie extracts, przekształca, oczyszcza i ładuje dane do hurtowni danych.
Narzędzie tworzy także metadane — szczegółowe informacje na temat źródła danych, ich aktualności, wprowadzonych zmian i zastosowanego poziomu podsumowania.
dostępu
Dostęp to czwarty krok, który umożliwia wykorzystanie danych: wyszukiwanie danych, tworzenie raportów i wykresów oraz ich publikowanie. Użytkownicy końcowi przesyłają zapytania i przeglądają wyniki, często za pośrednictwem OLAP narzędzia.
Krok dostępu obejmuje następujące zadania:
- Skonfigurowanie warstwy meta, która tłumaczy struktury baz danych i nazwy obiektów na terminy biznesowe, dzięki czemu użytkownicy bez wiedzy technicznej będą mogli łatwo uzyskać dostęp do hurtowni danych.
- Konfigurowanie i utrzymywanie struktur baz danych.
- Konfigurowanie interfejsów API i interfejsów, jeśli jest to wymagane.
Jakich produktów i technologii potrzebujesz?
Dostęp do hurtowni danych można uzyskać za pomocą wiersza poleceń lub interfejsu graficznego. Interfejs graficzny jest zazwyczaj preferowany, ponieważ ułatwia generowanie wykresów i jest bardziej przyjazny dla użytkownika niż wiersz poleceń.
Zarządzający
Zarządzanie to ostatnia faza procesu wdrażania hurtowni danych. Korzystając z graficznego interfejsu użytkownika (GUI) lub wiersza poleceń, zespoły realizują bieżące zadania zarządzania, takie jak:
- Bieżące zarządzanie dostępem użytkowników.
- Optymalizacja i dostrajanie systemu w celu uzyskania lepszej wydajności.
- Dodawanie i zarządzanie nowymi danymi w hurtowni danych.
- Planowanie scenariuszy odzyskiwania w celu utrzymania dostępności systemu w razie awarii.
- Odzyskiwanie danych po awariach sprzętu i oprogramowania z zachowaniem danych.
Najlepsze praktyki wdrażania Data Marts
Stosuj się do poniższych najlepszych praktyk w całym procesie wdrażania hurtowni danych:
- Ustrukturyzuj źródło hurtowni danych według działu.
- Mierz cykl wdrażania w tygodniach, a nie w miesiącach czy latach.
- Zaangażuj wszystkie strony zainteresowane w fazę planowania i projektowania, ponieważ wdrożenie hurtowni danych może być skomplikowane.
- Dokładnie zaplanuj koszty sprzętu, oprogramowania, sieci i wdrożenia hurtowni danych.
- Nawet jeśli hurtownia danych korzysta ze wspólnego sprzętu, może potrzebować innego oprogramowania do obsługi zapytań użytkowników; oceń zatem, jaka dodatkowa moc przetwarzania i pamięć masowa są niezbędne do uzyskania szybkich odpowiedzi.
- Jeśli hurtownia danych znajduje się w innej lokalizacji niż magazyn danych, należy upewnić się, że przepustowość sieci jest wystarczająca do przeniesienia wymaganych wolumenów danych.
- Budżet na czas ładowania, który rośnie w miarę wzrostu złożoności transformacji.
Zalety i wady Data Martu
Jak każdy wybór architektury, magazyn danych niesie ze sobą wyraźne korzyści, ale też pewne kompromisy.
Zalety
- Hurtownia danych przechowuje zbiór danych obejmujący całą organizację, które są cenne dla określonej grupy użytkowników.
- Jest to ekonomiczna alternatywa dla hurtowni danych, której stworzenie może wiązać się z dużymi kosztami.
- Magazyn danych umożliwia szybszy dostęp do danych.
- Jest łatwy w użyciu, ponieważ został zaprojektowany z myślą o konkretnych potrzebach użytkowników, co może przyspieszyć procesy biznesowe.
- Implementacja hurtowni danych zajmuje mniej czasu niż jej wdrożenie w przypadku hurtowni danych, ponieważ koncentrujesz się tylko na podzbiorze danych.
- Zawiera dane historyczne, które pomagają analitykom identyfikować trendy.
Wady
- Przedsiębiorstwa czasami tworzą zbyt wiele rozproszonych, niepowiązanych ze sobą hurtowni danych, których utrzymanie staje się trudne.
- Hurtownia danych nie jest w stanie zapewnić analizy danych obejmujących całą firmę, ponieważ jej zbiór danych jest ograniczony.

