Co to jest Data Mart w hurtowni danych? Typy i przykłady

⚡ Inteligentne podsumowanie

Projekt Data Mart dostarcza skoncentrowany podzbiór informacji z magazynu danych do jednego działu, obejmujący trzy typy data mart, pięć faz od projektu do zarządzania oraz najlepsze praktyki, które zapewniają szybkość, bezpieczeństwo i opłacalność dostarczania.

  • 🎯 Definicja: Hurtownia danych to podzbiór danych zorientowany tematycznie, stworzony dla jednego działu, np. sprzedaży, marketingu, kadr lub finansów.
  • 🧩 Typy sklepów: Zależne hurtownie pobierają produkty z centralnego magazynu, niezależne hurtownie pobierają je bezpośrednio z systemów operacyjnych, a hybrydowe hurtownie łączą oba systemy.
  • ⚙️ Fazy ​​wdrażania: Proces tworzenia hurtowni danych obejmuje projektowanie, konstruowanie, wypełnianie, uzyskiwanie dostępu i zarządzanie.
  • 🔌 ETL i RDBMS: System RDBMS przechowuje dane magazynowe, podczas gdy narzędzie ETL mapuje np.tracts, transformuje, oczyszcza i ładuje dane źródłowe oraz metadane.
  • 📊 Projekt wymiarowy: Modelowanie danych wokół schematu gwiazdy przyspiesza zapytania i upraszcza raportowanie dla użytkowników biznesowych.
  • 💡 Wpływ na biznes: Mniejszy zakres oznacza szybsze zapytania, niższe koszty, ściślejszą kontrolę dostępu i szybszą dostawę niż w przypadku pełnego magazynu.
  • 🧭 Najlepsze praktyki: Ogranicz cykl dostaw do kilku tygodni, zaplanuj budżet na sprzęt i sieć oraz zaangażuj wszystkie strony zainteresowane na wczesnym etapie.

Magazyn danych w magazynie danych pokazujący zależne, niezależne i hybrydowe magazyny danych

Magazyn danych zapewnia moc analityczną hurtownia danych do jednego zespołu. Koncentrując się na jednym obszarze tematycznym, pozwala działowi szybko analizować własne dane, bez konieczności czekania na obciążenia w całym przedsiębiorstwie. Poniższe sekcje wyjaśniają, czym jest hurtownia danych, dlaczego organizacje z niej korzystają, jakie są trzy dostępne typy oraz jak ją wdrożyć i zarządzać nią.

Co to jest Marta Danych?

Hurtownia danych skupia się na pojedynczym obszarze funkcjonalnym organizacji i zawiera podzbiór danych przechowywanych w Hurtownia danychJest to skondensowana wersja magazynu danych, przeznaczona do użytku przez konkretny dział, jednostkę lub grupę użytkowników — na przykład marketing, sprzedaż, kadry lub finanse.

Ponieważ magazyn danych pełni jedną funkcję, jest zazwyczaj kontrolowany przez jeden dział w organizacji. To skupienie sprawia, że ​​jego zakres jest wąski, a właściciel jasny.

Hurtownia danych pobiera dane tylko z kilku źródeł, w przeciwieństwie do hurtowni danych, która integruje wiele. W rezultacie hurtownie danych są niewielkie i znacznie bardziej elastyczne niż pełne hurtownie danych.

Dlaczego potrzebujemy Data Mart?

Organizacje korzystają z hurtowni danych z kilku praktycznych powodów:

  • Hurtownia danych skraca czas reakcji użytkowników poprzez redukcję objętości danych, które wyszukują.
  • Zapewnia łatwy dostęp do często żądanych danych.
  • Wdrożenie hurtowni danych jest prostsze i tańsze niż wdrożenie korporacyjnego magazynu danych.
  • Jest zwinny: gdy model ulega zmianie, można szybko odbudować mniejszy magazyn danych.
  • Definicję hurtowni danych tworzy pojedynczy ekspert w danej dziedzinie, natomiast definicję hurtowni danych tworzy zespół interdyscyplinarny. Dzięki temu hurtownia danych jest bardziej podatna na zmiany.
  • Dane są partycjonowane, co umożliwia bardzo szczegółową kontrolę uprawnień dostępu.
  • Dane mogą być segmentowane i przechowywane na różnych platformach sprzętowych i programowych.

Krótko mówiąc, ponieważ hurtownia danych przetwarza mniejszy, ściśle określony wycinek danych, jej utworzenie jest szybsze, jej eksploatacja tańsza, a zabezpieczenie łatwiejsze niż w przypadku korporacyjnego magazynu danych.

Nie wszystkie hurtownie danych są jednak zbudowane w ten sam sposób. Źródło, z którego korzysta hurtownia, decyduje o tym, z którym z trzech typów hurtowni danych pracujesz.

Rodzaje Data Mart

Istnieją trzy główne typy hurtowni danych, rozróżniane w zależności od źródła danych:

  1. Zależny: Zależne hurtownie danych czerpią dane bezpośrednio ze źródeł operacyjnych, źródeł zewnętrznych lub obu.
  2. Niezależny: Tworzy się niezależny magazyn danych bez centralnego magazynu danych.
  3. Hybrydowy: Hybrydowy magazyn danych może pobierać dane z magazynów danych lub systemów operacyjnych.

Zależny dział danych

Zależny magazyn danych pobiera dane organizacji z jednego magazynu danych, co daje mu korzyść centralizacji. Jeśli potrzebujesz zbudować jeden lub więcej fizycznych magazynów danych, skonfiguruj je jako zależne magazyny danych.

Zależny magazyn danych można zbudować na dwa sposoby: jeden, w którym użytkownicy uzyskują dostęp zarówno do magazynu danych, jak i do hurtowni danych w zależności od potrzeb, oraz drugi, w którym dostęp jest ograniczony tylko do magazynu danych. Drugie podejście nie jest optymalne, ponieważ może prowadzić do powstania „śmietnika danych” – danych, które pochodzą ze wspólnego źródła, a następnie są usuwane i w dużej mierze niewykorzystywane.

Zależny magazyn danych pobierający dane z pojedynczego magazynu danych
Zależny dział danych

Niezależny Data Mart

Niezależny magazyn danych powstaje bez centralnego magazynu danych. Ten rodzaj magazynu danych jest idealnym rozwiązaniem dla mniejszych grup w organizacji.

Niezależny magazyn danych nie ma żadnego związku z korporacyjnym magazynem danych ani żadnym innym magazynem danych. Jego dane są ładowane i analizowane samodzielnie. Takie podejście jest sprzeczne z głównym celem budowy magazynu danych: spójnym, scentralizowanym magazynem danych przedsiębiorstwa, który może być analizowany przez wielu użytkowników o różnych zainteresowaniach.

Niezależny Data Mart utworzony bez centralnego magazynu danych

Niezależny Data Mart

Hybrydowy magazyn danych

Hybrydowy magazyn danych łączy dane ze źródeł spoza magazynu danych. Jest to pomocne, gdy potrzebna jest doraźna integracja — na przykład po dodaniu do organizacji nowej grupy lub produktu.

Doskonale nadaje się do środowisk z wieloma bazami danych i oferuje szybką implementację przy minimalnym nakładzie pracy związanym z oczyszczaniem danych. Hybrydowy magazyn danych obsługuje również duże struktury pamięci masowej i sprawdza się w mniejszych aplikacjach skoncentrowanych na danych.

Hybrydowy Data Mart łączący magazyn danych z innymi źródłami

Hybrydowy magazyn danych

Kroki we wdrażaniu datamartu

Pięć kroków wdrażania hurtowni danych

Kroki we wdrażaniu datamartu

Wdrożenie hurtowni danych to satysfakcjonujący, ale skomplikowany proces. Obejmuje on pięć faz – projektowanie, tworzenie, wypełnianie, uzyskiwanie dostępu i zarządzanie – każdą z nich opisano poniżej.

Projektowanie

Projektowanie to pierwszy etap wdrażania hurtowni danych. Obejmuje on wszystkie zadania, od wstępnego wniosku o hurtownię danych, przez zebranie wymagań, aż po logiczny i fizyczny projekt hurtowni danych.

Etap projektowania obejmuje następujące zadania:

  • Zbieranie wymagań biznesowych i technicznych oraz identyfikacja źródeł danych.
  • Wybór odpowiedniego podzbioru danych.
  • Projektowanie struktury logicznej i fizycznej hurtowni danych.

Dane można partycjonować na podstawie następujących kryteriów:

  • Data
  • Jednostka biznesowa lub funkcjonalna
  • geografia
  • Dowolna kombinacja powyższych

Dane można partycjonować na poziomie aplikacji lub systemu DBMS, choć partycjonowanie na poziomie aplikacji jest zalecane, ponieważ pozwala na stosowanie innego modelu danych każdego roku w miarę zmian w środowisku biznesowym. Większość hurtowni danych jest oparta na model wymiarowy, np. schemat gwiazdy, aby zapewnić szybkość zapytań.

Jakich produktów i technologii potrzebujesz?

Na tym etapie wystarczy zwykły długopis i papier. Narzędzia ułatwiające tworzenie diagramów UML lub diagramów związków encji mogą również dodawać metadane do projektów logicznych i fizycznych.

Konstruowanie

Konstruowanie to druga faza implementacji. Obejmuje ona stworzenie fizycznej bazy danych i struktur logicznych.

Ten krok obejmuje następujące zadanie:

  • Implementacja fizycznej bazy danych zaprojektowanej we wcześniejszej fazie — na przykład utworzenie obiektów schematu, takich jak tabele, indeksy i widoki.

Jakich produktów i technologii potrzebujesz?

Do zbudowania hurtowni danych potrzebny jest system zarządzania relacyjnymi bazami danych (RDBMS). System RDBMS oferuje kilka funkcji, które są niezbędne do sukcesu hurtowni danych:

  • Zarządzanie magazynem: System RDBMS przechowuje i zarządza danymi, umożliwiając tworzenie, dodawanie i usuwanie rekordów.
  • Szybki dostęp do danych: Za pomocą zapytania SQL można łatwo pobierać dane na podstawie określonych warunków lub filtrów.
  • Ochrona danych: System RDBMS potrafi odzyskać sprawność działania po awariach systemu, takich jak przerwy w dostawie prądu, a także przywrócić dane z kopii zapasowych w przypadku awarii dysku.
  • Obsługa wielu użytkowników: Umożliwia równoczesny dostęp, dzięki czemu wielu użytkowników może odczytywać i modyfikować dane bez nadpisywania zmian wprowadzanych przez innych użytkowników.
  • Bezpieczeństwo: Reguluje, którzy użytkownicy mają dostęp do poszczególnych obiektów i jakie operacje mogą wykonywać.

Zaludnianie

W trzeciej fazie dane są wprowadzane do hurtowni danych.

Etap zapełniania obejmuje następujące zadania:

  • Mapaping dane źródłowe do danych docelowych.
  • Extracting danych źródłowych.
  • Czyszczenie i transformacja danych.
  • Ładowanie danych do hurtowni danych.
  • Tworzenie i przechowywanie metadanych.

Jakich produktów i technologii potrzebujesz?

Zadania te wykonujesz za pomocą ETL (np.tracNarzędzie „t”, „Transform, Load” (przekształcanie, ładowanie). Bada źródła danych, tworzy mapę źródło-celping, a następnie extracts, przekształca, oczyszcza i ładuje dane do hurtowni danych.

Narzędzie tworzy także metadane — szczegółowe informacje na temat źródła danych, ich aktualności, wprowadzonych zmian i zastosowanego poziomu podsumowania.

dostępu

Dostęp to czwarty krok, który umożliwia wykorzystanie danych: wyszukiwanie danych, tworzenie raportów i wykresów oraz ich publikowanie. Użytkownicy końcowi przesyłają zapytania i przeglądają wyniki, często za pośrednictwem OLAP narzędzia.

Krok dostępu obejmuje następujące zadania:

  • Skonfigurowanie warstwy meta, która tłumaczy struktury baz danych i nazwy obiektów na terminy biznesowe, dzięki czemu użytkownicy bez wiedzy technicznej będą mogli łatwo uzyskać dostęp do hurtowni danych.
  • Konfigurowanie i utrzymywanie struktur baz danych.
  • Konfigurowanie interfejsów API i interfejsów, jeśli jest to wymagane.

Jakich produktów i technologii potrzebujesz?

Dostęp do hurtowni danych można uzyskać za pomocą wiersza poleceń lub interfejsu graficznego. Interfejs graficzny jest zazwyczaj preferowany, ponieważ ułatwia generowanie wykresów i jest bardziej przyjazny dla użytkownika niż wiersz poleceń.

Zarządzający

Zarządzanie to ostatnia faza procesu wdrażania hurtowni danych. Korzystając z graficznego interfejsu użytkownika (GUI) lub wiersza poleceń, zespoły realizują bieżące zadania zarządzania, takie jak:

  • Bieżące zarządzanie dostępem użytkowników.
  • Optymalizacja i dostrajanie systemu w celu uzyskania lepszej wydajności.
  • Dodawanie i zarządzanie nowymi danymi w hurtowni danych.
  • Planowanie scenariuszy odzyskiwania w celu utrzymania dostępności systemu w razie awarii.
  • Odzyskiwanie danych po awariach sprzętu i oprogramowania z zachowaniem danych.

Najlepsze praktyki wdrażania Data Marts

Stosuj się do poniższych najlepszych praktyk w całym procesie wdrażania hurtowni danych:

  • Ustrukturyzuj źródło hurtowni danych według działu.
  • Mierz cykl wdrażania w tygodniach, a nie w miesiącach czy latach.
  • Zaangażuj wszystkie strony zainteresowane w fazę planowania i projektowania, ponieważ wdrożenie hurtowni danych może być skomplikowane.
  • Dokładnie zaplanuj koszty sprzętu, oprogramowania, sieci i wdrożenia hurtowni danych.
  • Nawet jeśli hurtownia danych korzysta ze wspólnego sprzętu, może potrzebować innego oprogramowania do obsługi zapytań użytkowników; oceń zatem, jaka dodatkowa moc przetwarzania i pamięć masowa są niezbędne do uzyskania szybkich odpowiedzi.
  • Jeśli hurtownia danych znajduje się w innej lokalizacji niż magazyn danych, należy upewnić się, że przepustowość sieci jest wystarczająca do przeniesienia wymaganych wolumenów danych.
  • Budżet na czas ładowania, który rośnie w miarę wzrostu złożoności transformacji.

Zalety i wady Data Martu

Jak każdy wybór architektury, magazyn danych niesie ze sobą wyraźne korzyści, ale też pewne kompromisy.

Zalety

  • Hurtownia danych przechowuje zbiór danych obejmujący całą organizację, które są cenne dla określonej grupy użytkowników.
  • Jest to ekonomiczna alternatywa dla hurtowni danych, której stworzenie może wiązać się z dużymi kosztami.
  • Magazyn danych umożliwia szybszy dostęp do danych.
  • Jest łatwy w użyciu, ponieważ został zaprojektowany z myślą o konkretnych potrzebach użytkowników, co może przyspieszyć procesy biznesowe.
  • Implementacja hurtowni danych zajmuje mniej czasu niż jej wdrożenie w przypadku hurtowni danych, ponieważ koncentrujesz się tylko na podzbiorze danych.
  • Zawiera dane historyczne, które pomagają analitykom identyfikować trendy.

Wady

  • Przedsiębiorstwa czasami tworzą zbyt wiele rozproszonych, niepowiązanych ze sobą hurtowni danych, których utrzymanie staje się trudne.
  • Hurtownia danych nie jest w stanie zapewnić analizy danych obejmujących całą firmę, ponieważ jej zbiór danych jest ograniczony.

FAQ

A hurtownia danych to repozytorium obejmujące całe przedsiębiorstwo, obejmujące każdy temat, podczas gdy hurtownia danych przechowuje mniejszy, zorientowany tematycznie podzbiór dla jednego działu. Hurtownie danych są tańsze, szybsze w budowie i szybsze w obsłudze, ale nie mogą dostarczać analiz obejmujących całą firmę.

Hurtownia danych przechowuje ustrukturyzowane, przetworzone dane modelowane dla jednej funkcji biznesowej. Jezioro danych przechowuje surowe dane dowolnego typu – ustrukturyzowane, półustrukturyzowane lub nieustrukturyzowane – na dużą skalę. Hurtownie danych umożliwiają szybkie raportowanie; jeziora danych wspierają eksploracyjną naukę danych i uczenie maszynowe.

Większość hurtowni danych korzysta z model wymiarowy, zazwyczaj schemat gwiazdy z jedną centralną tabelą faktów połączoną z tabelami wymiarów. Schemat płatka śniegu dodatkowo normalizuje te wymiary. Oba przyspieszają zapytania i upraszczają raportowanie dla użytkowników biznesowych.

Magazyn danych sprzedażowych przechowuje dane o transakcjach klientów, przychodach i lejkach sprzedażowych dla zespołu sprzedaży. Magazyny danych marketingowych, finansowych i kadrowych działają w ten sam sposób, zapewniając każdemu działowi wstępnie zagregowane dane bez konieczności przeszukiwania całego magazynu danych przedsiębiorstwa.

Magazyn danych obsługuje OLAP, nie OLTP. Jest zoptymalizowany do odczytu, agregacji i analizy danych historycznych w raportach i pulpitach nawigacyjnych, a nie do szybkiego wprowadzania danych i aktualizacji, które obsługują transakcyjne systemy OLTP.

Magazyn danych w chmurze działa na zarządzanej platformie hurtowni danych w chmurze, a nie na serwerach lokalnych. Eliminuje on konieczność zarządzania sprzętem, skaluje pamięć masową i moc obliczeniową na żądanie i zazwyczaj rozlicza się za zapytanie, co obniża koszty i przyspiesza wdrażanie.

Narzędzia sztucznej inteligencji i uczenia maszynowego przyspieszają pracę hurtowni danych poprzez profilowanie danych źródłowych, rekomendowanie schematów i wymiarów oraz generowanie map ETLpingi sygnalizowanie problemów z jakością danych. Sugerują również strategie partycjonowania i indeksowania, choć inżynierowie powinni zapoznać się z każdym zaleceniem przed wdrożeniem go w środowisku produkcyjnym.

Tak. ChatGPT oraz Drugi pilot GitHub twórz zapytania SQL, skrypty DDL w schemacie gwiazdy i skrypty ETL z poziomu krótkiego monitu. RevPrzed uruchomieniem sprawdź poprawność nazw tabel, połączeń i struktury danych wyjściowych, ponieważ wygenerowany kod może nie uwzględniać reguł biznesowych.

Podsumuj ten post następująco: