Що таке розмірне моделювання в сховищі даних? Вивчайте типи

⚡ Розумний підсумок

Вимірна модель у проектуванні сховища даних упорядковує інформацію в таблиці фактів та вимірів, щоб аналітики могли швидко отримувати та узагальнювати числові показники, дотримуючись п'ятиетапного методу Кімбалла, який визначає бізнес-процес, зернистість, виміри, факти та кінцеву схему.

  • 🎯 Основна мета: Вимірна модель налаштовує сховище даних для швидкого зчитування та звітності, на відміну від реляційних моделей, побудованих для транзакцій у режимі реального часу.
  • 🧱 Будівельні блоки: Факти містять числові виміри, тоді як виміри та їхні атрибути надають контекст хто, що та де для кожного факту.
  • 🔑 Таблиці фактів та вимірів: Таблиця фактів зберігає міри та зовнішні ключі; денормалізовані таблиці вимірів зберігають описові атрибути та ієрархії.
  • 🪜 Метод п'яти кроків: Визначте бізнес-процес, встановіть зерно, виберіть виміри, виберіть факти, а потім побудуйте схему.
  • Вибір схеми: Зіркові схеми зберігають розміри денормалізованими для швидкості, тоді як сніжинкові схеми нормалізують їх для економії місця.
  • ???? Основна перевага: Стандартизовані, зручні для бізнесу виміри підвищують продуктивність запитів і дозволяють додавати нові виміри з мінімальними перешкодами.

Вимірна модель у сховищі даних, що показує таблиці фактів та вимірів

Що таке розмірне моделювання?

Розмірне моделювання (DM) – це метод структурування даних, оптимізований для зберігання даних у сховищі даних. Його метою є налаштування бази даних для швидшого пошуку даних. Концепцію розробив Ральф Кімбалл і вона побудована навколо двох типів таблиць: таблиць «фактів» і таблиць «вимірів».

Вимірна модель у сховищі даних призначена для зчитування, узагальнення та аналізу числової інформації, такої як значення, залишки, кількість та ваги. Реляційні моделі, навпаки, оптимізовані для додавання, оновлення та видалення даних у системі обробки онлайн-транзакцій у режимі реального часу.

Кожен із цих підходів зберігає дані по-своєму, і кожен пропонує певні переваги.

У реляційній моделі моделі нормалізації та ER зменшують надлишковість даних. Натомість багатомірна модель упорядковує дані таким чином, що інформацію легше отримувати, а звіти легше створювати.

З цієї причини підходять розмірні моделі зберігання даних системи, а не реляційні системи з великою кількістю транзакцій. Оскільки модель лежить в основі ширшого архітектура сховища даних, у розділах нижче детально описано його елементи, типи та кроки проектування.

Елементи вимірювальної моделі даних

факт

Факти – це вимірювання або показники, отримані з бізнес-процесу. Наприклад, у процесі продажу квартальний показник продажів – це факт – числове значення, яке бізнес хоче проаналізувати.

Розмір

Вимір забезпечує контекст, що оточує подію бізнес-процесу. Простіше кажучи, виміри надають інформацію про те, хто, що та де відбувається у факті. Для факту «квартальний обсяг продажів» ці виміри будуть такими:

  • Хто – імена клієнтів
  • Де – Розташування
  • Що – Назва продукту

Іншими словами, вимір – це вікно, крізь яке ви бачите інформацію, що міститься у фактах.

Attributes

Атрибути – це різні характеристики виміру в межах вимірної моделі даних.

У вимірі "Місцезнаходження" атрибути можуть бути:

  • стан
  • Країна
  • Поштовий індекс

Атрибути використовуються для пошуку, фільтрації та класифікації фактів, а таблиці вимірів – це місце, де ці атрибути зберігаються.

Таблиця фактів

Таблиця фактів – це основна таблиця у вимірній моделі.

Таблиця фактів містить:

  1. Вимірювання або факти
  2. Зовнішні ключі до таблиць вимірів

Таблиця розмірів

Таблиця вимірів містить виміри факту та з'єднується з таблицею фактів через зовнішній ключ. Її основні характеристики наведено нижче:

  • Таблиці розмірності є денормалізованими таблицями.
  • Атрибути вимірів утворюють стовпці таблиці.
  • Виміри пропонують описові характеристики фактів через їхні атрибути.
  • Немає фіксованого обмеження на кількість вимірів.
  • Вимір може містити один або декілька ієрархічних зв'язків.

Типи розмірів у сховищі даних

Вимірне моделювання використовує кілька видів розмірів, кожен з яких підходить для певних потреб проектування. Основні типи вимірів у сховищі даних є:

  • Відповідний вимір
  • Розмір аутригера
  • Зменшений вимір
  • Рольовий вимір
  • Розмір до таблиці розмірів
  • Сміттєвий вимір
  • Вироджений вимір
  • Замінний розмір
  • Розмір кроку

Етапи розмірного моделювання

Точність вашого розмірного моделювання визначає успіх впровадження сховища даних. Існує п'ять кроків для побудови розмірної моделі:

  1. Визначте бізнес-процес
  2. Визначте зернистість (рівень деталізації)
  3. Визначте розміри
  4. Визначте факти
  5. Створіть схему

Загалом, готова модель повинна описувати чому, скільки, коли, де, хто і що у вашому бізнес-процесі.

П'ять кроків вимірного моделювання у сховищі даних

Крок 1) Визначте бізнес-процес

Перше завдання полягає у визначенні бізнес-процесів, які має охоплювати склад — маркетинг, продажі, управління персоналом тощо — на основі потреб організації. аналіз даних потреби та якість доступних даних. Це найважливіший крок, оскільки помилка тут призводить до каскадних, важковиправних дефектів.

Для опису бізнес-процесу можна використовувати звичайний текст, нотацію моделювання бізнес-процесів (BPMN) або уніфіковану мову моделювання (UML-).

Крок 2) Визначте зерно

Зернистість визначає рівень деталізації бізнес-проблеми — найнижчий рівень інформації, що зберігається в будь-якій таблиці.

Якщо таблиця містить дані про продажі за кожен день, вона має щоденну деталізацію; якщо вона містить щомісячні підсумки, вона має щомісячну деталізацію.

На цьому етапі ви відповідаєте на такі запитання, як:

  1. Чи слід на складі зберігати всі наявні товари чи лише кілька видів товарів? Це залежить від обраних бізнес-процесів.
  2. Чи слід зберігати дані про продажі продукції щомісяця, щотижня, щодня чи погодинно? Це залежить від звітів, які запитують керівники.
  3. Як ці два варіанти впливають на розмір бази даних?

Приклад зерна: Уявіть, що генеральний директор багатонаціональної компанії хоче бачити продажі певних продуктів у різних місцях, що вимірюються щодня.

У такому випадку зерно стає «інформацією про продаж продукції за місцем розташування щодня».

Крок 3) Визначте розміри

Виміри – це іменники, такі як дата, магазин та інвентар, і вони містять описові дані.

Наприклад, вимір дати може містити рік, місяць і день тижня.

Приклад розмірів: та сама вимога щодо щоденних продажів визначає вибір розмірів.

Для цього сценарію вимірами є Продукт, Місцезнаходження та Час.

Вимір «Продукт» містить такі атрибути, як ключ продукту (зовнішній ключ), ім'я, тип та специфікації.

Вимір «Місцезнаходження» організовано як ієрархія: країна, штат, місто, адреса та назва.

Крок 4) Визначте факти

Цей крок тісно пов'язаний з бізнес-користувачами системи, оскільки він визначає показники, які вони споживають зі сховища даних.

Більшість рядків таблиці фактів є числовими значеннями, такими як ціна або вартість за одиницю.

Приклад фактів: Вимога щодо щоденних продажів знову ж таки задає контекст.

Тут фактом є сума продажів за продуктом, за місцем розташування та за часом.

Крок 5) Створіть схему

На цьому останньому кроці ви реалізуєте розмірну модель. Схема — це просто структура бази даних — розташування таблиць — і дві схеми є особливо поширеними.

Першим з них є зіркова схема, яку легко спроектувати та назвати так за її форму: центральна таблиця фактів з таблицями вимірів, що розходяться назовні, як вершини зірки.

У зірковій схемі таблиця фактів знаходиться в третій нормальній формі, тоді як таблиці вимірів денормалізовані; це Зіркова схема в моделюванні сховищ даних Посібник працює на повному прикладі.

Другою є схема сніжинки, розширення зіркової схеми, в якій кожен вимір нормалізований і пов'язаний з подальшими таблицями вимірів, як пояснено в цьому Схема сніжинки в моделі сховища даних путівник

Правила розмірного моделювання

Наступні правила та принципи керуються ефективним розмірним моделюванням:

  • Завантажте атомарні дані у розмірні структури.
  • Створюйте розмірні моделі навколо бізнес-процесів.
  • Переконайтеся, що кожна таблиця фактів має пов'язану таблицю вимірів дат.
  • Зберігайте всі факти в одній таблиці фактів з однаковою ступенем деталізації.
  • Зберігайте мітки звітів та значення доменів фільтрів у таблицях вимірів.
  • Надайте кожній таблиці розмірностей сурогатний ключ.
  • Постійно балансуйте вимоги з реаліями, щоб забезпечити рішення, яке підтримує прийняття бізнес-рішень.

Переваги розмірного моделювання

Вимірне моделювання пропонує низку практичних переваг:

  • Стандартизовані виміри дозволяють легко та узгоджено звітувати в усіх сферах бізнесу.
  • Таблиці розмірів зберігають історію розмірної інформації.
  • Нові виміри можна вводити без суттєвих порушень у таблиці фактів.
  • Дані зберігаються для того, щоб їх було легше отримати після того, як вони потраплять до бази даних.
  • Порівняно з нормалізованою моделлю, таблиці вимірів легші для розуміння, оскільки інформація згрупована в чіткі бізнес-категорії.
  • Модель базується на бізнес-термінах, тому бізнес знає, що означає кожен факт, вимір чи атрибут.
  • Оскільки модель денормалізована, вона оптимізована для швидкого запитування, і багато реляційних платформ оптимізують свої плани виконання для неї.
  • Схема забезпечує високу продуктивність з меншою кількістю об'єднань та мінімізованою надлишковістю даних.
  • Вимірні моделі легко адаптуються до змін, оскільки стовпці можна додавати до таблиць вимірів, не впливаючи на існуючі програми бізнес-аналітики.

Що таке багатовимірна модель даних у сховищі даних?

A багатовимірна модель даних представляє дані у вигляді кубів даних, що дозволяє моделювати та переглядати дані в кількох вимірах, визначених вимірами та фактами. Така модель зазвичай організована навколо центральної теми та представлена ​​таблицею фактів, і вона формує основу OLAP аналізу.

Поширені запитання

Таблиця фактів зберігає числові показники бізнес-процесу разом із зовнішніми ключами до вимірів. Таблиця вимірів зберігає описові, денормалізовані атрибути, такі як продукт, місцезнаходження або дата, які надають цим показникам контекст, необхідний для фільтрації та групування.ping.

Факти бувають адитивними, напівадитивними або неадитивними. Адитивні факти, такі як сума продажів, підсумовуються за всіма вимірами. Напівадитивні факти, такі як залишки на рахунках, підсумовуються за деякими вимірами, але не за часом. Неадитивні факти, такі як коефіцієнти або відсотки, не можуть бути змістовно підсумовані.

A зіркова схема зберігає кожен вимір в одній денормалізованій таблиці, що забезпечує простіші об'єднання та швидші запити. Схема «сніжинка» нормалізує виміри у пов'язані підтаблиці, заощаджуючи місце для зберігання, але додаючи об'єднань та складності. Зіркові схеми є більш поширеним аналітичним вибором.

Сурогатний ключ — це ціле число, згенероване системою, яке використовується як первинний ключ виміру замість природного бізнес-ключа. Він забезпечує незалежність сховища від змін у вихідній системі, пришвидшує об'єднання та дозволяє... track історичних змін у межах виміру.

Повільно змінюваний вимір – це вимір, значення атрибутів якого змінюються з часом, наприклад, адреса клієнта. Звичайні стратегії включають перезапис старого значення (Тип 1), додавання нового рядка для збереження історії (Тип 2) або зберігання попереднього значення в окремому стовпці (Тип 3).

Вимірне моделювання Ральфа Кімбалла будує сховище даних знизу вгору на основі зіркоподібних вітрин даних, оптимізованих для звітності. Bill Підхід Inmon спочатку будує низхідний, нормалізований корпоративний склад, а потім створює вивідні вітрини. Kimball швидше у реалізації, тоді як Inmon наголошує на узгодженості в масштабах усього підприємства.

Інструменти штучного інтелекту можуть профілювати вихідні дані, пропонувати потенційні факти та виміри, рекомендувати зернистість та позначати надлишкові атрибути. Вони пришвидшують проектування та документування, але інженер даних повинен перевірити кожен факт, вимір та ієрархію, перш ніж модель потрапить у виробництво.

Так. ChatGPT може розробляти проекти зіркоподібних схем та пояснювати компроміси, водночас Копілот GitHub автозаповнення SQL для таблиць фактів та вимірів. Revперегляньте їхній вивід на наявність правильної зернистості, ключів та з'єднань, перш ніж запускати його.

Підсумуйте цей пост за допомогою: