Какво е дименсионално моделиране в Data Warehouse? Научете типове

⚡ Умно обобщение

Моделът на размерите в дизайна на хранилището за данни организира информацията в таблици с факти и размери, така че анализаторите могат бързо да извличат и обобщават числови мерки, следвайки петстъпковия метод на Кимбъл, който идентифицира бизнес процеса, зърното, размерите, фактите и крайната схема.

  • 🎯 Основна цел: Многомерният модел настройва хранилището за данни за бързо четене и отчитане, за разлика от релационните модели, изградени за транзакции в реално време.
  • 🧱 Изграждащи блокове: Фактите съдържат числови мерки, докато измеренията и техните атрибути предоставят контекста кой, какво и къде около всеки факт.
  • 🔑 Таблици с факти и измерения: Таблицата с факти съхранява мерки плюс външни ключове; денормализираните таблици с измерения съхраняват описателни атрибути и йерархии.
  • 🪜 Метод от пет стъпки: Идентифицирайте бизнес процеса, задайте зърното, изберете измеренията, изберете фактите и след това изградете схемата.
  • Избор на схема: Звездните схеми поддържат размерите денормализирани за бързина, докато снежинковите схеми ги нормализират, за да спестят място за съхранение.
  • ???? Основно предимство: Стандартизираните, удобни за бизнеса измерения повишават производителността на заявките и позволяват добавянето на нови измерения с минимално прекъсване.

Размерен модел в хранилище за данни, показващ таблици с факти и измерения

Какво е дименсионално моделиране?

Дименсионално моделиране (DM) е техника за структуриране на данни, оптимизирана за съхранение на данни в хранилище за данни. Целта ѝ е да настрои базата данни за по-бързо извличане на данни. Концепцията е разработена от Ралф Кимбъл и е изградена около два типа таблици: таблици с „факти“ и таблици с „измерения“.

Многомерният модел в хранилище за данни е проектиран да чете, обобщава и анализира числова информация, като стойности, салда, бройки и тегла. Релационните модели, за разлика от тях, са оптимизирани за добавяне, актуализиране и изтриване на данни в система за онлайн обработка на транзакции в реално време.

Всеки от тези подходи съхранява данни по свой собствен начин и всеки предлага различни предимства.

В релационния модел, нормализиращите и ER моделите намаляват излишъка от данни. Вместо това, многомерният модел подрежда данните така, че информацията да е по-лесна за извличане и отчетите да са по-лесни за генериране.

Поради тази причина, размерните модели са подходящи съхранение на данни системи, а не релационни системи, силно фокусирани върху транзакции. Тъй като моделът е в основата на по-широкия архитектура на хранилището за данни, разделите по-долу разглеждат неговите елементи, видове и стъпки на проектиране.

Елементи на модела на размерните данни

факт

Фактите са измерванията или показателите, извлечени от бизнес процес. В процес на продажби, например, тримесечното число на продажбите е факт - числовата стойност, която бизнесът иска да анализира.

Измерение

Измерението предоставя контекста, който обгражда събитие в бизнес процес. Казано по-просто, измеренията предоставят информацията кой, какво и къде е даден факт. За факта „тримесечен брой продажби“ измеренията биха били:

  • Кой – Имена на клиенти
  • Къде – Местоположение
  • Какво – Име на продукта

С други думи, измерението е прозорец, през който виждате информацията, съдържаща се във фактите.

Атрибути

Атрибутите са различните характеристики на измерение в рамките на модел на данни с измерения.

В измерение „Местоположение“ атрибутите могат да бъдат:

  • Област
  • Страна
  • Пощенски код

Атрибутите се използват за търсене, филтриране и класифициране на факти, а таблиците с измерения са мястото, където се намират тези атрибути.

Таблица с факти

Таблицата с факти е основната таблица в един многомерни модели.

Таблицата с факти съдържа:

  1. Измервания или факти
  2. Външни ключове към таблици с измерения

Таблица с размери

Таблицата с измерения съдържа измеренията на факт и се свързва с таблицата с факти чрез външен ключ. Основните ѝ характеристики са изброени по-долу:

  • Таблиците с размери са денормализирани таблици.
  • Атрибутите на измеренията формират колоните на таблицата.
  • Размерите предлагат описателни характеристики на фактите чрез техните атрибути.
  • Няма фиксирано ограничение за броя на измеренията.
  • Едно измерение може да съдържа една или повече йерархични връзки.

Видове измерения в Data Warehouse

Размерното моделиране използва няколко вида размери, всеки от които е подходящ за конкретна нужда от проектиране. Основните видове измерения в хранилище за данни са:

  • Съгласувано измерение
  • Размер на аутригера
  • Свито измерение
  • Ролева игра Dimension
  • Таблица от размери към размери
  • Нежелано измерение
  • Изродено измерение
  • Сменяемо измерение
  • Измерение на стъпката

Стъпки на дименсионалното моделиране

Точността на вашето размерно моделиране определя успеха на внедряването на хранилище за данни. Има пет стъпки за изграждане на размерен модел:

  1. Идентифицирайте бизнес процеса
  2. Идентифицирайте зърнистостта (ниво на детайлност)
  3. Определете размерите
  4. Определете фактите
  5. Изграждане на схемата

Като цяло, готовият модел трябва да описва защо, колко, кога, къде, кой и какво от вашия бизнес процес.

Петте стъпки на моделиране на размери в хранилище за данни

Стъпка 1) Идентифицирайте бизнес процеса

Първата задача е да се определи бизнес процесът, който складът трябва да покрива – маркетинг, продажби, човешки ресурси и т.н. – въз основа на нуждите на организацията. Анализ на данни нуждите и качеството на наличните данни. Това е най-важната стъпка, защото грешка тук води до каскадни, трудни за отстраняване дефекти.

За да опишете бизнес процеса, можете да използвате обикновен текст, нотация за моделиране на бизнес процеси (BPMN) или унифициран език за моделиране (UML).

Стъпка 2) Идентифицирайте зърното

Зърното определя нивото на детайлност за бизнес проблема - най-ниското ниво на информация, съхранявана във всяка таблица.

Ако таблицата съдържа продажби за всеки ден, тя има дневна гранулация; ако съдържа месечни суми, тя има месечна гранулация.

По време на този етап отговаряте на въпроси като:

  1. Трябва ли складът да съхранява всички налични продукти или само няколко вида продукти? Това зависи от избраните бизнес процеси.
  2. Трябва ли продажбите на продукти да се съхраняват на месечна, седмична, дневна или почасова база? Това зависи от отчетите, които ръководителите изискват.
  3. Как тези два избора влияят на размера на базата данни?

Пример за зърно: Представете си, че изпълнителният директор на мултинационална компания иска да вижда продажбите на специфични продукти на различни места, измервани всеки ден.

В този сценарий зърното се превръща в „информация за продажба на продукти по местоположение за всеки ден“.

Стъпка 3) Идентифицирайте размерите

Размерите са съществителни имена като дата, магазин и инвентар и те съдържат описателните данни.

Например, измерението за дата може да съдържа година, месец и ден от седмицата.

Пример за размери: Същото изискване за ежедневни продажби определя избора на размери.

За този сценарий измеренията са Продукт, Местоположение и Време.

Измерението „Продукт“ съдържа атрибути като продуктов ключ (външен ключ), име, тип и спецификации.

Измерението „Местоположение“ е организирано като йерархия: държава, щат, град, адрес и име.

Стъпка 4) Определете фактите

Тази стъпка е тясно свързана с бизнес потребителите на системата, защото определя данните, които те консумират от хранилището за данни.

Повечето редове в таблицата с факти са числови стойности, като например цена или цена за единица.

Пример за факти: Изискването за дневни продажби отново задава контекста.

Тук фактът е сумата от продажбите по продукт, по местоположение и по време.

Стъпка 5) Изградете схема

В тази последна стъпка имплементирате размерния модел. Схемата е просто структурата на базата данни - подредбата на таблиците - и две схеми са особено често срещани.

Първият е звездна схема, която е лесна за проектиране и е кръстена заради формата си: централна таблица с факти с таблици с измерения, разпръснати лъчевидно навън като върховете на звезда.

В звездна схема таблицата с факти е в трета нормална форма, докато таблиците с измерения са денормализирани; това звездна схема в моделирането на хранилища за данни Ръководството работи чрез пълен пример.

Вторият е схема на снежинка, разширение на звездната схема, в която всяко измерение е нормализирано и свързано с допълнителни таблици с измерения, както е обяснено в това схема на снежинка в модел на хранилище за данни напътства.

Правила за размерно моделиране

Следните правила и принципи ръководят ефективното моделиране на размери:

  • Заредете атомни данни в размерните структури.
  • Изградете размерни модели около бизнес процесите.
  • Уверете се, че всяка таблица с факти има свързана таблица с измерения на дати.
  • Съхранявайте всички факти в една таблица с факти на едно и също ниво на детайлност.
  • Съхранявайте етикетите на отчетите и стойностите на домейните за филтриране в таблиците с измерения.
  • Дайте на всяка таблица с измерения сурогатен ключ.
  • Непрекъснато балансирайте изискванията с реалностите, за да предоставите решение, което подпомага вземането на бизнес решения.

Предимства на дименсионалното моделиране

Размерното моделиране предлага редица практически предимства:

  • Стандартизираните измерения позволяват лесно и последователно отчитане в различните области на бизнеса.
  • Таблиците с размери съхраняват историята на информацията за размерите.
  • Нови измерения могат да бъдат въведени без съществено нарушаване на таблицата с факти.
  • Данните се съхраняват така, че да е по-лесно да се извлекат, след като са в базата данни.
  • В сравнение с нормализирания модел, таблиците с размери са по-лесни за разбиране, защото информацията е групирана в ясни бизнес категории.
  • Моделът е базиран на бизнес термини, така че бизнесът знае какво означава всеки факт, измерение или атрибут.
  • Тъй като моделът е денормализиран, той е оптимизиран за бързо запитване и много релационни платформи оптимизират своите планове за изпълнение за него.
  • Схемата осигурява висока производителност с по-малко съединения и минимизирано излишък на данни.
  • Моделите с размери лесно се адаптират към промените, тъй като колоните могат да се добавят към таблиците с размери, без това да засяга съществуващите приложения за бизнес разузнаване.

Какво е многомерен модел на данни в Data Warehouse?

A многоизмерен модел на данни представя данните като кубчета данни, което ви позволява да моделирате и преглеждате данни в няколко измерения, дефинирани от измерения и факти. Такъв модел обикновено е организиран около централна тема и е представен от таблица с факти, и той формира основата на OLAP анализ.

Въпроси и Отговори

Таблицата с факти съхранява числови показатели на бизнес процес, заедно с външни ключове към измерения. Таблицата с измерения съхранява описателни, денормализирани атрибути – като продукт, местоположение или дата – които дават на тези показатели контекста, необходим за филтриране и групиране.ping.

Фактите биват адитивни, полуадитивни или неадитивни. Адитивните факти, като например сумата на продажбите, се сумират във всяко измерение. Полуадитивните факти, като например салдата по сметките, се сумират в някои измерения, но не и във времето. Неадитивните факти, като например съотношения или проценти, не могат да бъдат сумирани смислено.

A звездна схема запазва всяко измерение в една денормализирана таблица, което осигурява по-лесни съединения и по-бързи заявки. Схемата тип „снежинка“ нормализира измеренията в свързани подтаблици, спестявайки място за съхранение, но добавяйки съединения и сложност. Звездообразните схеми са по-често срещаният аналитичен избор.

Сурогатният ключ е генерирано от системата цяло число, използвано като първичен ключ на измерение, вместо естествен бизнес ключ. Той поддържа хранилището независимо от промените в изходната система, ускорява съединенията и прави възможно... track исторически промени в рамките на дадено измерение.

Бавно променящото се измерение е измерение, чиито стойности на атрибутите се променят с течение на времето, като например адрес на клиент. Често срещани стратегии са презаписване на старата стойност (Тип 1), добавяне на нов ред за запазване на историята (Тип 2) или съхраняване на предишната стойност в отделна колона (Тип 3).

Размерното моделиране на Ралф Кимбъл изгражда склада отдолу нагоре от звездообразни информационни хранилища, оптимизирани за отчитане. Bill Подходът на Inmon първо изгражда отгоре надолу, нормализиран корпоративен склад, след което извлича складове. Kimball е по-бърз за изпълнение, докато Inmon набляга на съгласуваността в цялото предприятие.

Инструментите с изкуствен интелект могат да профилират изходни данни, да предлагат кандидат-фактове и измерения, да препоръчват зърнеста структура и да маркират излишни атрибути. Те ускоряват проектирането и документирането, но инженерът по данни трябва да валидира всеки факт, измерение и йерархия, преди моделът да достигне до производство.

Да. ChatGPT може да изготвя проекти със звездни схеми и да обяснява компромиси, докато Копилот на GitHub автоматично довършва SQL за таблици с факти и измерения. RevПрегледайте изхода им за правилна зърнистост, ключове и съединения, преди да го стартирате.

Обобщете тази публикация с: