Что такое размерное моделирование в хранилище данных? Изучите типы

⚡ Умное резюме

В проектировании хранилищ данных многомерная модель организует информацию в таблицы фактов и измерений, чтобы аналитики могли быстро извлекать и обобщать числовые показатели, следуя пятиэтапному методу Кимбалла, который определяет бизнес-процесс, детализацию, измерения, факты и окончательную схему.

  • 🎯 Основная цель: В отличие от реляционных моделей, созданных для транзакций в реальном времени, многомерная модель настраивает хранилище данных для быстрого чтения и формирования отчетов.
  • 🧱 Строительные блоки: Факты содержат числовые показатели, а измерения и их атрибуты обеспечивают контекст «кто, что и где» для каждого факта.
  • 🔑 Таблицы фактов и размеров: В таблице фактов хранятся показатели и внешние ключи; в денормализованных таблицах измерений хранятся описательные атрибуты и иерархии.
  • 🪜 Пятишаговый метод: Определите бизнес-процесс, задайте детализацию, выберите измерения, выберите факты, а затем постройте схему.
  • Выбор схемы: В схемах типа «звезда» измерения денормализованы для повышения скорости, а в схемах типа «снежинка» они нормализованы для экономии места на диске.
  • 🚀 Ключевое преимущество: Стандартизированные, удобные для бизнеса измерения повышают производительность запросов и позволяют добавлять новые измерения с минимальными сбоями.

Многомерная модель в хранилище данных, отображающая таблицы фактов и измерений.

Что такое объемное моделирование?

Размерное моделирование (ДМ) Это метод структурирования данных, оптимизированный для хранения данных в хранилище данных. Его цель — оптимизировать базу данных для более быстрого извлечения данных. Концепция была разработана Ральфом Кимбаллом и основана на двух типах таблиц: «таблицах фактов» и «таблицах измерений».

Многомерная модель в хранилище данных предназначена для чтения, обобщения и анализа числовой информации, такой как значения, остатки, количества и веса. Реляционные модели, напротив, оптимизированы для добавления, обновления и удаления данных в системе обработки транзакций в режиме реального времени.

Каждый из этих подходов хранит данные по-своему, и каждый из них имеет свои distinct преимущества.

В реляционной модели нормализация и ER-модели уменьшают избыточность данных. В одномерной модели, напротив, данные упорядочиваются таким образом, чтобы информацию было легче извлекать, а отчеты — легче создавать.

По этой причине подходят размерные модели. хранилище данных а не транзакционно-ориентированные реляционные системы. Потому что эта модель лежит в основе более широкой системы. архитектура хранилища данныхВ разделах ниже подробно рассматриваются его элементы, типы и этапы проектирования.

Элементы многомерной модели данных

Факт

Факты — это измерения или показатели, полученные в ходе бизнес-процесса. Например, в процессе продаж квартальные продажи — это факт, числовое значение, которое компания хочет проанализировать.

Размеры

Измерение определяет контекст, окружающий событие бизнес-процесса. Проще говоря, измерения указывают, кто, что и где произошло. Для факта «квартальные показатели продаж» измерениями будут следующие:

  • Кто – Имена клиентов
  • Где – Местоположение
  • Что – Название продукта

Иными словами, измерение — это окно, через которое вы видите информацию, содержащуюся в фактах.

Атрибуты

Атрибуты — это различные характеристики измерения в рамках многомерной модели данных.

В измерении «Местоположение» атрибутами могут быть:

  • Область
  • Страна
  • Почтовый индекс

Атрибуты используются для поиска, фильтрации и классификации фактов, а таблицы измерений — это место, где хранятся эти атрибуты.

Таблица фактов

Таблица фактов — это основная таблица в многомерной модели.

Таблица фактов содержит:

  1. Измерения или факты
  2. Внешние ключи к таблицам измерений

Таблица размеров

Таблица измерений хранит измерения таблицы фактов и связывается с ней посредством внешнего ключа. Ее основные характеристики перечислены ниже:

  • Таблицы измерений являются денормализованными таблицами.
  • Атрибуты измерений формируют столбцы таблицы.
  • Измерения позволяют описать характеристики фактов посредством их атрибутов.
  • Нет установленного ограничения на количество измерений.
  • Измерение может содержать одно или несколько иерархических отношений.

Типы измерений в хранилище данных

В моделировании с использованием размеров применяются различные типы размеров, каждый из которых подходит для решения конкретных задач проектирования. Основные размеры... типы измерений в хранилище данных составляют:

  • Соответствующий размер
  • Размер аутригера
  • Уменьшенное измерение
  • Ролевое измерение
  • Таблица размеров
  • Мусорное измерение
  • Вырожденное измерение
  • Сменный размер
  • Размер шага

Этапы размерного моделирования

Точность вашей многомерной модели определяет успех внедрения хранилища данных. Построение многомерной модели включает пять шагов:

  1. Определить бизнес-процесс
  2. Определите тип зерна (уровень детализации).
  3. Определите размеры
  4. Определите факты
  5. Создайте схему

В целом, готовая модель должна описывать причины, объемы, сроки, места, участников и суть вашего бизнес-процесса.

Пять этапов многомерного моделирования в хранилище данных.

Шаг 1) Определите бизнес-процесс

Первая задача — определить бизнес-процессы, которые должен охватывать склад — маркетинг, продажи, управление персоналом и так далее — исходя из специфики организации. анализ данных потребности и качество доступных данных. Это самый важный шаг, поскольку ошибка на этом этапе приводит к каскадным, трудноисправимым проблемам.

Для описания бизнес-процесса можно использовать простой текст, нотацию моделирования бизнес-процессов (BPMN) или унифицированный язык моделирования (UML).UML-).

Шаг 2) Определите зерно

Зернистость определяет уровень детализации бизнес-задачи — самый низкий уровень информации, хранящейся в любой таблице.

Если таблица содержит данные о продажах за каждый день, она имеет ежедневную детализацию; если она содержит месячные итоги, она имеет месячную детализацию.

На этом этапе вы отвечаете на такие вопросы, как:

  1. Следует ли хранить на складе все имеющиеся товары или только некоторые виды продукции? Это зависит от выбранных бизнес-процессов.
  2. Следует ли хранить данные о продажах продукции ежемесячно, еженедельно, ежедневно или ежечасно? Это зависит от того, какие отчеты запрашивают руководители.
  3. Как эти два варианта влияют на размер базы данных?

Пример зерна: Представьте, что генеральный директор многонациональной компании хочет ежедневно отслеживать продажи конкретных товаров в разных регионах.

В этом случае зерно превращается в «информацию о продажах продукции по местоположению за каждый день».

Шаг 3) Определите размеры

Измерения — это существительные, такие как дата, магазин и инвентарь, и они содержат описательные данные.

Например, измерение даты может содержать год, месяц и день недели.

Пример размеров: Тот же самый показатель ежедневного объема продаж определяет выбор габаритов.

В данном сценарии параметрами являются продукт, местоположение и время.

В измерении "Продукт" содержатся такие атрибуты, как ключ продукта (внешний ключ), название, тип и характеристики.

В параметре «Местоположение» представлена ​​иерархическая структура: страна, штат, город, адрес и название.

Шаг 4) Определите факты

Этот этап тесно связан с бизнес-пользователями системы, поскольку он определяет, какие данные они будут получать из хранилища данных.

Большинство строк в таблицах фактов содержат числовые значения, такие как цена или себестоимость единицы продукции.

Пример фактов: Требование к ежедневным продажам снова задает контекст.

В данном случае речь идет о сумме продаж по товарам, по местоположению и по времени.

Шаг 5) Постройте схему

На этом заключительном этапе вы реализуете многомерную модель. Схема — это просто структура базы данных, то есть расположение таблиц, и особенно распространены две схемы.

Первый схема звезды, которую легко спроектировать, и которая названа так из-за своей формы: центральная таблица фактов с таблицами измерений, расходящимися наружу, подобно вершинам звезды.

В звездообразной схеме таблица фактов находится в третьей нормальной форме, в то время как таблицы измерений денормализованы; Звездная схема в моделировании хранилища данных В руководстве представлен полный пример.

Второй является схема снежинкиЭто расширение звездообразной схемы, в которой каждое измерение нормализовано и связано с другими таблицами измерений, как объяснено в этом документе. Схема «снежинка» в модели хранилища данных руководства.

Правила размерного моделирования

Для эффективного моделирования размерностей используются следующие правила и принципы:

  • Загрузите атомные данные в трехмерные структуры.
  • Создавайте многомерные модели бизнес-процессов.
  • Убедитесь, что каждая таблица фактов имеет связанную с ней таблицу измерений дат.
  • Все факты должны быть представлены в одной таблице с одинаковым уровнем детализации.
  • Сохраняйте метки отчетов и значения доменов фильтров в таблицах измерений.
  • Присвойте каждой таблице измерений суррогатный ключ.
  • Необходимо постоянно балансировать требования с реальностью, чтобы предложить решение, поддерживающее принятие бизнес-решений.

Преимущества размерного моделирования

Многомерное моделирование предоставляет ряд практических преимуществ:

  • Стандартизированные параметры позволяют легко и согласованно формировать отчеты по всем направлениям бизнеса.
  • Таблицы измерений хранят историю информации о измерениях.
  • Новые параметры можно вводить без существенного нарушения структуры таблицы фактов.
  • Данные хранятся таким образом, чтобы их было легче извлечь после того, как они окажутся в базе данных.
  • По сравнению с нормализованной моделью, многомерные таблицы проще для понимания, поскольку информация сгруппирована в четкие бизнес-категории.
  • Модель основана на бизнес-терминах, поэтому компания понимает, что означает каждый факт, параметр или атрибут.
  • Поскольку модель денормализована, она оптимизирована для быстрой обработки запросов, и многие реляционные платформы оптимизируют свои планы выполнения именно для неё.
  • Данная схема обеспечивает высокую производительность за счет меньшего количества объединений и минимизации избыточности данных.
  • Многомерные модели легко адаптируются к изменениям, поскольку столбцы можно добавлять в таблицы измерений без влияния на существующие приложения бизнес-аналитики.

Что такое многомерная модель данных в хранилище данных?

A многомерная модель данных Модель представляет данные в виде кубов данных, позволяя моделировать и просматривать данные в нескольких измерениях, определяемых измерениями и фактами. Такая модель обычно организуется вокруг центральной темы и представляется таблицей фактов, и она составляет основу OLAP анализа.

Часто задаваемые вопросы (FAQ)

В таблице фактов хранятся числовые показатели бизнес-процесса, а также внешние ключи к измерениям. В таблице измерений хранятся описательные, денормализованные атрибуты — такие как продукт, местоположение или дата — которые придают этим показателям контекст, необходимый для фильтрации и группировки.ping.

Факты бывают аддитивными, полуаддитивными или неаддитивными. Аддитивные факты, такие как сумма продаж, суммируются по всем параметрам. Полуаддитивные факты, такие как остатки на счетах, суммируются по некоторым параметрам, но не по времени. Неаддитивные факты, такие как коэффициенты или проценты, не могут быть осмысленно суммированы.

A схема звезды Схема «снежинка» хранит каждое измерение в одной денормализованной таблице, что упрощает соединения и ускоряет запросы. Схема «снежинка» нормализует измерения в связанные подтаблицы, экономя место для хранения, но увеличивая количество соединений и сложность. Звездные схемы являются более распространенным аналитическим выбором.

Суррогатный ключ — это сгенерированное системой целое число, используемое в качестве первичного ключа измерения вместо естественного бизнес-ключа. Он обеспечивает независимость хранилища данных от изменений в исходной системе, ускоряет операции объединения и позволяет... track — исторические изменения в пределах одного измерения.

Медленно изменяющееся измерение — это измерение, значения атрибутов которого меняются со временем, например, адрес клиента. Распространенные стратегии включают перезапись старого значения (тип 1), добавление новой строки для сохранения истории (тип 2) или сохранение предыдущего значения в отдельном столбце (тип 3).

Разработанная Ральфом Кимбаллом технология многомерного моделирования позволяет создавать хранилище данных «снизу вверх» на основе витрин данных со звездообразной схемой, оптимизированных для формирования отчетов. Bill Подход Инмона сначала строит сверху вниз, нормализованное корпоративное хранилище данных, а затем создает витрины. Подход Кимбалла обеспечивает более быструю реализацию, в то время как Инмон делает акцент на согласованности данных в масштабах всего предприятия.

Инструменты искусственного интеллекта могут анализировать исходные данные, предлагать потенциальные факты и измерения, рекомендовать уровень детализации и выявлять избыточные атрибуты. Они ускоряют проектирование и документирование, но инженер данных должен проверить каждый факт, измерение и иерархию, прежде чем модель поступит в производство.

Да. ChatGPT может составлять схемы "звезда" и объяснять компромиссы, в то время как Второй пилот GitHub Автоматическое завершение SQL-запросов для таблиц фактов и измерений. RevПеред запуском проверьте правильность выходных данных, ключей и соединений.

Подведем итог этой публикации следующим образом: