Інформаційне сховище Archiтектура, компоненти та діаграма Concepts

⚡ Розумний підсумок

Інформаційне сховище ArchiСтруктура визначає, як історичні та сукупні дані з багатьох джерел організовані в багаторівневі шари та пов'язані компоненти, що забезпечує надійну звітність, аналіз та єдину версію достовірної інформації для прийняття рішень та прогнозування в організації.

  • 🏛️ Основна мета: Сховище даних зберігає тематично-орієнтовані, інтегровані, змінні в часі та незалежні дані для підтримки аналізу, а не щоденної обробки транзакцій.
  • 🧱 Багаторівневий дизайн: ArchiСтруктури варіюються від однорівневих до широко використовуваної трирівневої моделі з нижньою базою даних, проміжним OLAP-сервером та верхнім клієнтським рівнем.
  • 🗄️ Основна база даних: Центральне сховище працює на базі даних, що базується на реляційних СУБД, часто розширених паралельними базами даних, новими структурами індексів та багатовимірними базами даних для масштабування та швидкості.
  • 🔄 Компоненти ETL: Інструменти пошуку, придбання, очищення та трансформації об'єднують дані в один уніфікований формат і підтримують актуальність сховища.
  • 🏷️ Роль метаданих: Технічні та бізнес-метадані описують джерело, значення та обробку даних, перетворюючи необроблені значення на корисні знання.
  • 📊 Інструменти запитів та OLAP: Інструменти звітності, керованих запитів, розробки додатків, аналізу даних та OLAP дозволяють користувачам досліджувати сховище даних з багатьох точок зору.
  • Кращі практики: Оптимізуйте модель даних для пошуку, консолідуйте її до єдиної версії істини та розгляньте модель ODS або 3NF, коли це необхідно.

Інформаційне сховище ArchiСтруктурна діаграма, що показує рівні та основні компоненти сховища даних

Інформаційне сховище Concepts

A сховище даних існує для того, щоб надати компанії єдину версію достовірної інформації для прийняття рішень та прогнозування. Це інформаційна система, яка містить історичні та сукупні дані, отримані з одного або багатьох джерел.

Організовуючи ці дані для аналізу, а не для транзакцій, сховище даних спрощує роботу зі звітності та аналізу всієї організації.

Характеристики Data Warehouse

Сховище даних має чотири визначальні характеристики, які відрізняють його від звичайної операційної бази даних:

  • Предметно-орієнтований
  • Інтегрований
  • Варіант часу
  • Нелетучі

Предметно-орієнтований

Сховище даних є предметно-орієнтованим, оскільки воно надає інформацію про певну тему, а не про поточну діяльність компанії. Типові теми включають продажі, маркетинг та дистрибуцію.

Замість щоденної обробки, сховище даних робить акцент на моделюванні та аналізі для прийняття рішень. Воно пропонує просте, лаконічне уявлення про кожен об'єкт та не включає дані, які не підтримують процес прийняття рішень.

Інтегрований

Інтеграція тісно пов'язана з предметною орієнтацією. У сховищі даних інтеграція означає встановлення спільної одиниці вимірювання для всіх подібних даних, отриманих з різних баз даних, та зберігання цих даних спільним, універсально прийнятним способом.

Сховище даних створюється шляхом інтеграції даних з різних джерел, таких як мейнфрейм, реляційні бази даних та плоскі файли. Воно також повинно дотримуватися узгоджених правил іменування, форматів та кодування.

Така узгодженість в іменуванні, вимірюванні атрибутів та структурі кодування робить можливим ефективний аналіз. Розглянемо наступний приклад:

Приклад інтеграції сховища даних зі стандартизацією полів статі, дати та балансу з трьох програм

У наведеному вище прикладі три програми з позначками A, B та C зберігають інформацію про стать, дату та баланс, але кожна програма зберігає її по-різному:

  • Додаток A зберігає поле статі як логічні значення, такі як M або F.
  • Додаток B зберігає поле статі як числове значення.
  • Додаток C зберігає поле статі як символьне значення.
  • Така ж варіація застосовується до полів «Дата» та «Салдо».

Після процесу перетворення та очищення всі ці дані зберігаються у загальному форматі всередині сховища даних.

Варіант часу

Часовий горизонт сховища даних набагато ширший, ніж у операційної системи. Дані розпізнаються з певним періодом та пропонують історичну точку зору, тому вони завжди містять елемент часу, явно чи неявно.

Одним із місць, де проявляється ця часова вариативність, є структура ключа запису. Кожен первинний ключ у сховищі повинен містити елемент часу, такий як день, тиждень або місяць.

Ще один аспект часової дисперсії полягає в тому, що після введення даних у сховище їх не можна оновити або змінити.

Нелетучі

Сховище даних також є енергонезалежним, що означає, що попередні дані не видаляються, коли надходять нові. Дані доступні лише для читання та періодично оновлюються, що допомагає аналітикам вивчати історичні дані та розуміти, що і коли сталося.

Оскільки сховище даних не потребує обробки транзакцій, відновлення або контролю паралельності, воно не виконує дії видалення, оновлення та вставки, типові для операційної програми. У сховищі даних виконуються лише дві операції з даними:

  1. Завантаження даних
  2. Доступ до даних

У таблиці нижче наведено деякі основні відмінності між операційною програмою та сховищем даних:

Operational Application Інформаційне сховище
Необхідно закодувати складну програму, щоб гарантувати, що процеси оновлення даних підтримують високу цілісність кінцевого продукту. Такої проблеми не виникає, оскільки оновлення даних не виконується.
Дані розміщуються в нормалізованій формі, щоб забезпечити мінімальну надмірність. Дані не зберігаються в нормалізованому вигляді.
Технології, необхідні для підтримки транзакцій, відновлення даних, відкату та вирішення блокувань, є досить складними. Він пропонує відносну простоту технології.

Інформаційне сховище Archiтектура

Інформаційне сховище ArchiСтруктура є складною, оскільки система зберігає історичні та сукупні дані з кількох джерел. Існує три підходи до побудови шарів сховища: однорівневий, дворівневий та трирівневий.

Однорівнева архітектура прагне мінімізувати обсяг даних, що зберігаються, шляхом усунення надлишковості. На практиці він рідко використовується.

Дворівнева архітектура відокремлює фізично доступні джерела від сховища даних. Його важко розширити, він підтримує меншу кількість кінцевих користувачів і може зіткнутися з проблемами підключення через обмеження мережі.

Трирівнева архітектура є найпоширенішим варіантом дизайну сховища даних.

Він складається з верхнього, середнього та нижнього ярусів:

  1. Нижній рівень: База даних сховища слугує нижнім рівнем. Зазвичай це реляційна система баз даних, і дані очищуються, трансформуються та завантажуються на цей рівень за допомогою бекенд-інструментів.
  2. Середній рівень: Середній рівень – це OLAP-сервер, реалізований з використанням моделі ROLAP або MOLAP. Він представляє собою ABStracперегляд бази даних та діє як посередник між кінцевим користувачем та базою даних.
  3. Найвищий рівень: Верхній рівень – це рівень клієнтського інтерфейсу. Він містить інструменти та API, що використовуються для підключення та вилучення даних зі сховища, такі як інструменти запитів, інструменти звітності, інструменти керованих запитів, інструменти аналізу та інструменти інтелектуального аналізу даних.

Компоненти сховища даних

Компоненти та загальна архітектура сховища даних працюють разом, як показано на діаграмі нижче.

Компоненти архітектури сховища даних, включаючи базу даних, інструменти ETL, метадані, інструменти запитів та сховища даних

Сховище даних базується на сервері RDBMS, центральному сховищі інформації, оточеному ключовими компонентами, які забезпечують функціональність, керованість та доступність усього середовища.

Сховище даних має п'ять основних компонентів, описаних нижче.

База даних сховища даних

Центральна база даних є основою складського середовища та впроваджена на СУБД технологія. Оскільки традиційна СУБД налаштована на обробку транзакцій, а не на зберігання даних, ресурсомісткі операції, такі як спеціальні запити, об'єднання кількох таблиць та агрегати, можуть уповільнити її роботу.

З цієї причини використовуються альтернативні підходи до баз даних:

  • Реляційні бази даних розгортаються паралельно для забезпечення масштабованості, використовуючи моделі спільної пам'яті або нічого спільного на різних багатопроцесорних або масово паралельних конфігураціях.
  • Нові структури індексів використовуються для обходу сканування реляційних таблиць та підвищення швидкості.
  • Багатовимірні бази даних (MDDB) використовуються для подолання обмежень моделей реляційних сховищ. Прикладом є Essbase з Oracle.

Інструменти пошуку, придбання, очищення та трансформації (ETL)

Інструменти пошуку, перетворення та міграції даних виконують усі перетворення, узагальнення та зміни, необхідні для перетворення даних в єдиний формат сховища. Їх також називають Ex.tracІнструменти t, перетворення та завантаження (ETL).

Їх функціональність включає наступне:

  • Анонімізувати дані відповідно до нормативних положень.
  • Видаліть небажані дані з операційних баз даних перед завантаженням на склад.
  • Пошук і заміна загальних імен і визначень для даних, що надходять з різних джерел.
  • Обчислювати зведені дані та похідні дані.
  • Заповніть відсутні дані значеннями за замовчуванням.
  • Видалення дублікатів даних, що надходять з кількох джерел.

Ці Інструменти ETL може генерувати cron-завдання, фонові завдання, програми на Cobol та скрипти оболонки, які регулярно оновлюють сховище даних та допомагають підтримувати метадані.

Оскільки інструменти ETL використовують багато систем, вони також повинні справлятися з неоднорідністю баз даних та даних.

метадані

Метадані можуть здатися складними, але це просто дані про дані, які визначають сховище. Вони використовуються для побудови, обслуговування та управління сховищем.

В межах архітектури метадані визначають джерело, використання, значення та функції даних, а також те, як дані можна змінювати та обробляти, щоб вони залишалися тісно пов'язаними зі сховищем.

Наприклад, рядок у базі даних продажів може містити:

4030 KJ732 299.90

Це не має сенсу, доки метадані не пояснять, що це номер моделі 4030, ідентифікатор торгового агента KJ732 та загальна сума продажів $299.90.

Таким чином, метадані є важливим інгредієнтом у перетворенні даних на знання та допомагають відповісти на такі питання, як:

  • Які таблиці, атрибути та ключі містить сховище?
  • Звідки дані?
  • Скільки разів перезавантажуються дані?
  • Які перетворення та очищення були застосовані?

Метадані поділяються на дві категорії:

  1. Технічні метадані: Це описує сховище даних для дизайнерів та адміністраторів, які його створюють та керують.
  2. Бізнес-метадані: Це дає кінцевим користувачам простий спосіб зрозуміти інформацію, що зберігається на сховищі.

Інструменти запитів

Головна мета сховищ даних — надати підприємствам інформацію, необхідну для прийняття стратегічних рішень, а інструменти запитів — це те, як користувачі взаємодіють із системою.

Ці інструменти поділяються на чотири категорії:

  1. Інструменти запитів і звітів
  2. Інструменти розробки додатків
  3. Інструменти інтелектуального аналізу даних
  4. Інструменти OLAP

Інструменти запитів та звітності

Інструменти для запитів та звітності поділяються на дві групи: інструменти звітності та інструменти керованих запитів.

Інструменти звітності поділяються далі на інструменти звітності про виробництво та засоби створення звітів для робочого столу:

  1. Автори звіту: Вони розроблені для кінцевих користувачів, які проводять власні аналізи.
  2. Звітність про виробництво: Вони дозволяють організаціям генерувати регулярні операційні звіти та підтримувати пакетні завдання великого обсягу, такі як друк та обчислення. Популярні приклади включають Brio, Business Objects, Oracle, PowerSoft та Інститут SAS.

Інструменти керованих запитів допомогти кінцевим користувачам, вставивши меташар між користувачем і базою даних, що приховує складність SQL та структури бази даних.

Інструменти розробки додатків

Коли вбудовані графічні та аналітичні інструменти не можуть задовольнити аналітичні потреби організації, за допомогою інструментів розробки додатків створюються власні звіти.

Інструменти інтелектуального аналізу даних

Інтелектуальний аналіз даних виявляє нові значущі кореляції, закономірності та тенденції у великих обсягах даних, а інструменти інтелектуального аналізу даних автоматизують це відкриття.

Інструменти OLAP

OLAP Інструменти побудовані на багатовимірній базі даних і дозволяють користувачам аналізувати дані за допомогою складних багатовимірних представлень.

Шина сховища даних Archiтектура

Шина сховища даних визначає, як дані проходять через сховище. Цей потік можна розділити на вхідний, висхідний, низхідний, вихідний та метапотік.

Під час проектування шини необхідно враховувати спільні виміри та факти, що охоплюють сховища даних.

Витримки даних

A март даних — це рівень доступу, який використовується для доставки даних користувачам. Він підходить для великих сховищ, оскільки його створення займає менше часу та коштів, хоча єдиного узгодженого визначення вітрина даних немає.

Простіше кажучи, сховище даних – це дочірня структура сховища даних. Воно розділяє дані для певної групи користувачів і може знаходитися в тій самій базі даних, що й сховище, або в фізично окремій.

Інформаційне сховище Archiнайкращі практики tecture

Щоб розробити надійну архітектуру сховища даних, дотримуйтесь наведених нижче найкращих практик.

  • Використовуйте моделі сховищ даних, оптимізовані для пошуку інформації, незалежно від того, чи розмірний, денормалізований або гібридний підхід.
  • Оберіть відповідний підхід до дизайну, зверху вниз чи знизу вгору.
  • Забезпечте швидку та точну обробку даних, одночасно об'єднуючи їх в єдину версію правдивої інформації.
  • Ретельно продумайте процес збору та очищення даних для сховища.
  • Розробіть архітектуру метаданих, яка дозволяє спільний доступ до метаданих між компонентами сховища.
  • Розглянемо Operaмодель сховища даних (ODS), коли потреби в пошуку знаходяться в нижній частині бази данихtracпіраміди операцій або коли необхідно отримати доступ до кількох операційних джерел.
  • Переконайтеся, що модель даних інтегрована, а не просто консолідована; у такому випадку використовуйте модель даних 3NF, яка також ідеально підходить для придбання інструментів ETL та очищення даних.

Поширені запитання

Оперативна база даних обробляє часті вставки, оновлення та видалення за допомогою нормалізованих таблиць для обробки транзакцій. Сховище даних доступне лише для читання та є енергонезалежним, зберігає історичні дані в денормалізованих структурах та оптимізоване для запитів, звітності та аналізу, а не для щоденних операцій.

Сховище даних – це сховище всього підприємства, яке містить інтегровані дані з багатьох джерел. март даних — це менша підмножина, зосереджена на одному відділі або предметі, такому як продажі чи фінанси, що робить її швидшою та дешевшою у створенні та легшою для запитів.

Обидві схеми є вимірними. Зіркова схема розміщує одну центральну таблицю фактів, безпосередньо пов'язану з денормалізованими таблицями вимірів, що нагадує зірку. Схема сніжинки нормалізує ці виміри у пов'язані підтаблиці. Див. розмірне моделювання щодо того, як організовані факти та виміри.

Хмарне сховище даних — це керована аналітична база даних, що розміщується у постачальника, такого як Amazon червоне зміщення, Google BigQuery, або Snowflake. Він масштабує сховище та обчислення на вимогу, зменшує обсяг обслуговування обладнання та підтримує ту саму багаторівневу архітектуру та ETL-конвеєри, що й локальні сховища.

Єдина версія правдивої інформації означає, що кожен користувач і звіт спираються на один узгоджений, інтегрований набір даних. Завдяки консолідації та стандартизації значень з різних джерел, сховище даних усуває суперечливі цифри, тому рішення ґрунтуються на тих самих достовірних числах.

ETL extracts дані, трансформує їх у проміжній області, а потім завантажує до сховища. ELT спочатку завантажує необроблені дані та трансформує їх у сховищі, використовуючи свою обчислювальну потужність. Дізнайтеся більше в Процес ETL пояснення.

Інструменти штучного інтелекту та машинного навчання пропонують схеми проектування, автоматизують створення ETL-картping, виявляти аномалії якості даних та рекомендувати індекси або розділи, що пришвидшують запити. Вони також можуть прогнозувати зростання обсягу сховища. Інженер повинен переглянути кожну рекомендацію, перш ніж застосовувати її до виробничого сховища.

Так. ChatGPT може створювати SQL, вимірні моделі та логіку ETL на основі опису, Копілот GitHub автозаповнення скриптів трансформації у вашому редакторі. Завжди перевіряйте згенеровані схеми та запити, оскільки ШІ може посилатися на застарілий синтаксис або значення за замовчуванням.

Підсумуйте цей пост за допомогою: