Entreposage De Données Architecture, composants et diagramme Concepts

⚡ Résumé intelligent

Entreposage De Données ArchiLa structure définit la manière dont les données historiques et cumulatives provenant de nombreuses sources sont organisées en couches hiérarchisées et en composants connectés, permettant ainsi des rapports fiables, des analyses et une version unique de la vérité pour la prise de décision et les prévisions organisationnelles.

  • Objectif principal : Un entrepôt de données stocke des données orientées sujet, intégrées, temporelles et non volatiles pour faciliter l'analyse plutôt que le traitement transactionnel quotidien.
  • 🧱 Conception à plusieurs niveaux : ArchiLes architectures vont du modèle monocouche au modèle à trois couches largement utilisé, composé d'une base de données inférieure, d'un serveur OLAP intermédiaire et d'une couche client supérieure.
  • 🇧🇷 Base de données principale : Le référentiel central fonctionne sur un SGBDR, souvent étendu avec des bases de données parallèles, de nouvelles structures d'index et des bases de données multidimensionnelles pour gagner en évolutivité et en rapidité.
  • (I.e. Composants ETL : Les outils de sourcing, d'acquisition, de nettoyage et de transformation consolident les données dans un format unifié et maintiennent l'entrepôt de données à jour.
  • 🏷️ Rôle des métadonnées : Les métadonnées techniques et commerciales décrivent la source, la signification et le traitement des données, transformant les valeurs brutes en connaissances exploitables.
  • (I.e. Outils de requête et d'OLAP : Les outils de reporting, de gestion des requêtes, de développement d'applications, d'exploration de données et d'OLAP permettent aux utilisateurs d'explorer l'entrepôt de données sous de nombreux angles.
  • Meilleures pratiques : Optimisez le modèle de données pour la récupération, consolidez-le en une seule version de vérité et envisagez un modèle ODS ou 3NF si nécessaire.

Entreposage De Données ArchiDiagramme de structure illustrant les niveaux et les composants principaux d'un entrepôt de données

Entreposage De Données Concepts

A entrepôt de données Ce système a pour but de fournir à une entreprise une source unique et fiable d'informations pour la prise de décision et les prévisions. Il s'agit d'un système d'information qui centralise des données historiques et cumulatives provenant d'une ou plusieurs sources.

En organisant ces données pour l'analyse plutôt que pour les transactions, un entrepôt de données simplifie le travail de reporting et d'analyse de toute une organisation.

Caractéristiques de l'entrepôt de données

Un entrepôt de données possède quatre caractéristiques essentielles qui le distinguent d'une base de données opérationnelle classique :

  • Orienté sujet
  • Intégration
  • Variante dans le temps
  • Non volatile

Orienté sujet

Un entrepôt de données est orienté sujet car il fournit des informations sur un thème précis plutôt que sur les opérations courantes d'une entreprise. Les sujets typiques incluent les ventes, le marketing et la distribution.

Au lieu du traitement quotidien, l'entrepôt de données privilégie la modélisation et l'analyse pour la prise de décision. Il offre une vue simple et concise de chaque sujet et exclut les données qui ne contribuent pas au processus décisionnel.

Intégration

L'intégration est étroitement liée à l'orientation par sujet. Dans un entrepôt de données, l'intégration consiste à établir une unité de mesure commune pour toutes les données similaires issues de bases de données différentes, et à stocker ces données d'une manière commune et universellement acceptable.

Un entrepôt de données est construit en intégrant des données provenant de sources variées telles qu'un ordinateur central, des bases de données relationnelles et des fichiers plats. Il doit également respecter des conventions de nommage, des formats et un codage cohérents.

Cette cohérence dans la dénomination, les mesures des attributs et la structure d'encodage est ce qui rend possible une analyse efficace. Prenons l'exemple suivant :

Exemple d'intégration d'entrepôt de données standardisant les champs genre, date et solde provenant de trois applications

Dans l'exemple ci-dessus, trois applications nommées A, B et C stockent chacune des informations sur le sexe, la date et le solde, mais chaque application les stocke d'une manière différente :

  • L'application A stocke le champ genre sous forme de valeurs logiques telles que M ou F.
  • L'application B stocke le champ genre sous forme de valeur numérique.
  • L'application C stocke le champ genre sous forme de valeur de type caractère.
  • La même variation s'applique aux champs Date et Solde.

Après le processus de transformation et de nettoyage, toutes ces données sont stockées dans un format commun au sein de l'entrepôt de données.

Variante dans le temps

L'horizon temporel d'un entrepôt de données est bien plus large que celui d'un système opérationnel. Les données sont associées à une période précise et offrent une perspective historique ; elles comportent donc toujours une dimension temporelle, de manière explicite ou implicite.

Cette variation temporelle se manifeste notamment dans la structure de la clé d'enregistrement. Chaque clé primaire de l'entrepôt de données doit comporter un élément temporel, tel que le jour, la semaine ou le mois.

Un autre aspect de la variation temporelle est que, une fois les données insérées dans l'entrepôt, elles ne peuvent plus être mises à jour ni modifiées.

Non volatile

Un entrepôt de données est également non volatil, ce qui signifie que les données antérieures ne sont pas effacées lors de l'arrivée de nouvelles données. Les données sont en lecture seule et actualisées périodiquement, ce qui permet aux analystes d'étudier l'historique des données et de comprendre le déroulement des événements.

Puisqu'il ne nécessite ni traitement transactionnel, ni récupération, ni contrôle de concurrence, un entrepôt de données omet les opérations de suppression, de mise à jour et d'insertion courantes dans une application opérationnelle. Seules deux opérations sur les données sont effectuées dans un entrepôt de données :

  1. Chargement des données
  2. Accès aux données

Le tableau ci-dessous met en évidence quelques différences majeures entre une application opérationnelle et un entrepôt de données :

OperaApplication internationale Entreposage De Données
Un programme complexe doit être codé pour garantir que les processus de mise à niveau des données maintiennent une haute intégrité du produit final. Ce type de problème ne se produit pas parce qu'une mise à jour des données n'est pas effectuée.
Les données sont placées sous une forme normalisée pour garantir une redondance minimale. Les données ne sont pas stockées sous forme normalisée.
La technologie nécessaire pour gérer les transactions, la récupération des données, la restauration et la résolution des blocages est assez complexe. Il offre une relative simplicité technologique.

Entreposage De Données Architecture

Entreposage De Données ArchiL'architecture est complexe car le système stocke des données historiques et cumulatives provenant de sources multiples. Il existe trois approches pour la construction des couches de l'entrepôt de données : à un seul niveau, à deux niveaux et à trois niveaux.

Architecture à un seul niveau L'objectif est de minimiser la quantité de données stockées en éliminant les redondances. Cette méthode est rarement utilisée en pratique.

Architecture à deux niveaux Il sépare les sources physiquement disponibles de l'entrepôt de données. Son extension est difficile, il prend en charge un nombre limité d'utilisateurs finaux et peut rencontrer des problèmes de connectivité dus aux limitations du réseau.

Architecture à trois niveaux est la conception la plus répandue d'un entrepôt de données.

Il se compose des niveaux supérieur, intermédiaire et inférieur :

  1. Niveau inférieur: La base de données de l'entrepôt constitue la couche inférieure. Il s'agit généralement d'un système de base de données relationnelle, et les données sont nettoyées, transformées et chargées dans cette couche à l'aide d'outils back-end.
  2. Niveau intermédiaire: La couche intermédiaire est un serveur OLAP implémenté selon le modèle ROLAP ou MOLAP. Elle présente une vue d'ensemble.tracIl offre une vue détaillée de la base de données et sert d'intermédiaire entre l'utilisateur final et la base de données.
  3. Haut niveau: La couche supérieure est une couche cliente frontale. Elle contient les outils et les API utilisés pour se connecter à l'entrepôt de données et en extraire des données, tels que les outils de requête, les outils de reporting, les outils de requête gérée, les outils d'analyse et les outils d'exploration de données.

Composants de l'entrepôt de données

Les composants et l'architecture globale d'un entrepôt de données fonctionnent ensemble comme illustré dans le schéma ci-dessous.

Composants de l'architecture d'un entrepôt de données, notamment la base de données, les outils ETL, les métadonnées, les outils de requête et les data marts

L'entrepôt de données repose sur un serveur SGBDR, un référentiel central d'informations entouré de composants clés qui assurent le fonctionnement, la gestion et l'accessibilité de l'ensemble de l'environnement.

Un entrepôt de données comporte cinq composants principaux, décrits ci-dessous.

Base de données de l'entrepôt de données

La base de données centrale constitue le fondement de l'environnement d'entreposage et est implémentée sur RDBMS En raison de sa conception axée sur le traitement transactionnel plutôt que sur l'entreposage de données, un SGBDR traditionnel peut être ralenti par des opérations gourmandes en ressources telles que les requêtes ad hoc, les jointures multi-tables et les agrégats.

C’est pourquoi des approches alternatives en matière de bases de données sont utilisées :

  • Les bases de données relationnelles sont déployées en parallèle pour permettre l'évolutivité, en utilisant des modèles à mémoire partagée ou sans partage sur diverses configurations multiprocesseurs ou massivement parallèles.
  • De nouvelles structures d'index sont utilisées pour contourner les analyses de tables relationnelles et améliorer la vitesse.
  • Les bases de données multidimensionnelles (MDDB) sont utilisées pour pallier les limitations des modèles d'entrepôts de données relationnels. Essbase en est un exemple. Oracle.

Outils de sourcing, d'acquisition, de nettoyage et de transformation (ETL)

Les outils d'acquisition, de transformation et de migration de données effectuent toutes les conversions, synthèses et modifications nécessaires pour transformer les données en un format d'entrepôt de données unifié. Ils sont également appelés outils d'extraction, de transformation et de migration de données (Ex).tracOutils ETL (transformation, chargement et transformation).

Leurs fonctionnalités comprennent les éléments suivants :

  • Anonymiser les données conformément aux stipulations réglementaires.
  • Éliminez les données indésirables des bases de données opérationnelles avant leur chargement dans l'entrepôt.
  • Recherchez et remplacez les noms communs et les définitions des données provenant de différentes sources.
  • Calculer les résumés et les données dérivées.
  • Renseignez les données manquantes avec des valeurs par défaut.
  • Supprimer les doublons de données provenant de sources multiples.

Ces Outils ETL peut générer des tâches cron, des tâches en arrière-plan, des programmes Cobol et des scripts shell qui actualisent régulièrement l'entrepôt de données et contribuent à la maintenance des métadonnées.

Parce qu'ils puisent dans de nombreux systèmes, les outils ETL doivent également gérer l'hétérogénéité des bases de données et des données.

Métadonnées

Le terme « métadonnées » peut paraître complexe, mais il s'agit simplement de données sur les données qui définissent l'entrepôt de données. Elles servent à construire, maintenir et gérer cet entrepôt.

Au sein de l'architecture, les métadonnées spécifient la source, l'utilisation, les valeurs et les caractéristiques des données et définissent comment les données peuvent être modifiées et traitées, de sorte qu'elles restent étroitement liées à l'entrepôt de données.

Par exemple, une ligne dans une base de données de ventes peut contenir :

4030 KJ732 299.90

Cela n'a aucun sens tant que les métadonnées n'expliquent pas qu'il s'agit d'un numéro de modèle 4030, d'un identifiant d'agent commercial KJ732 et d'un montant total de ventes de 299.90 $.

Les métadonnées sont donc un ingrédient essentiel pour transformer les données en connaissances, et elles permettent de répondre à des questions telles que :

  • Quelles sont les tables, les attributs et les clés que contient l'entrepôt de données ?
  • D'où viennent les données ?
  • Combien de fois les données sont-elles rechargées ?
  • Quelles transformations et purifications ont été appliquées ?

Les métadonnées se répartissent en deux catégories :

  1. Métadonnées techniques: Ceci décrit l'entrepôt de données pour les concepteurs et les administrateurs qui le construisent et le gèrent.
  2. Métadonnées d'entreprise: Cela permet aux utilisateurs finaux de comprendre facilement les informations stockées dans l'entrepôt.

Outils de requête

L'un des principaux objectifs de l'entreposage de données est de fournir aux entreprises les informations dont elles ont besoin pour prendre des décisions stratégiques, et les outils de requête sont la manière dont les utilisateurs interagissent avec le système.

Ces outils se répartissent en quatre catégories :

  1. Outils de requête et de reporting
  2. Outils de développement d'applications
  3. Outils d'exploration de données
  4. Outils OLAP

Outils de requête et de reporting

Les outils de requête et de reporting se divisent en deux groupes : les outils de reporting et les outils de requête gérés.

Outils de reporting se divisent ensuite en outils de reporting de production et en logiciels de création de rapports pour ordinateurs de bureau :

  1. Rédacteurs de rapports : Ces outils sont conçus pour les utilisateurs finaux qui réalisent leurs propres analyses.
  2. Rapports de production : Ces solutions permettent aux organisations de générer des rapports opérationnels réguliers et de prendre en charge les traitements par lots à volume élevé, tels que l'impression et les calculs. Parmi les exemples les plus courants, citons Brio et Business Objects. Oracle, PowerSoft et SAS Institute.

Outils de requêtes gérés aider les utilisateurs finaux en insérant une méta-couche entre l'utilisateur et la base de données, qui masque la complexité du SQL et de la structure de la base de données.

Outils de développement d'applications

Lorsque les outils graphiques et analytiques intégrés ne peuvent répondre aux besoins analytiques d'une organisation, des rapports personnalisés sont créés à l'aide d'outils de développement d'applications.

Outils d'exploration de données

L'exploration de données permet de découvrir de nouvelles corrélations, de nouveaux modèles et de nouvelles tendances significatifs au sein de grands volumes de données, et les outils d'exploration de données automatisent cette découverte.

Outils OLAP

OLAP Ces outils reposent sur une base de données multidimensionnelle et permettent aux utilisateurs d'analyser les données grâce à des vues multidimensionnelles élaborées.

Bus d'entrepôt de données Architecture

Le bus de l'entrepôt de données détermine la circulation des données au sein de celui-ci. Cette circulation peut être catégorisée en flux entrants, ascendants, descendants, sortants et métaflux.

Lors de la conception du bus, il faut tenir compte des dimensions et des faits partagés par les différents entrepôts de données.

Datamarts

A data mart Il s'agit d'une couche d'accès permettant de fournir des données aux utilisateurs. Elle convient aux grands entrepôts de données car sa mise en place est plus rapide et moins coûteuse, bien qu'il n'existe pas de définition unique et consensuelle d'un data mart.

En termes simples, un data mart est une sous-unité d'un entrepôt de données. Il segmente les données pour un groupe d'utilisateurs spécifique et peut résider dans la même base de données que l'entrepôt ou sur une base de données physiquement distincte.

Entreposage De Données Architecture Meilleures Pratiques

Pour concevoir une architecture d'entrepôt de données robuste, suivez les bonnes pratiques ci-dessous :

  • Utilisez des modèles d'entrepôt de données optimisés pour la recherche d'informations, qu'il s'agisse d'un dimensions, dénormalisée ou approche hybride.
  • Choisissez une approche de conception appropriée, qu'elle soit descendante ou ascendante.
  • Veillez à ce que les données soient traitées rapidement et avec précision tout en les consolidant en une version unique de la vérité.
  • Concevoir soigneusement le processus d'acquisition et de nettoyage des données pour l'entrepôt de données.
  • Concevoir une architecture de métadonnées permettant le partage des métadonnées entre les composants de l'entrepôt de données.
  • Considérez un OperaModèle de magasin de données national (ODS) lorsque les besoins de récupération se situent près du bas de la chaîne de valeur des donnéestracpyramide de tion ou lorsque plusieurs sources opérationnelles doivent être consultées.
  • Veillez à ce que le modèle de données soit intégré plutôt que simplement consolidé ; dans ce cas, utilisez un modèle de données 3NF, qui est également idéal lors de l'acquisition d'outils ETL et de nettoyage de données.

FAQ

Une base de données opérationnelle gère les insertions, mises à jour et suppressions fréquentes grâce à des tables normalisées pour le traitement transactionnel. Un entrepôt de données, en lecture seule et non volatil, stocke les données historiques dans des structures dénormalisées et est optimisé pour les requêtes, la génération de rapports et l'analyse plutôt que pour les opérations quotidiennes.

Un entrepôt de données est un référentiel à l'échelle de l'entreprise contenant des données intégrées provenant de nombreuses sources. data mart il s'agit d'un sous-ensemble plus petit, centré sur un département ou un sujet, comme les ventes ou la finance, ce qui le rend plus rapide et moins coûteux à construire et plus facile à interroger.

Ce sont deux schémas dimensionnels. Un schéma en étoile place une table de faits centrale directement liée à des tables de dimensions dénormalisées, formant ainsi une étoile. Un schéma en flocon de neige normalise ces dimensions en sous-tables liées. Voir modélisation dimensionnelle pour la manière dont les faits et les dimensions sont organisés.

Un entrepôt de données cloud est une base de données analytique gérée et hébergée par un fournisseur, tel que Amazon Décalage vers le rouge, Google BigQuery, ou Snowflake, permet de faire évoluer le stockage et la puissance de calcul à la demande, de réduire la maintenance du matériel et de prendre en charge la même architecture hiérarchisée et les mêmes pipelines ETL que les entrepôts de données sur site.

Une source unique de données fiables signifie que chaque utilisateur et chaque rapport s'appuie sur un ensemble de données cohérent et intégré. En consolidant et en normalisant les valeurs provenant de différentes sources, un entrepôt de données élimine les chiffres contradictoires, permettant ainsi aux décisions de reposer sur les mêmes données de confiance.

ETL extracELT traite les données, les transforme dans une zone de transit, puis les charge dans l'entrepôt de données. ELT charge d'abord les données brutes et les transforme dans l'entrepôt grâce à sa puissance de calcul. Pour en savoir plus, consultez la documentation. Processus ETL explication.

Les outils d'IA et d'apprentissage automatique suggèrent des schémas et automatisent le mappage ETL.pingIls peuvent détecter les anomalies de qualité des données et recommander des index ou des partitions pour accélérer les requêtes. Ils peuvent également prévoir la croissance du stockage. Un ingénieur doit examiner chaque recommandation avant de l'appliquer à un entrepôt de données en production.

Oui. ChatGPT peut rédiger des requêtes SQL, des modèles dimensionnels et une logique ETL à partir d'une description, tandis que Copilote GitHub L'IA complète automatiquement les scripts de transformation dans votre éditeur. Validez toujours les schémas et les requêtes générés, car elle peut utiliser une syntaxe obsolète ou des valeurs par défaut.

Résumez cet article avec :