Qu’est-ce que la modélisation dimensionnelle dans Data Warehouse ? Apprendre les types
⚡ Résumé intelligent
Le modèle dimensionnel dans la conception d'un entrepôt de données organise les informations en tables de faits et de dimensions afin que les analystes puissent récupérer et résumer rapidement les mesures numériques, en suivant la méthode Kimball en cinq étapes qui identifie le processus métier, la granularité, les dimensions, les faits et le schéma final.

Qu'est-ce que la modélisation dimensionnelle?
Modélisation dimensionnelle (DM) Il s'agit d'une technique de structuration de données optimisée pour le stockage dans un entrepôt de données. Son objectif est d'optimiser la base de données pour une récupération plus rapide des données. Ce concept a été développé par Ralph Kimball et repose sur deux types de tables : les tables de faits et les tables de dimensions.
Dans un entrepôt de données, un modèle dimensionnel est conçu pour lire, synthétiser et analyser des informations numériques telles que des valeurs, des soldes, des effectifs et des pondérations. Les modèles relationnels, en revanche, sont optimisés pour l'ajout, la mise à jour et la suppression de données dans un système de traitement transactionnel en ligne et en temps réel.
Chacune de ces approches stocke les données à sa manière, et chacune offre des avantages distincts.
Dans un modèle relationnel, la normalisation et les modèles entité-relation réduisent la redondance des données. Un modèle dimensionnel, quant à lui, organise les données de manière à faciliter la recherche d'informations et la génération de rapports.
Pour cette raison, les modèles dimensionnels conviennent entreposage de données Des systèmes plutôt que des systèmes relationnels à forte composante transactionnelle. Car ce modèle sous-tend un système plus global. architecture d'entrepôt de donnéesLes sections ci-dessous détaillent ses éléments, ses types et ses étapes de conception.
Éléments du modèle de données dimensionnelles
Fait
Les faits sont les mesures ou indicateurs issus d'un processus métier. Dans un processus de vente, par exemple, le chiffre d'affaires trimestriel est un fait : la valeur numérique que l'entreprise souhaite analyser.
Dimension
Une dimension fournit le contexte d'un événement de processus métier. En termes simples, les dimensions précisent qui, quoi et où se situe un fait. Pour le fait « chiffre d'affaires trimestriel », les dimensions seraient :
- Qui – Noms des clients
- Où – Emplacement
- Quoi – Nom du produit
En d'autres termes, une dimension est une fenêtre à travers laquelle on observe les informations contenues dans les faits.
Attributs
Les attributs sont les différentes caractéristiques d'une dimension au sein d'un modèle de données dimensionnel.
Dans une dimension Emplacement, les attributs peuvent être :
- État
- Pays
- Code postal
Les attributs servent à rechercher, filtrer et classer les faits, et les tables de dimensions contiennent ces attributs.
Tableau des faits
Une table de faits est la table principale d'un modèle dimensionnel.
Une table de faits contient :
- Mesures ou faits
- Clés étrangères vers les tables de dimensions
Tableau des dimensions
Une table de dimension contient les dimensions d'une table de faits et est liée à cette dernière par une clé étrangère. Ses principales caractéristiques sont énumérées ci-dessous :
- Les tableaux de dimensions sont des tableaux dénormalisés.
- Les attributs de dimension forment les colonnes du tableau.
- Les dimensions offrent des caractéristiques descriptives des faits à travers leurs attributs.
- Il n'y a pas de limite fixe au nombre de dimensions.
- Une dimension peut contenir une ou plusieurs relations hiérarchiques.
Types de dimensions dans l'entrepôt de données
La modélisation dimensionnelle utilise plusieurs types de dimensions, chacune adaptée à un besoin de conception particulier. types de dimensions dans un entrepôt de données sont:
- Dimension conforme
- Dimension du stabilisateur
- Dimension réduite
- Dimension du jeu de rôle
- Tableau des dimensions vers les dimensions
- Dimension indésirable
- Dimension dégénérée
- Dimension échangeable
- Dimension de l'étape
Étapes de la modélisation dimensionnelle
La précision de votre modélisation dimensionnelle détermine le succès de la mise en œuvre de votre entrepôt de données. La construction d'un modèle dimensionnel comporte cinq étapes :
- Identifier le processus métier
- Identifier le grain (niveau de détail)
- Identifier les dimensions
- Identifier les faits
- Construire le schéma
Globalement, le modèle final doit décrire le pourquoi, le combien, le quand, le où, le qui et le quoi de votre processus métier.
Étape 1) Identifiez le processus métier
La première étape consiste à identifier le processus métier que l'entrepôt doit couvrir (marketing, ventes, RH, etc.) en fonction de l'organisation. l'analyse des données Il s'agit de l'étape la plus importante, car une erreur à ce stade engendre des défauts en cascade difficiles à corriger.
Pour décrire le processus métier, vous pouvez utiliser du texte brut, la notation de modélisation des processus métier (BPMN) ou le langage de modélisation unifié (Unified Modeling Language).UML).
Étape 2) Identifiez le grain
Le niveau de détail définit la granularité du problème métier — le niveau d'information le plus fin stocké dans une table.
Si un tableau contient les ventes de chaque jour, sa granularité est quotidienne ; s’il contient les totaux mensuels, sa granularité est mensuelle.
Au cours de cette étape, vous répondez à des questions telles que :
- L'entrepôt doit-il stocker tous les produits disponibles ou seulement quelques types de produits ? Cela dépend des processus métier choisis.
- Les données relatives aux ventes de produits doivent-elles être enregistrées mensuellement, hebdomadairement, quotidiennement ou toutes les heures ? Cela dépend des rapports demandés par la direction.
- Quel est l'impact de ces deux choix sur la taille de la base de données ?
Exemple de grain : Imaginez que le PDG d'une multinationale souhaite consulter les ventes de produits spécifiques dans différents endroits, mesurées quotidiennement.
Dans ce scénario, le grain devient « informations sur les ventes de produits par lieu et par jour ».
Étape 3) Identifiez les dimensions
Les dimensions sont des noms tels que date, magasin et inventaire, et elles contiennent les données descriptives.
Par exemple, une dimension de date peut contenir une année, un mois et un jour de la semaine.
Exemple de dimensions : Le choix des dimensions est déterminé par les mêmes exigences en matière de ventes quotidiennes.
Dans ce scénario, les dimensions sont le produit, le lieu et le temps.
La dimension Produit comporte des attributs tels que la clé produit (une clé étrangère), le nom, le type et les spécifications.
La dimension « Lieu » est organisée sous forme de hiérarchie : pays, état/province, ville, adresse et nom.
Étape 4) Identifier les faits
Cette étape est étroitement liée aux utilisateurs métiers du système, car elle définit les données qu'ils utilisent à partir de l'entrepôt de données.
La plupart des lignes d'un tableau de faits contiennent des valeurs numériques telles que le prix ou le coût unitaire.
Exemple de faits : L'exigence de ventes quotidiennes remet une fois de plus les choses en perspective.
Ici, le fait correspond à la somme des ventes par produit, par lieu et par période.
Étape 5) Créer un schéma
Dans cette dernière étape, vous implémentez le modèle dimensionnel. Un schéma correspond simplement à la structure de la base de données — l'agencement des tables — et l'utilisation de deux schémas est particulièrement courante.
Le premier est le schéma en étoile, facile à concevoir et nommée d'après sa forme : une table de faits centrale avec des tables de dimensions rayonnant vers l'extérieur comme les pointes d'une étoile.
Dans un schéma en étoile, la table de faits est en troisième forme normale tandis que les tables de dimensions sont dénormalisées ; schéma en étoile dans la modélisation d'entrepôts de données Ce guide propose un exemple complet.
Le second est le schéma de flocon de neige, une extension du schéma en étoile dans laquelle chaque dimension est normalisée et liée à d'autres tables de dimensions, comme expliqué dans ce Schéma en flocon de neige dans le modèle d'entrepôt de données guider.
Règles de modélisation dimensionnelle
Les règles et principes suivants guident une modélisation dimensionnelle efficace :
- Charger les données atomiques dans les structures dimensionnelles.
- Créez des modèles dimensionnels autour des processus métier.
- Assurez-vous que chaque table de faits possède une table de dimension de date associée.
- Conservez toutes les données dans un seul tableau de faits, au même niveau de détail.
- Stockez les étiquettes de rapport et les valeurs de domaine de filtre dans les tables de dimensions.
- Attribuez à chaque table de dimension une clé de substitution.
- Équilibrer en permanence les exigences et les réalités afin de fournir une solution qui soutienne la prise de décision commerciale.
Avantages de la modélisation dimensionnelle
La modélisation dimensionnelle offre un certain nombre d'avantages pratiques :
- Des dimensions standardisées permettent une production de rapports simple et cohérente dans tous les secteurs de l'entreprise.
- Les tables de dimensions stockent l'historique des informations dimensionnelles.
- De nouvelles dimensions peuvent être introduites sans perturber significativement la table de faits.
- Les données sont stockées de manière à être plus faciles à récupérer une fois qu'elles sont dans la base de données.
- Comparativement au modèle normalisé, les tableaux dimensionnels sont plus faciles à comprendre car les informations sont regroupées en catégories d'activités claires.
- Le modèle est basé sur des termes commerciaux, de sorte que l'entreprise sait ce que signifie chaque fait, dimension ou attribut.
- Du fait de sa dénormalisation, le modèle est optimisé pour des requêtes rapides, et de nombreuses plateformes relationnelles optimisent leurs plans d'exécution en conséquence.
- Ce schéma offre des performances élevées avec moins de jointures et une redondance des données minimisée.
- Les modèles dimensionnels s'adaptent facilement aux changements, car des colonnes peuvent être ajoutées aux tables de dimensions sans affecter les applications de veille stratégique existantes.
Qu'est-ce que le modèle de données multidimensionnel dans Data Warehouse ?
A modèle de données multidimensionnel représente les données sous forme de cubes de données, permettant de modéliser et de visualiser les données selon plusieurs dimensions définies par des dimensions et des faits. Un tel modèle est généralement organisé autour d'un thème central et représenté par une table de faits ; il constitue la base de… OLAP analyse.

