Qu’est-ce que Data Mart dans Data Warehouse ? Types et exemple
⚡ Résumé intelligent
La conception d'un data mart fournit un sous-ensemble ciblé d'informations d'entrepôt de données à un seul département, couvrant les trois types de data mart, les cinq phases allant de la conception à la gestion, et les meilleures pratiques qui garantissent une livraison rapide, sécurisée et rentable.

Un entrepôt de données apporte la puissance analytique d'un entrepôt de données au sein d'une seule équipe. En se concentrant sur un domaine précis, un data mart permet à un service d'analyser rapidement ses propres données, sans être pénalisé par la charge de travail globale de l'entreprise. Les sections suivantes expliquent ce qu'est un data mart, pourquoi les organisations l'utilisent, les trois types disponibles, ainsi que la manière de le mettre en œuvre et de le gérer.
Qu'est-ce que le Data Mart ?
Un data mart est axé sur un seul domaine fonctionnel d'une organisation et contient un sous-ensemble des données stockées dans un Entreposage De DonnéesIl s'agit d'une version condensée d'un entrepôt de données, conçue pour être utilisée par un département, une unité ou un groupe d'utilisateurs spécifique, par exemple le marketing, les ventes, les RH ou la finance.
Du fait de sa fonction unique, un entrepôt de données est généralement géré par un seul service au sein de l'organisation. Cette spécialisation permet de limiter son périmètre et d'en clarifier la responsabilité.
Un data mart puise ses données dans un nombre restreint de sources, contrairement à un entrepôt de données qui en intègre de nombreuses. De ce fait, les data marts sont de petite taille et bien plus flexibles qu'un entrepôt de données complet.
Pourquoi avons-nous besoin d’un Data Mart ?
Les organisations s'appuient sur les entrepôts de données pour plusieurs raisons pratiques :
- Un entrepôt de données améliore le temps de réponse des utilisateurs en réduisant le volume de données qu'ils interrogent.
- Il offre un accès facile aux données fréquemment demandées.
- Un data mart est plus simple et moins coûteux à mettre en œuvre qu'un entrepôt de données d'entreprise.
- Il est agile : lorsque le modèle change, un entrepôt de données plus petit peut être rapidement reconstruit.
- Un data mart est défini par un seul expert du domaine, tandis qu'un entrepôt de données est défini par une équipe interdisciplinaire ; un data mart est donc plus ouvert au changement.
- Les données sont partitionnées, ce qui permet des privilèges de contrôle d'accès très précis.
- Les données peuvent être segmentées et stockées sur différentes plateformes matérielles ou logicielles.
En résumé, comme un data mart traite une portion de données plus petite et bien définie, il est plus rapide à construire, moins coûteux à exploiter et plus facile à sécuriser qu'un entrepôt de données d'entreprise.
Cependant, les entrepôts de données ne sont pas tous construits de la même manière. La source à partir de laquelle un entrepôt de données s'appuie détermine le type d'entrepôt de données avec lequel il travaille (il en existe trois).
Types de datamart
Il existe trois principaux types de data mart, qui se distinguent par la source de leurs données :
- Dépendant: Les entrepôts de données dépendants puisent leurs données directement dans des sources opérationnelles, des sources externes, ou les deux.
- Indépendant: Un data mart indépendant est créé sans entrepôt de données central.
- hybride: Un data mart hybride peut exploiter des données provenant d'entrepôts de données ou de systèmes opérationnels.
Magasin de données dépendant
Un data mart dépendant centralise les données de l'organisation à partir d'un entrepôt de données unique. Si vous devez créer un ou plusieurs data marts physiques, configurez-les comme des data marts dépendants.
Un data mart dépendant peut être construit de deux manières : soit en permettant aux utilisateurs d’accéder à la fois au data mart et à l’entrepôt de données selon leurs besoins, soit en limitant l’accès au seul data mart. Cette seconde approche n’est pas optimale, car elle peut engendrer un « dépotoir de données » : des données issues d’une source commune, mais ensuite mises au rebut et largement inutilisées.

Magasin de données indépendant
Un data mart indépendant est créé sans entrepôt de données central. Ce type de data mart est idéal pour les petites équipes au sein d'une organisation.
Un data mart indépendant n'est lié ni à un entrepôt de données d'entreprise ni à aucun autre data mart. Ses données sont chargées et analysées de manière autonome. Cette approche va à l'encontre de la raison d'être d'un entrepôt de données : disposer d'un référentiel centralisé et cohérent de données d'entreprise, accessible à de nombreux utilisateurs aux intérêts variés.
Data Mart hybride
Un entrepôt de données hybride combine des données provenant de sources extérieures à l'entrepôt de données principal. Cela s'avère utile pour les intégrations ponctuelles, par exemple après l'ajout d'un nouveau groupe ou produit à l'organisation.
Il est parfaitement adapté aux environnements multi-bases de données et offre une mise en œuvre rapide avec un minimum de nettoyage des données. Un data mart hybride prend également en charge les structures de stockage volumineuses et convient parfaitement aux applications plus petites, axées sur les données.
Étapes de mise en œuvre d'un datamart
La mise en place d'un entrepôt de données est un processus gratifiant mais complexe. Elle se déroule en cinq phases : conception, construction, alimentation, accès et gestion, chacune étant décrite ci-dessous.
Conception
La conception est la première phase de la mise en œuvre d'un data mart. Elle englobe toutes les tâches, de la demande initiale de création d'un data mart à la collecte des exigences, et se termine par la conception logique et physique du data mart.
L'étape de conception implique les tâches suivantes :
- Recueillir les exigences fonctionnelles et techniques et identifier les sources de données.
- Sélection du sous-ensemble de données approprié.
- Concevoir la structure logique et physique du data mart.
Les données peuvent être partitionnées selon les critères suivants :
- Date
- unité commerciale ou fonctionnelle
- Zone géographique
- Toute combinaison de ce qui précède
Les données peuvent être partitionnées au niveau de l'application ou du SGBD, bien que le partitionnement au niveau de l'application soit recommandé car il permet d'adapter le modèle de données chaque année en fonction de l'évolution de l'environnement métier. La plupart des data marts sont construits sur un SGBD. modèle dimensionnel, comme un schéma en étoile, pour garantir la rapidité des requêtes.
De quels produits et technologies avez-vous besoin ?
Un simple stylo et du papier suffiront à ce stade. Les outils permettant de créer des diagrammes UML ou entité-relation peuvent également ajouter des métadonnées à vos conceptions logiques et physiques.
La construction
La construction est la deuxième phase de la mise en œuvre. Elle consiste à créer la base de données physique et les structures logiques.
Cette étape implique la tâche suivante :
- Mise en œuvre de la base de données physique conçue lors de la phase précédente — par exemple, création d'objets de schéma tels que des tables, des index et des vues.
De quels produits et technologies avez-vous besoin ?
Pour construire un data mart, vous avez besoin d'un système de gestion de base de données relationnelle (SGBDR). Un SGBDR offre plusieurs fonctionnalités essentielles à la réussite d'un data mart :
- Gestion du stockage: Un SGBDR stocke et gère des données, vous permettant de créer, d'ajouter et de supprimer des enregistrements.
- Accès rapide aux données : Grâce à une requête SQL, vous pouvez facilement récupérer des données en fonction de conditions ou de filtres spécifiques.
- Protection des données: Le SGBDR peut se remettre de pannes système telles que des coupures de courant et restaurer les données à partir de sauvegardes en cas de défaillance d'un disque.
- Prise en charge multi-utilisateurs : Il offre un accès simultané, permettant à plusieurs utilisateurs de lire et de modifier des données sans écraser les modifications des autres.
- Sécurité : Il réglemente quels utilisateurs peuvent accéder à quels objets et quelles opérations ils peuvent effectuer.
Peuplement
Dans la troisième phase, les données sont intégrées au data mart.
L'étape de remplissage implique les tâches suivantes :
- Carteping Données sources vers données cibles.
- Extracen extrayant les données sources.
- Nettoyage et transformation des données.
- Chargement des données dans le data mart.
- Création et stockage des métadonnées.
De quels produits et technologies avez-vous besoin ?
Vous effectuez ces tâches avec un ETL (ExtracL'outil t (Transform, Load) examine les sources de données et effectue une conversion source-cible.ping, puis extracts, transforme, nettoie et charge les données dans le data mart.
Au passage, l'outil crée également des métadonnées — des détails tels que la provenance des données, leur date de mise à jour, les modifications apportées et le niveau de synthèse appliqué.
Accès
L'accès aux données est la quatrième étape ; il permet de les exploiter : interroger les données, créer des rapports et des graphiques, et les publier. Les utilisateurs finaux soumettent des requêtes et consultent les résultats, souvent via… OLAP outils.
L'étape d'accès comprend les tâches suivantes :
- Mise en place d'une couche de métadonnées qui traduit les structures de la base de données et les noms des objets en termes métier, afin que les utilisateurs non techniques puissent accéder facilement à l'entrepôt de données.
- Mise en place et maintenance des structures de bases de données.
- Mise en place des API et des interfaces si nécessaire.
De quels produits et technologies avez-vous besoin ?
Vous pouvez accéder à l'entrepôt de données via la ligne de commande ou une interface graphique. Cette dernière est généralement privilégiée car elle permet de générer facilement des graphiques et est plus conviviale que la ligne de commande.
Gérant
La gestion est la dernière phase du processus de mise en œuvre d'un entrepôt de données. À l'aide d'une interface graphique ou de la ligne de commande, les équipes gèrent les tâches de gestion courantes telles que :
- Gestion continue des accès des utilisateurs.
- Optimisation et mise au point du système pour de meilleures performances.
- Ajout et gestion de nouvelles données dans l'entrepôt de données.
- Planifier des scénarios de reprise pour maintenir la disponibilité du système en cas de panne.
- Récupération suite à des pannes matérielles et logicielles tout en préservant les données.
Meilleures pratiques pour la mise en œuvre de Data Marts
Suivez ces bonnes pratiques tout au long du processus de mise en œuvre du data mart :
- Structurez la source d'un entrepôt de données par département.
- Mesurez le cycle de mise en œuvre en semaines plutôt qu'en mois ou en années.
- Impliquez toutes les parties prenantes dans la phase de planification et de conception, car la mise en œuvre d'un entrepôt de données peut s'avérer complexe.
- Établissez un budget précis pour le matériel, les logiciels, le réseau et les coûts de mise en œuvre de votre data mart.
- Même si un entrepôt de données partage le même matériel, il peut nécessiter un logiciel différent pour traiter les requêtes des utilisateurs ; il convient d’évaluer la puissance de traitement et le stockage supplémentaires nécessaires pour des réponses rapides.
- Lorsqu'un data mart est situé à un emplacement différent de celui de l'entrepôt de données, assurez-vous de disposer d'une capacité réseau suffisante pour déplacer les volumes de données requis.
- Prévoir un budget pour le temps de chargement, qui augmente à mesure que la complexité des transformations s'accroît.
Avantages et inconvénients d'un datamart
Comme tout choix d'architecture, un entrepôt de données présente des avantages évidents, mais aussi quelques inconvénients.
Avantages
- Un entrepôt de données contient un sous-ensemble de données à l'échelle de l'organisation qui est précieux pour un groupe spécifique d'utilisateurs.
- Il s'agit d'une alternative économique à un entrepôt de données, dont la construction peut s'avérer coûteuse.
- Un entrepôt de données permet un accès plus rapide aux données.
- Il est facile à utiliser, car il est conçu pour répondre aux besoins spécifiques de ses utilisateurs, ce qui peut accélérer les processus métier.
- Un data mart nécessite moins de temps de mise en œuvre qu'un entrepôt de données, puisqu'il se concentre uniquement sur un sous-ensemble des données.
- Il contient des données historiques qui aident les analystes à identifier les tendances.
Désavantages
- Les entreprises créent parfois trop de bases de données disparates et sans lien entre elles, ce qui les rend difficiles à maintenir.
- Un entrepôt de données ne peut pas fournir une analyse de données à l'échelle de l'entreprise, car son ensemble de données est limité.
