Qu’est-ce que Data Mart dans Data Warehouse ? Types et exemple

⚡ Résumé intelligent

La conception d'un data mart fournit un sous-ensemble ciblé d'informations d'entrepôt de données à un seul département, couvrant les trois types de data mart, les cinq phases allant de la conception à la gestion, et les meilleures pratiques qui garantissent une livraison rapide, sécurisée et rentable.

  • (I.e. Définition: Un data mart est un sous-ensemble d'un entrepôt de données orienté sujet, conçu pour un département spécifique tel que les ventes, le marketing, les RH ou la finance.
  • 🧩 Types de marchés : Les magasins dépendants s'approvisionnent auprès d'un entrepôt central, les magasins indépendants puisent directement dans les systèmes opérationnels, et les magasins hybrides combinent les deux.
  • ⚙️ Phases de mise en œuvre : La construction d'un entrepôt de données comprend les étapes de conception, de construction, de remplissage, d'accès et de gestion.
  • ???? ETL et SGBDR : Un SGBDR stocke le magasin tandis qu'un outil ETL effectue une transformation, par exempletracts, transforme, nettoie et charge les données sources ainsi que les métadonnées.
  • (I.e. Conception dimensionnelle : La modélisation des données autour d'un schéma en étoile accélère les requêtes et simplifie la production de rapports pour les utilisateurs métiers.
  • 💡 Impact sur les entreprises: Un périmètre plus restreint signifie des requêtes plus rapides, des coûts moindres, un contrôle d'accès plus strict et une livraison plus rapide qu'avec un entrepôt complet.
  • 🧭 Meilleure pratique : Limitez le cycle de livraison à quelques semaines, budgétisez le matériel et le réseau, et impliquez toutes les parties prenantes dès le début.

Un data mart dans un entrepôt de données montrant des data marts dépendants, indépendants et hybrides

Un entrepôt de données apporte la puissance analytique d'un entrepôt de données au sein d'une seule équipe. En se concentrant sur un domaine précis, un data mart permet à un service d'analyser rapidement ses propres données, sans être pénalisé par la charge de travail globale de l'entreprise. Les sections suivantes expliquent ce qu'est un data mart, pourquoi les organisations l'utilisent, les trois types disponibles, ainsi que la manière de le mettre en œuvre et de le gérer.

Qu'est-ce que le Data Mart ?

Un data mart est axé sur un seul domaine fonctionnel d'une organisation et contient un sous-ensemble des données stockées dans un Entreposage De DonnéesIl s'agit d'une version condensée d'un entrepôt de données, conçue pour être utilisée par un département, une unité ou un groupe d'utilisateurs spécifique, par exemple le marketing, les ventes, les RH ou la finance.

Du fait de sa fonction unique, un entrepôt de données est généralement géré par un seul service au sein de l'organisation. Cette spécialisation permet de limiter son périmètre et d'en clarifier la responsabilité.

Un data mart puise ses données dans un nombre restreint de sources, contrairement à un entrepôt de données qui en intègre de nombreuses. De ce fait, les data marts sont de petite taille et bien plus flexibles qu'un entrepôt de données complet.

Pourquoi avons-nous besoin d’un Data Mart ?

Les organisations s'appuient sur les entrepôts de données pour plusieurs raisons pratiques :

  • Un entrepôt de données améliore le temps de réponse des utilisateurs en réduisant le volume de données qu'ils interrogent.
  • Il offre un accès facile aux données fréquemment demandées.
  • Un data mart est plus simple et moins coûteux à mettre en œuvre qu'un entrepôt de données d'entreprise.
  • Il est agile : lorsque le modèle change, un entrepôt de données plus petit peut être rapidement reconstruit.
  • Un data mart est défini par un seul expert du domaine, tandis qu'un entrepôt de données est défini par une équipe interdisciplinaire ; un data mart est donc plus ouvert au changement.
  • Les données sont partitionnées, ce qui permet des privilèges de contrôle d'accès très précis.
  • Les données peuvent être segmentées et stockées sur différentes plateformes matérielles ou logicielles.

En résumé, comme un data mart traite une portion de données plus petite et bien définie, il est plus rapide à construire, moins coûteux à exploiter et plus facile à sécuriser qu'un entrepôt de données d'entreprise.

Cependant, les entrepôts de données ne sont pas tous construits de la même manière. La source à partir de laquelle un entrepôt de données s'appuie détermine le type d'entrepôt de données avec lequel il travaille (il en existe trois).

Types de datamart

Il existe trois principaux types de data mart, qui se distinguent par la source de leurs données :

  1. Dépendant: Les entrepôts de données dépendants puisent leurs données directement dans des sources opérationnelles, des sources externes, ou les deux.
  2. Indépendant: Un data mart indépendant est créé sans entrepôt de données central.
  3. hybride: Un data mart hybride peut exploiter des données provenant d'entrepôts de données ou de systèmes opérationnels.

Magasin de données dépendant

Un data mart dépendant centralise les données de l'organisation à partir d'un entrepôt de données unique. Si vous devez créer un ou plusieurs data marts physiques, configurez-les comme des data marts dépendants.

Un data mart dépendant peut être construit de deux manières : soit en permettant aux utilisateurs d’accéder à la fois au data mart et à l’entrepôt de données selon leurs besoins, soit en limitant l’accès au seul data mart. Cette seconde approche n’est pas optimale, car elle peut engendrer un « dépotoir de données » : des données issues d’une source commune, mais ensuite mises au rebut et largement inutilisées.

Data Mart dépendant tirant des données d'un seul entrepôt de données
Magasin de données dépendant

Magasin de données indépendant

Un data mart indépendant est créé sans entrepôt de données central. Ce type de data mart est idéal pour les petites équipes au sein d'une organisation.

Un data mart indépendant n'est lié ni à un entrepôt de données d'entreprise ni à aucun autre data mart. Ses données sont chargées et analysées de manière autonome. Cette approche va à l'encontre de la raison d'être d'un entrepôt de données : disposer d'un référentiel centralisé et cohérent de données d'entreprise, accessible à de nombreux utilisateurs aux intérêts variés.

Data Mart indépendant créé sans entrepôt de données central

Magasin de données indépendant

Data Mart hybride

Un entrepôt de données hybride combine des données provenant de sources extérieures à l'entrepôt de données principal. Cela s'avère utile pour les intégrations ponctuelles, par exemple après l'ajout d'un nouveau groupe ou produit à l'organisation.

Il est parfaitement adapté aux environnements multi-bases de données et offre une mise en œuvre rapide avec un minimum de nettoyage des données. Un data mart hybride prend également en charge les structures de stockage volumineuses et convient parfaitement aux applications plus petites, axées sur les données.

Entrepôt de données hybride combinant un entrepôt de données avec d'autres sources

Data Mart hybride

Étapes de mise en œuvre d'un datamart

Les cinq étapes de la mise en œuvre d'un entrepôt de données

Étapes de mise en œuvre d'un datamart

La mise en place d'un entrepôt de données est un processus gratifiant mais complexe. Elle se déroule en cinq phases : conception, construction, alimentation, accès et gestion, chacune étant décrite ci-dessous.

Conception

La conception est la première phase de la mise en œuvre d'un data mart. Elle englobe toutes les tâches, de la demande initiale de création d'un data mart à la collecte des exigences, et se termine par la conception logique et physique du data mart.

L'étape de conception implique les tâches suivantes :

  • Recueillir les exigences fonctionnelles et techniques et identifier les sources de données.
  • Sélection du sous-ensemble de données approprié.
  • Concevoir la structure logique et physique du data mart.

Les données peuvent être partitionnées selon les critères suivants :

  • Date
  • unité commerciale ou fonctionnelle
  • Zone géographique
  • Toute combinaison de ce qui précède

Les données peuvent être partitionnées au niveau de l'application ou du SGBD, bien que le partitionnement au niveau de l'application soit recommandé car il permet d'adapter le modèle de données chaque année en fonction de l'évolution de l'environnement métier. La plupart des data marts sont construits sur un SGBD. modèle dimensionnel, comme un schéma en étoile, pour garantir la rapidité des requêtes.

De quels produits et technologies avez-vous besoin ?

Un simple stylo et du papier suffiront à ce stade. Les outils permettant de créer des diagrammes UML ou entité-relation peuvent également ajouter des métadonnées à vos conceptions logiques et physiques.

La construction

La construction est la deuxième phase de la mise en œuvre. Elle consiste à créer la base de données physique et les structures logiques.

Cette étape implique la tâche suivante :

  • Mise en œuvre de la base de données physique conçue lors de la phase précédente — par exemple, création d'objets de schéma tels que des tables, des index et des vues.

De quels produits et technologies avez-vous besoin ?

Pour construire un data mart, vous avez besoin d'un système de gestion de base de données relationnelle (SGBDR). Un SGBDR offre plusieurs fonctionnalités essentielles à la réussite d'un data mart :

  • Gestion du stockage: Un SGBDR stocke et gère des données, vous permettant de créer, d'ajouter et de supprimer des enregistrements.
  • Accès rapide aux données : Grâce à une requête SQL, vous pouvez facilement récupérer des données en fonction de conditions ou de filtres spécifiques.
  • Protection des données: Le SGBDR peut se remettre de pannes système telles que des coupures de courant et restaurer les données à partir de sauvegardes en cas de défaillance d'un disque.
  • Prise en charge multi-utilisateurs : Il offre un accès simultané, permettant à plusieurs utilisateurs de lire et de modifier des données sans écraser les modifications des autres.
  • Sécurité : Il réglemente quels utilisateurs peuvent accéder à quels objets et quelles opérations ils peuvent effectuer.

Peuplement

Dans la troisième phase, les données sont intégrées au data mart.

L'étape de remplissage implique les tâches suivantes :

  • Carteping Données sources vers données cibles.
  • Extracen extrayant les données sources.
  • Nettoyage et transformation des données.
  • Chargement des données dans le data mart.
  • Création et stockage des métadonnées.

De quels produits et technologies avez-vous besoin ?

Vous effectuez ces tâches avec un ETL (ExtracL'outil t (Transform, Load) examine les sources de données et effectue une conversion source-cible.ping, puis extracts, transforme, nettoie et charge les données dans le data mart.

Au passage, l'outil crée également des métadonnées — des détails tels que la provenance des données, leur date de mise à jour, les modifications apportées et le niveau de synthèse appliqué.

Accès

L'accès aux données est la quatrième étape ; il permet de les exploiter : interroger les données, créer des rapports et des graphiques, et les publier. Les utilisateurs finaux soumettent des requêtes et consultent les résultats, souvent via… OLAP outils.

L'étape d'accès comprend les tâches suivantes :

  • Mise en place d'une couche de métadonnées qui traduit les structures de la base de données et les noms des objets en termes métier, afin que les utilisateurs non techniques puissent accéder facilement à l'entrepôt de données.
  • Mise en place et maintenance des structures de bases de données.
  • Mise en place des API et des interfaces si nécessaire.

De quels produits et technologies avez-vous besoin ?

Vous pouvez accéder à l'entrepôt de données via la ligne de commande ou une interface graphique. Cette dernière est généralement privilégiée car elle permet de générer facilement des graphiques et est plus conviviale que la ligne de commande.

Gérant

La gestion est la dernière phase du processus de mise en œuvre d'un entrepôt de données. À l'aide d'une interface graphique ou de la ligne de commande, les équipes gèrent les tâches de gestion courantes telles que :

  • Gestion continue des accès des utilisateurs.
  • Optimisation et mise au point du système pour de meilleures performances.
  • Ajout et gestion de nouvelles données dans l'entrepôt de données.
  • Planifier des scénarios de reprise pour maintenir la disponibilité du système en cas de panne.
  • Récupération suite à des pannes matérielles et logicielles tout en préservant les données.

Meilleures pratiques pour la mise en œuvre de Data Marts

Suivez ces bonnes pratiques tout au long du processus de mise en œuvre du data mart :

  • Structurez la source d'un entrepôt de données par département.
  • Mesurez le cycle de mise en œuvre en semaines plutôt qu'en mois ou en années.
  • Impliquez toutes les parties prenantes dans la phase de planification et de conception, car la mise en œuvre d'un entrepôt de données peut s'avérer complexe.
  • Établissez un budget précis pour le matériel, les logiciels, le réseau et les coûts de mise en œuvre de votre data mart.
  • Même si un entrepôt de données partage le même matériel, il peut nécessiter un logiciel différent pour traiter les requêtes des utilisateurs ; il convient d’évaluer la puissance de traitement et le stockage supplémentaires nécessaires pour des réponses rapides.
  • Lorsqu'un data mart est situé à un emplacement différent de celui de l'entrepôt de données, assurez-vous de disposer d'une capacité réseau suffisante pour déplacer les volumes de données requis.
  • Prévoir un budget pour le temps de chargement, qui augmente à mesure que la complexité des transformations s'accroît.

Avantages et inconvénients d'un datamart

Comme tout choix d'architecture, un entrepôt de données présente des avantages évidents, mais aussi quelques inconvénients.

Avantages

  • Un entrepôt de données contient un sous-ensemble de données à l'échelle de l'organisation qui est précieux pour un groupe spécifique d'utilisateurs.
  • Il s'agit d'une alternative économique à un entrepôt de données, dont la construction peut s'avérer coûteuse.
  • Un entrepôt de données permet un accès plus rapide aux données.
  • Il est facile à utiliser, car il est conçu pour répondre aux besoins spécifiques de ses utilisateurs, ce qui peut accélérer les processus métier.
  • Un data mart nécessite moins de temps de mise en œuvre qu'un entrepôt de données, puisqu'il se concentre uniquement sur un sous-ensemble des données.
  • Il contient des données historiques qui aident les analystes à identifier les tendances.

Désavantages

  • Les entreprises créent parfois trop de bases de données disparates et sans lien entre elles, ce qui les rend difficiles à maintenir.
  • Un entrepôt de données ne peut pas fournir une analyse de données à l'échelle de l'entreprise, car son ensemble de données est limité.

FAQ

A entrepôt de données Un entrepôt de données est un référentiel d'entreprise couvrant tous les sujets, tandis qu'un data mart contient un sous-ensemble plus restreint et spécialisé pour un seul département. Les data marts sont moins chers, plus rapides à créer et plus rapides à interroger, mais ils ne permettent pas d'effectuer une analyse à l'échelle de l'entreprise.

Un entrepôt de données stocke des données structurées et traitées, modélisées pour une fonction métier spécifique. Un lac de données stocke des données brutes de tout type (structurées, semi-structurées ou non structurées) à grande échelle. Les entrepôts de données permettent une génération rapide de rapports ; les lacs de données favorisent l’exploration des données et l’apprentissage automatique.

La plupart des entrepôts de données utilisent un modèle dimensionnelUn schéma en étoile classique comporte une table de faits centrale liée à des tables de dimensions. Un schéma en flocon de neige normalise davantage ces dimensions. Ces deux schémas accélèrent les requêtes et simplifient la production de rapports pour les utilisateurs métiers.

Un entrepôt de données commerciales centralise les transactions clients, le chiffre d'affaires et les indicateurs de performance du pipeline pour l'équipe commerciale. Les entrepôts de données marketing, finance et RH fonctionnent de la même manière, fournissant à chaque service des données pré-agrégées sans avoir à interroger l'ensemble de l'entrepôt de données de l'entreprise.

Un data mart prend en charge OLAPIl ne s'agit pas d'un système OLTP. Il est optimisé pour la lecture, l'agrégation et l'analyse des données historiques en vue de la création de rapports et de tableaux de bord, plutôt que pour les insertions et mises à jour rapides gérées par les systèmes OLTP transactionnels.

Un data mart cloud s'exécute sur une plateforme d'entrepôt de données cloud gérée, et non sur des serveurs sur site. Il élimine la gestion du matériel, fait évoluer le stockage et la puissance de calcul à la demande et facture généralement par requête, ce qui réduit les coûts et accélère le déploiement.

L'IA et les outils d'apprentissage automatique accélèrent le travail sur les entrepôts de données en profilant les données sources, en recommandant des schémas et des dimensions, et en générant des flux ETL.pingIls permettent de signaler les problèmes de qualité des données et proposent des stratégies de partitionnement et d'indexation. Toutefois, il est recommandé aux ingénieurs d'examiner chaque recommandation avant de la déployer en production.

Oui. ChatGPT et Copilote GitHub Génération de requêtes SQL préliminaires, de DDL en étoile et de scripts ETL à partir d'une simple invite. RevVérifiez le résultat pour vous assurer de l'exactitude des noms de tables, des jointures et du niveau de détail avant de l'exécuter, car le code généré peut omettre des règles métier.

Résumez cet article avec :