数据仓库中的数据集市是什么?类型和示例

⚡ 智能摘要

数据集市设计向一个部门提供重点数据仓库信息子集,涵盖三种数据集市类型、从设计到管理的五个阶段,以及保持交付快速、安全和经济高效的最佳实践。

  • 🎯 定义: 数据集市是数据仓库中面向特定主题的子集,专为销售、市场营销、人力资源或财务等特定部门而构建。
  • 🧩 超市类型: 依赖型超市从中央仓库进货,独立型超市直接从运营系统进货,混合型超市则结合了这两种方式。
  • ⚙️ 实施阶段: 构建数据集市包括设计、构建、填充、访问和管理五个步骤。
  • ???? ETL 和关系数据库管理系统: 关系数据库管理系统 (RDBMS) 存储数据集市,而 ETL 工具则负责映射、转换等操作。tracts 转换、清理并加载源数据及元数据。
  • 📊 立体设计: 围绕星型模式对数据进行建模可以加快查询速度,并简化业务用户的报表生成。
  • ???? 商业冲击: 较小的范围意味着更快的查询速度、更低的成本、更严格的访问控制以及比整个仓库更快的交付速度。
  • 🧭 最佳实践: 将交付周期控制在几周以内,合理规划硬件和网络预算,并尽早让所有利益相关者参与进来。

数据仓库中的数据集市展示了依赖型、独立型和混合型数据集市

数据集市带来了强大的分析能力 数据仓库 数据仓库服务于单个团队。通过专注于单一主题领域,部门可以快速分析自身数据,而无需等待企业级工作负载的处理。以下章节将解释什么是数据仓库、组织为何使用数据仓库、三种可用类型以及如何实施和管理数据仓库。

什么是数据集市?

数据集市专注于组织的单一职能领域,并包含存储在数据仓库中的数据子集。 数据仓库它是数据仓库的精简版,专为特定部门、单位或用户组(例如市场部、销售部、人力资源部或财务部)使用而设计。

由于数据仓库的功能单一,因此通常由组织内的单个部门控制。这种集中化管理方式使其范围狭窄,所有权也清晰明确。

与整合众多数据源的数据仓库不同,数据集市仅从少数几个数据源提取数据。因此,数据集市规模较小,且比完整的数据仓库灵活得多。

为什么需要数据集市?

组织机构依赖数据集市的原因有很多:

  • 数据集市通过减少用户查询的数据量来提高用户的响应速度。
  • 它可以轻松访问经常请求的数据。
  • 数据集市比企业数据仓库更容易实施,成本也更低。
  • 它具有敏捷性:当模型发生变化时,可以快速重建较小的数据集市。
  • 数据集市由单个领域专家定义,而数据仓库由跨学科团队定义,因此数据集市更容易发生变化。
  • 数据被分区,从而可以实现非常精细的访问控制权限。
  • 数据可以分段存储在不同的硬件或软件平台上。

简而言之,由于数据集市处理的是较小、定义明确的数据切片,因此与企业数据仓库相比,它的构建速度更快、运行成本更低、安全性也更容易保障。

然而,并非所有数据集市的构建方式都相同。数据集市所依赖的数据源决定了你正在处理三种类型中的哪一种。

数据集市的类型

根据数据来源的不同,数据集市主要分为三种类型:

  1. 依赖: 依赖型数据集市直接从运营源、外部源或两者提取数据。
  2. 独立: 无需中央数据仓库即可创建独立数据集市。
  3. 混合型: 混合数据集市可以从数据仓库或运营系统中获取数据。

依赖数据集市

依赖型数据集市从单个数据仓库获取组织的数据,从而实现集中化管理。如果您需要构建一个或多个物理数据集市,则需要将它们配置为依赖型数据集市。

构建依赖型数据集市有两种方式:一种是用户根据需要访问数据集市和数据仓库;另一种是访问权限仅限于数据集市。第二种方式并非最佳选择,因为它可能会产生“数据垃圾场”——数据虽然源自同一数据源,但最终被弃用且基本未被利用。

从单个数据仓库提取数据的依赖数据集市
依赖数据集市

独立数据集市

独立数据集市无需中央数据仓库即可创建。这种数据集市是组织内小型团队的理想选择。

独立数据集市与企业数据仓库或任何其他数据集市均无关联。其数据独立加载和分析。这种方法违背了构建数据仓库的初衷:建立一个一致、集中的企业数据存储平台,供众多具有不同需求的用户进行分析。

无需中央数据仓库即可创建的独立数据集市

独立数据集市

混合数据集市

混合数据集市整合了来自数据仓库以外来源的输入数据。这有助于您进行临时集成——例如,在组织中添加新团队或产品之后。

它非常适合多数据库环境,能够以最少的数据清理工作量实现快速部署。混合数据集市也支持大型存储结构,并且非常适合规模较小的以数据为中心的应用程序。

混合数据集市,将数据仓库与其他数据源结合起来

混合数据集市

实施数据集市的步骤

构建数据集市的五个步骤

实施数据集市的步骤

构建数据集市是一个很有成就感但又非常细致的过程。它分为五个阶段——设计、构建、填充、访问和管理——每个阶段都将在下面进行描述。

设计

设计是数据集市实施的第一阶段。它涵盖从最初提出数据集市需求到收集需求,直至完成数据集市的逻辑和物理设计的所有任务。

设计步骤涉及以下任务:

  • 收集业务和技术需求,并确定数据来源。
  • 选择适当的数据子集。
  • 设计数据集市的逻辑和物理结构。

数据可以根据以下标准进行分区:

  • 日期
  • 业务或职能部门
  • 地理
  • 以上任意组合

数据可以在应用程序层或数据库管理系统 (DBMS) 层进行分区,但建议在应用程序层进行分区,因为它允许随着业务环境的变化每年采用不同的数据模型。大多数数据集市都是基于此构建的。 维度模型例如,星型模式,以保持查询速度快。

您需要哪些产品和技术?

现阶段,简单的纸笔就足够了。一些可以帮助你创建 UML 图或实体关系图的工具,还可以为你的逻辑设计和物理设计添加元数据。

建造中

构建是实施的第二阶段。它包括创建物理数据库和逻辑结构。

此步骤包含以下任务:

  • 实现早期阶段设计的物理数据库——例如,创建表、索引和视图等模式对象。

您需要哪些产品和技术?

你需要一个关系数据库管理系统(RDBMS)来构建数据集市。RDBMS 提供了一些对数据集市成功至关重要的功能:

  • 存储管理: 关系数据库管理系统 (RDBMS) 存储和管理数据,允许您创建、添加和删除记录。
  • 快速数据访问: 通过 SQL 查询,您可以轻松地根据特定条件或筛选条件检索数据。
  • 数据保护: 关系数据库管理系统可以从断电等系统故障中恢复,并在磁盘发生故障时从备份中恢复数据。
  • 多用户支持: 它提供并发访问,因此多个用户可以读取和修改数据,而不会覆盖彼此的更改。
  • 安全性: 它规定了哪些用户可以访问哪些对象以及可以执行哪些操作。

填充

第三阶段,数据被填充到数据集市中。

填充步骤涉及以下任务:

  • 地图ping 源数据到目标数据。
  • Extrac读取源数据。
  • 清理和转换数据。
  • 将数据加载到数据集市中。
  • 创建和存储元数据。

您需要哪些产品和技术?

您可以使用 ETL(例如)来执行这些任务。tract(转换、加载)工具。它会检查数据源,并执行源到目标的映射。ping然后是 extrac对数据进行转换、清洗,并将数据加载到数据集市中。

在此过程中,该工具还会创建元数据——例如数据来源、数据的新旧程度、所做的更改以及应用的汇总级别等详细信息。

访问

访问是第四步,它指的是对数据的使用:查询数据、构建报表和图表,以及发布它们。最终用户提交查询并查看结果,通常是通过以下方式: OLAP 工具。

访问步骤包括以下任务:

  • 建立元层,将数据库结构和对象名称转换为业务术语,以便非技术用户可以轻松访问数据集市。
  • 建立和维护数据库结构。
  • 如有需要,设置 API 和接口。

您需要哪些产品和技术?

您可以使用命令行或图形用户界面 (GUI) 访问数据集市。通常首选 GUI,因为它能轻松生成图表,而且比命令行更易于使用。

管理的

管理是数据集市实施过程的最后阶段。团队可以使用图形用户界面 (GUI) 或命令行来处理诸如以下方面的日常管理任务:

  • 持续的用户访问管理。
  • 系统优化和微调,以获得更好的性能。
  • 在数据集市中添加和管理新数据。
  • 制定恢复方案,以确保系统在发生故障时仍能可用。
  • 在硬件和软件故障中恢复,同时保留数据。

实施数据集市的最佳实践

在数据仓库实施过程中,请遵循以下最佳实践:

  • 按部门构建数据集市的数据源结构。
  • 以周而不是月或年来衡量实施周期。
  • 让所有利益相关者参与规划和设计阶段,因为数据集市的实施可能很复杂。
  • 准确预算数据集市硬件、软件、网络和实施成本。
  • 即使数据集市共享硬件,也可能需要不同的软件来处理用户查询;评估快速响应所需的额外处理能力和存储空间。
  • 当数据集市与数据仓库位于不同的位置时,要确保有足够的网络容量来传输所需的数据量。
  • 加载时间需要预留预算,随着转换复杂性的增加,加载时间也会增加。

数据集市的优点和缺点

与任何架构选择一样,数据集市在带来明显优势的同时,也存在一些权衡取舍。

优势

  • 数据集市保存着组织范围内一部分对特定用户群体有价值的数据。
  • 它是一种经济高效的数据仓库替代方案,而构建数据仓库的成本可能很高。
  • 数据集市可以加快数据访问速度。
  • 它易于使用,因为它是针对用户的特定需求而设计的,这可以加快业务流程。
  • 数据集市比数据仓库需要更少的实施时间,因为它只关注数据的一个子集。
  • 它包含历史数据,有助于分析师识别趋势。

缺点

  • 企业有时会创建太多分散的、不相关的数据集市,这会导致维护困难。
  • 数据集市无法提供公司范围内的数据分析,因为它的数据集有限。

常见问题

A 数据仓库 企业级存储库涵盖所有主题,而数据集市则存储着一个规模较小、面向特定主题的部门数据子集。数据集市构建成本更低、速度更快、查询速度也更快,但它们无法提供公司范围内的分析。

数据集市存储针对特定业务功能建模的结构化、处理后的数据。数据湖则大规模存储任何类型的原始数据——结构化、半结构化或非结构化数据。数据集市用于快速生成报告;数据湖则支持探索性数据科学和机器学习。

大多数数据集市都使用 维度模型通常情况下,星型模式包含一个中心事实表和多个维度表。雪花模式则进一步规范化了这些维度。两者都能加快查询速度,并简化业务用户的报表生成流程。

销售数据集市存储着销售团队所需的客户交易、收入和销售渠道指标。市场营销、财务和人力资源数据集市的工作方式相同,为每个部门提供预先汇总的数据,而无需查询整个企业数据仓库。

数据集市支持 OLAP它不是 OLTP 系统。它针对读取、聚合和分析历史数据以生成报表和仪表板进行了优化,而不是针对事务性 OLTP 系统处理的快速插入和更新操作。

云数据集市运行在托管的云数据仓库平台上,而不是本地服务器上。它无需硬件管理,可按需扩展存储和计算资源,并且通常按查询计费,从而降低成本并加快部署速度。

人工智能和机器学习工具通过分析源数据、推荐模式和维度、生成 ETL 映射,加速了数据集市的工作。ping并标记数据质量问题。他们还提出了分区和索引策略建议,但工程师在将每项建议部署到生产环境之前都应该进行审查。

是的。 ChatGPTGitHub 副驾驶 根据简短提示编写 SQL 查询、星型模式 DDL 和 ETL 脚本。 Rev运行前请检查输出结果,确保表名、连接和粒度正确,因为生成的代码可能会遗漏业务规则。

总结一下这篇文章: