数据仓库中的数据集市是什么?类型和示例

数据集市带来了强大的分析能力 数据仓库 数据仓库服务于单个团队。通过专注于单一主题领域,部门可以快速分析自身数据,而无需等待企业级工作负载的处理。以下章节将解释什么是数据仓库、组织为何使用数据仓库、三种可用类型以及如何实施和管理数据仓库。
什么是数据集市?
数据集市专注于组织的单一职能领域,并包含存储在数据仓库中的数据子集。 数据仓库它是数据仓库的精简版,专为特定部门、单位或用户组(例如市场部、销售部、人力资源部或财务部)使用而设计。
由于数据仓库的功能单一,因此通常由组织内的单个部门控制。这种集中化管理方式使其范围狭窄,所有权也清晰明确。
与整合众多数据源的数据仓库不同,数据集市仅从少数几个数据源提取数据。因此,数据集市规模较小,且比完整的数据仓库灵活得多。
为什么需要数据集市?
组织机构依赖数据集市的原因有很多:
- 数据集市通过减少用户查询的数据量来提高用户的响应速度。
- 它可以轻松访问经常请求的数据。
- 数据集市比企业数据仓库更容易实施,成本也更低。
- 它具有敏捷性:当模型发生变化时,可以快速重建较小的数据集市。
- 数据集市由单个领域专家定义,而数据仓库由跨学科团队定义,因此数据集市更容易发生变化。
- 数据被分区,从而可以实现非常精细的访问控制权限。
- 数据可以分段存储在不同的硬件或软件平台上。
简而言之,由于数据集市处理的是较小、定义明确的数据切片,因此与企业数据仓库相比,它的构建速度更快、运行成本更低、安全性也更容易保障。
然而,并非所有数据集市的构建方式都相同。数据集市所依赖的数据源决定了你正在处理三种类型中的哪一种。
数据集市的类型
根据数据来源的不同,数据集市主要分为三种类型:
- 依赖: 依赖型数据集市直接从运营源、外部源或两者提取数据。
- 独立: 无需中央数据仓库即可创建独立数据集市。
- 混合型: 混合数据集市可以从数据仓库或运营系统中获取数据。
依赖数据集市
依赖型数据集市从单个数据仓库获取组织的数据,从而实现集中化管理。如果您需要构建一个或多个物理数据集市,则需要将它们配置为依赖型数据集市。
构建依赖型数据集市有两种方式:一种是用户根据需要访问数据集市和数据仓库;另一种是访问权限仅限于数据集市。第二种方式并非最佳选择,因为它可能会产生“数据垃圾场”——数据虽然源自同一数据源,但最终被弃用且基本未被利用。

独立数据集市
独立数据集市无需中央数据仓库即可创建。这种数据集市是组织内小型团队的理想选择。
独立数据集市与企业数据仓库或任何其他数据集市均无关联。其数据独立加载和分析。这种方法违背了构建数据仓库的初衷:建立一个一致、集中的企业数据存储平台,供众多具有不同需求的用户进行分析。
混合数据集市
混合数据集市整合了来自数据仓库以外来源的输入数据。这有助于您进行临时集成——例如,在组织中添加新团队或产品之后。
它非常适合多数据库环境,能够以最少的数据清理工作量实现快速部署。混合数据集市也支持大型存储结构,并且非常适合规模较小的以数据为中心的应用程序。
实施数据集市的步骤
构建数据集市是一个很有成就感但又非常细致的过程。它分为五个阶段——设计、构建、填充、访问和管理——每个阶段都将在下面进行描述。
设计
设计是数据集市实施的第一阶段。它涵盖从最初提出数据集市需求到收集需求,直至完成数据集市的逻辑和物理设计的所有任务。
设计步骤涉及以下任务:
- 收集业务和技术需求,并确定数据来源。
- 选择适当的数据子集。
- 设计数据集市的逻辑和物理结构。
数据可以根据以下标准进行分区:
- 日期
- 业务或职能部门
- 地理
- 以上任意组合
数据可以在应用程序层或数据库管理系统 (DBMS) 层进行分区,但建议在应用程序层进行分区,因为它允许随着业务环境的变化每年采用不同的数据模型。大多数数据集市都是基于此构建的。 维度模型例如,星型模式,以保持查询速度快。
您需要哪些产品和技术?
现阶段,简单的纸笔就足够了。一些可以帮助你创建 UML 图或实体关系图的工具,还可以为你的逻辑设计和物理设计添加元数据。
建造中
构建是实施的第二阶段。它包括创建物理数据库和逻辑结构。
此步骤包含以下任务:
- 实现早期阶段设计的物理数据库——例如,创建表、索引和视图等模式对象。
您需要哪些产品和技术?
你需要一个关系数据库管理系统(RDBMS)来构建数据集市。RDBMS 提供了一些对数据集市成功至关重要的功能:
- 存储管理: 关系数据库管理系统 (RDBMS) 存储和管理数据,允许您创建、添加和删除记录。
- 快速数据访问: 通过 SQL 查询,您可以轻松地根据特定条件或筛选条件检索数据。
- 数据保护: 关系数据库管理系统可以从断电等系统故障中恢复,并在磁盘发生故障时从备份中恢复数据。
- 多用户支持: 它提供并发访问,因此多个用户可以读取和修改数据,而不会覆盖彼此的更改。
- 安全性: 它规定了哪些用户可以访问哪些对象以及可以执行哪些操作。
填充
第三阶段,数据被填充到数据集市中。
填充步骤涉及以下任务:
- 地图ping 源数据到目标数据。
- Extrac读取源数据。
- 清理和转换数据。
- 将数据加载到数据集市中。
- 创建和存储元数据。
您需要哪些产品和技术?
您可以使用 ETL(例如)来执行这些任务。tract(转换、加载)工具。它会检查数据源,并执行源到目标的映射。ping然后是 extrac对数据进行转换、清洗,并将数据加载到数据集市中。
在此过程中,该工具还会创建元数据——例如数据来源、数据的新旧程度、所做的更改以及应用的汇总级别等详细信息。
访问
访问是第四步,它指的是对数据的使用:查询数据、构建报表和图表,以及发布它们。最终用户提交查询并查看结果,通常是通过以下方式: OLAP 工具。
访问步骤包括以下任务:
- 建立元层,将数据库结构和对象名称转换为业务术语,以便非技术用户可以轻松访问数据集市。
- 建立和维护数据库结构。
- 如有需要,设置 API 和接口。
您需要哪些产品和技术?
您可以使用命令行或图形用户界面 (GUI) 访问数据集市。通常首选 GUI,因为它能轻松生成图表,而且比命令行更易于使用。
管理的
管理是数据集市实施过程的最后阶段。团队可以使用图形用户界面 (GUI) 或命令行来处理诸如以下方面的日常管理任务:
- 持续的用户访问管理。
- 系统优化和微调,以获得更好的性能。
- 在数据集市中添加和管理新数据。
- 制定恢复方案,以确保系统在发生故障时仍能可用。
- 在硬件和软件故障中恢复,同时保留数据。
实施数据集市的最佳实践
在数据仓库实施过程中,请遵循以下最佳实践:
- 按部门构建数据集市的数据源结构。
- 以周而不是月或年来衡量实施周期。
- 让所有利益相关者参与规划和设计阶段,因为数据集市的实施可能很复杂。
- 准确预算数据集市硬件、软件、网络和实施成本。
- 即使数据集市共享硬件,也可能需要不同的软件来处理用户查询;评估快速响应所需的额外处理能力和存储空间。
- 当数据集市与数据仓库位于不同的位置时,要确保有足够的网络容量来传输所需的数据量。
- 加载时间需要预留预算,随着转换复杂性的增加,加载时间也会增加。
数据集市的优点和缺点
与任何架构选择一样,数据集市在带来明显优势的同时,也存在一些权衡取舍。
优势
- 数据集市保存着组织范围内一部分对特定用户群体有价值的数据。
- 它是一种经济高效的数据仓库替代方案,而构建数据仓库的成本可能很高。
- 数据集市可以加快数据访问速度。
- 它易于使用,因为它是针对用户的特定需求而设计的,这可以加快业务流程。
- 数据集市比数据仓库需要更少的实施时间,因为它只关注数据的一个子集。
- 它包含历史数据,有助于分析师识别趋势。
缺点
- 企业有时会创建太多分散的、不相关的数据集市,这会导致维护困难。
- 数据集市无法提供公司范围内的数据分析,因为它的数据集有限。
