Teradata教程:数据库 Archi结构与类型

⚡ 智能摘要

Teradata SQL 运行于专为企业级数据仓库构建的大规模并行关系数据库之上。本页将介绍解析引擎、BYNET 和 AMP 架构、支持的 DDL、DCL 和 DML 命令集以及实际业务应用。

  • 🏛️ 核心定义: Teradata 是一个基于大规模并行处理技术的商业关系数据库管理系统,而不是开源引擎。
  • ⚙️ 三个组成部分: 解析引擎规划查询,BYNET 移动行,访问模块处理器搜索各自的磁盘。
  • 📈 线性可扩展性: 添加节点会按比例提高吞吐量,因为无共享设计消除了并行单元之间的争用。
  • 🧾 指挥覆盖范围: DDL 创建对象,DCL 授予权限,DML 选择、更新和删除行。
  • ☁️ 现代平台: Vantage、VantageCloud 和 ClearScape Analytics 将引擎扩展到云端和数据库内机器学习。

Teradata 教程

什么是 Teradata?

Teradata数据 是一个用于开发的商业关系数据库管理系统ping 大规模数据仓库应用。该工具利用并行处理的概念,支持同时执行多个数据仓库操作。Teradata 是一个大规模并行处理系统,支持 Unix/Linux/Windows 服务器平台。

Teradata 软件由美国 IT 公司 Teradata Corporation 开发。它是分析数据平台、应用程序和其他相关服务的供应商。该公司开发了一种产品来整合来自各种来源的数据并使数据可供分析。

为何选择 Teradata?

  • Teradata 提供全套服务,重点关注 数据仓库
  • 该系统建立在开放式架构上。因此,无论何时推出任何更快的设备,都可以将其纳入已构建的架构中。
  • Teradata 支持 50+PB 的数据。
  • 使用 Service Workstation 的大型 Teradata 多节点系统的单一操作视图
  • 兼容多种 BI工具 获取数据。
  • 它可以作为 DBA 的单一控制点来管理 数据库.
  • 高性能、多样化查询、数据库内分析和复杂的工作负载管理
  • Teradata 可让您在多个部署选项上获取相同的数据

这些优势是在四十年的时间里逐步积累起来的,如下面的时间线所示。

Teradata 的历史

Teradata公司由加州理工学院的研究人员于1979年与花旗银行合作创立。1991年,NCR公司收购了该公司。2007年10月,Teradata分拆上市,成为一家独立的上市公司,Michael Koehler担任首任首席执行官。公司总部位于圣地亚哥,自2020年以来一直由总裁兼首席执行官Steve McMillan领导。

Teradata 公司的里程碑:

  • 1979 年 – Teradata 成立
  • 1984 年——发布第一台数据库计算机 DBC/1012
  • 1986 年 – 《财富》杂志将 Teradata 评为“年度产品”
  • 1991年——NCR公司收购Teradata
  • 1999 年 – 使用 Teradata 构建的最大数据库,容量为 130 TB
  • 2002 年 – Teradata V2R5 版本发布,具有压缩和分区主功能
  • 2006 年 – 推出 Teradata 主数据管理解决方案
  • 2007年——Teradata从NCR分离出来,成为一家独立公司。
  • 2008 年 – Teradata 13.0 发布,搭载 Active Data Warehousing
  • 2011 年 - 收购 Teradata Aster,进军高级分析领域
  • 2012 年 – 推出 Teradata 14.0
  • 2014 年 – 推出 Teradata 15.0
  • 2015年——Teradata收购应用营销平台Appoxee
  • 2017年——Teradata收购圣地亚哥的StackIQ
  • 2018 年 – Teradata Vantage 作为统一分析平台发布
  • 2022 年 – VantageCloud Lake 发布,用于云原生分析
  • 2023年——ClearScape Analytics大规模地在数据库内添加人工智能和机器学习功能。
  • 2024 年 – 为 Apache Iceberg 添加了对 opentable 格式的支持, Delta Lake,并在 AWS 上发布 Teradata AI Unlimited, Azure 交易市场
  • 2025年——推出企业级矢量存储、开源MCP服务器和AgentBuilder,以支持智能体AI工作负载。
  • 2026 年——Teradata 自主知识平台于 5 月发布,并将于 7 月在云端、本地和混合部署环境中全面推出。

接下来在本 Teradata 教程中,我们将了解 Teradata 的功能。

Teradata SQL 的功能

Teradata 提供以下强大的功能:

  • 线性可扩展性: 通过添加节点来提高系统性能,在处理大量数据时提供线性可扩展性。
  • 无限并行: Teradata 基于 MPP(大规模并行处理 Archi所以它从一开始就被设计为并行的。它可以将一个大任务分成几个小任务,然后并行运行
  • 成熟的优化器: Teradata Optimizer 最多可以处理一个查询中的 64 个连接。
  • 低总体拥有成本(TCO): Teradata总体拥有成本低,易于安装、维护和管理。
  • 加载和卸载实用程序: Teradata 提供加载和卸载实用程序以将数据移入或移出 Teradata 系统。
  • 连接方式: 该MPP系统可以连接到通道附加系统,如大型机或网络附加系统。
  • SQL: Teradata 支持 SQL 与表中存储的数据进行交互。它提供了其扩展。
  • 强大的实用程序: Teradata 提供强大的实用程序来从 Teradata 系统(如 FastExport、FastLoad、MultiLoad 和 TPT)导入/导出数据。
  • 自动分配: Teradata数据 可以自动将数据分发到磁盘,无需人工干预。

接下来在本 Teradata SQL 教程中,我们将学习 Teradata Archi结构。

Teradata数据 Archi质地

Teradata 架构是一种大规模并行处理 Archi结构。

Teradata 的三个重要组件是:

  • 解析引擎
  • 碧雅特
  • 访问模块处理器 (AMP)

Teradata 存储 Archi建筑数据库 Archi结构图:

Teradata数据 Archi质地
Teradata数据 Archi结构图

上图 trac这是解析引擎发出的请求,经由 BYNET 最终到达拥有磁盘的 AMP。以下两个小节将分别按此路径进行描述。

Teradata 存储 Archi质地

解析引擎:

解析引擎解析查询并准备执行计划。它为用户管理会话。它优化并向用户发送请求。

因此,当客户端执行插入记录的查询时,解析引擎会将记录发送到消息传递层。消息传递层或 BYNET 是一个软件和硬件组件。它提供联网功能。它还会检索记录并将行发送到目标 AMP。

放大器:

AMP 代表访问模块处理器。它将记录存储在这些磁盘上。AMP 进行以下活动:

  • 管理数据库的一部分
  • 管理每张桌子的一部分
  • 执行与生成结果集相关的所有任务,例如排序、聚合和连接
  • 执行锁和空间管理

Teradata 检索 Archi质地

当客户端运行查询以检索记录时,解析引擎会向 BYNET 发送请求。然后 BYNET 会将检索请求发送到适当的 AMP。

AMP 并行搜索磁盘并识别所需记录并将其发送到 BYNET。BYNET 将记录发送到解析引擎,解析引擎随后将发送给客户端。

接下来在本 Teradata 数据库教程中,我们将学习 Teradata SQL 命令。

Teradata SQL 命令类型

Teradata 数据库支持以下基本 SQL 命令:

  1. 数据定义语言 (DDL) 命令
  2. 数据控制语言 (DCL) 命令
  3. 数据操作语言 (DML) 命令

数据定义语言命令

指挥 描述
CREATE 创建新的数据库、表、用户等。
下降 删除新的数据库、表、用户等。
改变 更改表、列、触发器等。
调整 更改数据库或用户定义
改名 更改表、视图、宏等的名称。

数据控制语言命令

指挥 描述
授予/撤销 用于控制用户对对象的权限
授予登录权/撤销登录权 用于控制主机或主机组的登录权限
用于将一个数据库对象赋予另一个数据库对象

Teradata数据库SQL数据操作语言命令

指挥 描述
删除 从表中删除一行
ECHO 用于向客户端回显字符串或命令
检查点 定义日志中的恢复点,稍后可用于恢复表内容
选择 用于以表格形式返回特定行的数据
更新 修改表中一行或多行的数据

Teradata 产品套件和部署选项

无论在哪个版本下运行,这些命令的行为都完全相同,因为 Teradata 在多个交付模型中都使用同一个引擎。

  • Teradata Vantage: 核心平台结合了 SQL 引擎、工作负载管理和对象存储连接器。
  • VantageCloud 企业版: 在 AWS 上进行托管部署 Azure 或 Google Cloud 适用于仓库搬迁自有硬件。
  • VantageCloud Lake: 一个云原生、对象存储优先的版本,具有独立的计算集群,可实现弹性工作负载。
  • ClearScape 分析: 数据库内层除了数据之外,还运行机器学习和时间序列函数。
  • 本地部署版 IntelliFlex: 专为受监管工作负载而设计的硬件,这些工作负载必须保留在私有数据中心内。

由于同一个 SQL 语句在这些版本中保持不变,因此混合部署很常见。

Teradata 数据库的应用

以下是流行的 Teradata 应用程序:

  • 客户数据管理: 有助于与客户维持长期关系。
  • 主数据管理: 有助于建立可以使用、同步和存储主数据的环境。
  • 财务和绩效管理: 帮助组织提高财务报告的速度和质量。降低财务基础设施成本,并主动管理企业绩效。
  • 供应链管理: 改善供应链运作,有助于改善客户服务、缩短周期时间并降低库存。
  • 需求链管理: 有助于提高客户服务水平和销售额。它还可以帮助公司准确预测其商店商品的需求。

接下来,在本 Teradata 初学者教程中,我们将了解 Teradata 与其他 RDBMS.

Teradata 与其他 RDBMS 之间的区别

参数 Teradata数据 RDBMS
Archi讲座 遵循无共享 Archi结构。 共享一切并允许资源争用。
加工流程 MIPS [每秒百万条指令] KIPS(千指令/秒)
指数 更好的分发和检索 仅提供 FASI 检索
排比 支持无条件并行。 并行是有条件的且不可预测的
批量加载 Teradata 允许批量加载。 仅允许有限的批量负载。
可扩展性 斜率为 1 的线性可扩展性 收益递减的可扩展性
数据库缓冲区 所有并行单元 (UoP) 共用一个数据库缓冲区。所有并行单元 (UoP) 均可访问同一个数据存储。 查询控制器将函数发送给拥有数据的 UoP
商店 它存储了太字节[Bill行离子] 千兆字节 [百万行]

上面提到的“无共享”行取决于接下来要比较的处理模型。

MPP 与 SMP

MPP的 SMP
MPP——大规模并行处理。它是连接许多并行运行的独立运算单元或整个微处理器的计算机系统。 对称多处理。在 SMP 处理系统中,CPU 共享相同的内存,因此一个系统中运行的代码可能会影响另一个系统中使用的内存。
数据库可以通过添加新的 CPU 来扩展。 SMP 数据库通常使用一个 CPU 来执行数据库搜索。
在 MPP 环境中,由于物理计算机之间不需要共享任何资源,因此性能得到了提高。 并行作业的工作负载分布在系统的各个处理器上。
大规模并行处理系统的性能是线性的。但是,它会随着节点数量的增加而成比例增加。 SMP 数据库可以在多台服务器上运行。但是,将共享其他资源。

常见问题

主索引决定哪个 AMP 存储每一行​​数据。Teradata 对索引列进行哈希处理,并将该行数据路由到匹配的 AMP,因此,精心选择的索引可以均匀地分布数据,避免数据倾斜。

Teradata Studio 是当前的图形客户端,取代了旧版的 SQL Assistant。BTEQ 处理来自终端的脚本批处理工作,而标准的 ODBC 或 JDBC 驱动程序则连接第三方数据库。 BI工具.

生产平台采用商业许可,但 Teradata 提供免费的 ClearScape Analytics Experience 环境和开发者试用版,足以练习 SQL、索引和查询规划。

ClearScape Analytics 直接对存储的行运行 SQL 语句,执行机器学习、评分和时间序列功能。ping 除了数据之外,模型还可以移除导出步骤,让预测使用整个数据仓库而不是样本。

AI 助手可以生成查询语句并建议索引或连接更改,但优化器统计信息和业务规则仍需人工审核。请将生成的 SQL 视为初始草稿,切勿将其作为生产版本发布。

总结一下这篇文章: