什么是大数据?类型、特征和示例

⚡ 智能摘要

大数据指的是规模庞大、种类繁多、变化迅速的信息集合,普通的数据库工具无法存储或处理这些信息,因此分布式平台和新的分析方法变得必不可少。

  • 🔘 定义: 单凭数据量并不能说明数据很大;复杂性和增长率同样重要。
  • ☑️ 三种类型: 结构化数据具有固定格式,非结构化数据没有固定格式,半结构化数据介于两者之间。
  • 示例: 股票交易所、社交平台和喷气式发动机每天都会产生数TB的新记录。
  • 🧪 特点: 数量、种类、速度和变化性是经典的四大要素,真实性和价值通常也会被考虑在内。
  • 🛠️ 商业价值: 外部情报、更快的客户反馈分析、更早的风险发现和更便宜的仓库卸货。
  • ⚠️ 立即扩大规模: 目前,全球每天大约产生 402 亿 TB 的数据。 trac到 2026 年,k 将超过 200 泽字节。

通过实例解释大数据类型和特征。

在介绍大数据之前,首先需要了解数据本身是什么。

什么是数据?

数据是指计算机用来执行操作的数量、字符或符号,这些数据可以被存储和使用。 transmit以电信号的形式记录,并记录在磁性、光学或机械记录介质上。

现在,让我们来看看大数据的定义。

什么是大数据?

大数据 大数据是指数据量庞大且随时间呈指数级增长的数据集。其规模和复杂性如此之高,以至于任何传统的数据管理工具都无法高效地存储或处理。大数据仍然是数据,但其规模之大,已经超出了常规工具的处理能力。

下图将该定义与组织已经处理的普通数据进行了对比,因此很容易看出规模上的飞跃。

大数据定义图及其与传统管理工具处理的数据的区别

什么是大数据?

什么是大数据的例子?

以下是一些大数据示例-

证券交易所数据

纽约证券交易所 是大数据的一个例子,它生成 XNUMXTB 每天有 3000 个新的贸易数据。

证券交易所交易大厅每天产生约1TB的交易数据。

社交媒体

统计数据显示 500+TB 的新数据被输入社交媒体网站的数据库 Facebook,每天。这些数据主要来自照片和视频上传、消息交流、发表评论等。

社交媒体图标展示了每日照片、视频和消息数据量。

喷气发动机

一个单一的 喷气发动机 可以生成 10+TB 中的数据 30分钟 飞行时间。每天有数千架飞机,产生的数据量高达 PB。

喷气发动机传感器在三十分钟的飞行中产生了超过十TB的遥测数据。

这三个数字是这些例子首次发布时各来源的快照,而此后它们的数量只增不减。为了便于理解目前的规模,全球整体上大约会产生…… 每天 402 亿 TB 的数据,将2026年的年度总额设定为 track 表示超过 200 泽字节。

大数据的类型

大数据的类型如下:

  1. 结构化
  2. 非结构化
  3. 半结构化

结构化

任何可以以固定格式存储、访问和处理的数据都称为“结构化”数据。随着时间的推移,计算机科学在开发结构化数据方面取得了巨大的成功。ping 处理这类数据(其格式事先已知)并从中提取价值的技术已经存在。然而,当这类数据规模急剧增长时,我们面临的问题就出现了,其典型大小可达数泽字节。

你知道吗? 一泽字节是 1021 字节,这是 十亿兆字节.

从这些数据可以看出,人们很容易理解为什么称之为大数据,并可以想象存储和处理大数据所面临的挑战。

你知道吗? 存储在关系数据库管理系统中的数据就是一个例子 '结构化的' 数据。

结构化数据的示例

数据库中的“员工”表就是一个结构化数据的例子。每一行都包含相同的五列,并且每一列都有明确的数据类型,这正是数据易于查询的原因。

员工ID 员工姓名 性别 问题类型 工资
2365 拉杰什·库尔卡尼 (男) 金融学 650000
3398 普拉提巴·乔希(Pratibha Joshi) (女) 管理員 650000
7465 舒希尔·罗伊 (男) 管理員 500000
7500 舒布吉特·达斯 (男) 金融学 500000
7699 普丽雅·萨内 (女) 金融学 550000

非结构化

任何形式或结构未知的数据都被归类为非结构化数据。除了数据量庞大之外,非结构化数据在处理和价值挖掘方面也面临诸多挑战。非结构化数据的典型例子是包含简单文本文件、图像、视频等多种类型的异构数据源。如今,企业拥有海量数据,但由于这些数据处于原始或非结构化状态,他们往往不知如何从中挖掘价值。

非结构化数据的示例

'Google “搜索”是无结构的:同一个查询会返回页面、图像、摘要和链接,而这些内容背后没有任何共同的架构。

Google 搜索结果页面就是一个非结构化数据的例子,其中包含文本、链接和图像等混合内容。

非结构化数据示例

半结构化

半结构化数据可以包含以上两种形式。它看起来结构化,但并非由正式的模式(例如关系数据库中的表定义)定义。 DBMS半结构化数据的常见例子是 XML 文件中表示的数据。JSON 文档和包含键值对的日志行也属于此类。

半结构化数据的示例

存储在 XML 文件中的个人数据

<rec><name>Prashant Rao</name><sex>Male</sex><age>35</age></rec>
<rec><name>Seema R.</name><sex>Female</sex><age>41</age></rec>
<rec><name>Satish Mane</name><sex>Male</sex><age>29</age></rec>
<rec><name>Subrato Roy</name><sex>Male</sex><age>26</age></rec>
<rec><name>Jeremiah J.</name><sex>Male</sex><age>35</age></rec>

多年来的数据增长

下图 trac随着数据总量的增加,结构化数据和非结构化数据的组合发生了怎样的变化?

历年数据增长图表显示,非结构化数据的增长速度超过了结构化数据。

多年来的数据增长

请注意: Web应用程序 非结构化数据包括日志文件、交易历史文件等。OLTP 系统是为处理结构化数据而构建的,其中数据存储在关系(表)中。

大数据的特点

大数据可以用以下特征来描述:

  • 音量
  • 品种
  • 速度
  • 变化性

(一)数量—— 大数据这个名称本身就与庞大的规模有关。数据规模在决定其价值方面起着至关重要的作用。此外,一组特定的数据是否能被视为大数据,也取决于其数据量。因此, '卷' 是处理大数据解决方案时需要考虑的一个特征。

(二)多样性—— 大数据的下一个方面是 各种.

多样性指的是数据来源的异质性以及数据的性质,包括结构化和非结构化数据。早期,大多数应用程序仅考虑电子表格和数据库作为数据来源。如今,电子邮件、照片、视频、监控设备、PDF、音频等形式的数据也被纳入分析应用程序的考虑范围。这种多样化的非结构化数据给数据的存储、挖掘和分析带来了一些挑战。

(三)速度 期限 '速度' 指的是数据生成的速度。数据生成和处理的速度,以及处理速度的快慢,决定了数据的真正潜力。

大数据速度指的是数据从业务流程、应用程序日志、网络、社交媒体网站、传感器等来源流入的速度。 通过手机捐款 设备等。数据流是巨大的、连续的。

(四)多变性—— 这是指数据有时会表现出不一致性,从而妨碍有效处理和管理数据的过程。

如今,人们通常还会在这个列表中添加另外两个特征,从而形成广为人知的“五V”:

  • 准确性 数据的可信度和准确性如何?重复记录、传感器漂移和字段缺失都会降低数据的真实性,而数据量再大也无法弥补这些缺陷。
  • 价值 ——数据经过分析后的真正价值所在。从未转化为决策的数据只会增加存储成本。

大数据处理的优势

数据库管理系统(DBMS)处理大数据能力带来了诸多好处,例如:

企业在做决策时可以利用外部信息

访问社交数据 搜索引擎 Facebook 和 X(前身为 Twitter)等网站使组织能够微调其业务战略。

改善客户服务

传统的客户反馈系统正被采用大数据技术设计的新系统所取代。在这些新系统中,大数据和自然语言处理技术被用于读取和评估消费者的反馈。

及早识别产品和服务风险

持续对交易记录、传感器读数和支持工单进行分析,可以在缺陷、欺诈模式和服务故障还很小的时候就发现它们,而不是等到月度报告才发现它们。

更好 Opera国家效率

大数据技术可用于创建新数据的暂存区或着陆区,然后再确定哪些数据应该迁移到其他位置。 数据仓库此外,大数据技术与数据仓库的这种集成有助于组织卸载不常用的数据。

常见问题

根据目前的估计,每天大约产生 402 亿 TB 的数据,这将使 2026 年的年度总量超过 200 ZB。这一数字还在持续攀升,因为视频、传感器遥测数据和应用程序日志的增长速度比交易记录更快。

Algorithms 在数百万条记录中寻找分析师无法手动审查的模式,然后根据这些模式对新记录进行评分。更大、更多样化的训练集通常能提高准确率,这也是这两个领域共同发展的原因。

它能很好地起草日常工作文件: Spark 转换、模式定义、SQL 连接和连接器配置。 Rev请仔细查看输出结果,因为生成的管道通常会忽略分区、数据类型和成本,而这正是实际管道失败的地方。

分布式存储,例如 高密度文件系统 或云对象存储、处理引擎等 Spark 以及 Flink、Kafka 等流式系统和查询层等。 蜂房托管云仓库现在涵盖了许多相同的工作。

数据质量差、所有权不明确、存储和计算成本高昂,以及能够运维分布式系统的工程师短缺,都是导致项目失败的原因。大多数失败的项目都停滞在治理和业务问题不明朗上,而非技术本身。

诸如GDPR之类的法规限制了可以收集哪些个人数据、可以保存多长时间以及可以存储在哪里。团队会根据同意情况做出回应。 trac管道中内置了策略保留、假名化和审计日志。

数据湖存储任意格式的原始文件,并在读取数据时应用结构化处理。数据仓库存储经过清理和建模的表,并在写入数据时应用结构化处理,这使得查询速度更快,但加载速度更慢。

先学习 SQL,然后再学习编程语言,例如 Python 或者 Scala,分布式处理 Spark还需要一个云平台,以及足够的数据建模能力来合理地设计表格。沟通同样重要,因为结果必须能够说服非技术读者。

总结一下这篇文章: