自然语言处理教程

⚡ 智能摘要

自然语言处理是人工智能的一个分支,它帮助计算机理解、解释和处理人类语言(例如英语或印地语),从而支持翻译、摘要、命名实体识别、语音识别和情感分析等任务。

  • 🧠 定义: 自然语言处理技术使机器能够读取、解释和理解人类语言的含义。
  • 🧩 五个组成部分: 形态分析、句法分析、语义分析、语篇分析和语用分析共同构建了语言结构。
  • 🔤 令牌化: 分析前,文本会被拆分成单词、子词或句子。
  • 📚 词向量: 周围的词语构成向量,通过上下文捕捉意义。
  • 🌍 应用环境: 搜索、语法纠错、翻译、摘要和情感分析都使用自然语言处理技术。
  • 🤖 人工智能增长: 机器学习和GPT模型推动了自然语言处理市场的快速扩张。

自然语言处理教程

什么是自然语言处理?

自然语言处理(NLP) 是一个分支 人工智能 它帮助计算机理解、解释和处理人类语言(例如英语或印地语),从而分析并推导出其含义。自然语言处理 (NLP) 帮助开发人员组织和构建知识,以执行翻译、摘要、命名实体识别、关系提取等任务。trac语音识别、语音识别和主题分割。

自然语言处理的历史

以下是自然语言处理发展史上的一些重要事件:

  • 1950年: 自然语言处理始于艾伦·图灵发表的一篇题​​为《计算机器与智能》的文章。
  • 1950年: 人们早期曾尝试实现俄语和英语之间的自动翻译。
  • 1960年: 乔姆斯基等人关于形式语言理论和生成句法的研究推动了该领域的发展。
  • 1990年: 概率模型和数据驱动模型已经相当普及。
  • 2000年: 大量的口述和文本数据变得可用。
  • 2013年: Google 引入了 Word2Vec,学习能够捕捉词语之间语义关系的词嵌入。
  • 2017年: Transformer 架构首次出现在《Attention Is All You Need》一书中,它利用自注意力机制来高效地处理语言。
  • 2018年: OpenAI 发布了 GPT 和 Google 发布 BERT,预训练的 Transformer 模型,提高了语言理解和生成能力。
  • 2020年: OpenAI 推出了 GPT-3,这是一个拥有 175 亿个参数的模型,可以根据简短的提示生成类似人类的文本。
  • 2022年: OpenAI 发布了 ChatGPT,将对话式大型语言模型带给了主流用户。
  • 2023年: GPT-4 和其他多模态模型增加了图像理解和更强的推理能力,而 Llama 等开源模型则扩大了访问权限。
  • 2024年: 优化的多模态模型(例如 GPT-4o)实现了实时文本、语音和视觉处理。
  • 2025年: 以推理为中心的大型语言模型提高了复杂自然语言处理任务的多步骤问题解决能力。
  • 2026年: 自然语言处理越来越依赖于内置于日常工具和工作流程中的智能体、多模态人工智能助手。

NLP 是如何运作的?

在学习自然语言处理(NLP)的工作原理之前,让我们先了解一下人类如何使用语言。我们每天都会说成千上万个词,而其他人会根据这些词做出各种各样的事情。我们认为这只是简单的交流,但语言的意义远不止于此。我们所说的话以及说话的方式总是包含着一定的语境。人工智能中的自然语言处理并不关注语音语调的变化,而是着重于理解语境模式。

计费示例:

Man is to woman as king is to __________?
Meaning(king) - meaning(man) + meaning(woman) = ?
The answer is: queen

这里我们可以很容易地进行对应,因为“男人”代表男性,“女人”代表女性。同样地,“国王”代表男性,其对应的女性称谓是“女王”。

计费示例:

Is king to kings as queen is to _______?
The answer is: queens

这里我们看到两个词,king 和 kings,一个是单数,另一个是复数。因此,当出现 queen 这个词时,它自然而然地与 queens 对应起来,同样构成单复数形式。

最大的问题是:我们如何知道词语的含义?答案是:我们通过经验学习。下一个问题是:计算机如何才能做到这一点?我们需要提供足够的数据,让机器通过经验学习。我们可以提供以下细节:

  • 女王陛下。
  • 女王在国事访问期间的讲话。
  • 伊丽莎白女王的王冠。
  • 女王的母亲。
  • 女王陛下慷慨大方。

通过以上示例,机器理解了“女王”这一实体。然后,机器创建词向量,其中词向量是由其周围的词语构建而成的。

自然语言处理如何创建词向量

该机器通过学习多个数据集,利用深度学习算法等机器学习方法,并根据相邻词语构建每个词向量,从而创建这些向量。公式如下:

vector(king) - vector(man) + vector(woman) = vector(?)

这相当于对词向量执行简单的代数运算,机器对此的回答是“皇后”。

NLP 的组成部分

人工智能中的自然语言处理主要包含以下五个组成部分:

  • 形态和词汇分析
  • 句法分析
  • 语义分析
  • 话语整合
  • 务实分析

NLP 的组成部分

NLP 的组成部分

形态和词汇分析

词汇分析涵盖词汇表,包括单词和短语。它分析、识别和描述单词的结构。它包括将文本划分为段落、句子和单词。单个单词会被分解成其组成部分,标点符号等非单词标记也会从单词中分离出来。

句法分析

人们普遍认为词是句法的最小单位。句法指的是任何一种语言的句子结构所遵循的原则和规则。句法关注词的正确排列,这会影响词义。这需要分析句子中的词语,遵循其语法结构,并将词语组合成一个能够展现它们之间关系的结构。

语义分析

语义分析是由句法分析器创建的一种结构,用于赋予词语意义。它将线性词语序列转化为结构,并展示词语之间的关联。语义分析只关注词语、短语和句子的字面意义,以及它们之间的语义关系。trac根据上下文判断字典释义。例如,“无色的绿色想法”会被语义分析拒绝,因为这个描述不合逻辑。

话语整合

语篇整合是指对语境的理解。任何一个句子的意义都取决于它周围的句子,并且也会影响后面句子的意义。例如,“他想要那个”这句话中的“那个”一词就取决于前面的语境。

务实分析

语用分析关注整体的交际和社会内容及其对理解的影响。它指的是在特定情境中推导出语言的真正含义。在这种分析中,重点始终在于对所说的话进行重新解读,从而理解其背后的真正含义。例如,“关窗户?”应该被理解为请求而非命令。语用分析通过应用一套描述合作对话的规则,帮助用户发现这种预期效果。

NLP 和书写系统

一种语言所使用的书写系统类型是决定文本预处理最佳方法的关键因素之一。书写系统可以分为:

  1. 表意文字: 大量的单个符号代表词语,例如日语和汉语。
  2. 音节的: 单个符号代表音节。
  3. 按字母顺序排列: 单个符号代表一个声音。

大多数书写系统采用音节文字或字母文字系统。即使是书写系统相对简单的英语,基于罗马字母,也使用表意符号,包括阿拉伯数字、货币符号($、£)和其他特殊符号。这带来了以下挑战:

  • Extrac从文本中理解词义(语义)是一项挑战。
  • 人工智能中的自然语言处理取决于语料库的质量。如果领域过于庞大,就很难理解上下文。
  • 这取决于字符集和语言。

如何实现 NLP

以下是一些常用的自然语言处理方法:

机器学习: 这些程序用于机器学习过程中。模型会自动关注最常见的情况。当我们手动编写规则时,由于人为错误,规则往往是不正确的。

统计推断: 自然语言处理可以利用统计推断算法。即使模型中包含不熟悉的词语或结构,这些算法也能帮助你构建出稳健的模型。

NLP 示例

如今,自然语言处理技术应用广泛。以下是一些常见的自然语言处理技术:

信息检索与网络搜索: Google雅虎、必应和其他 搜索引擎 他们的机器翻译技术基于自然语言处理深度学习模型。这使得算法能够读取网页上的文本,理解其含义,并将其翻译成另一种语言。

语法纠正: 自然语言处理技术被广泛应用于文字处理软件,例如微软 Word,用于拼写纠错和语法检查。

问题解答: 用户输入关键词,用自然语言提问。

文字总结: 这是将来自某个来源的重要信息进行总结,从而生成一个简短版本的过程。

机器翻译: 这是利用计算机应用程序将文本或语音从一种自然语言翻译成另一种自然语言的过程。

情绪分析: 自然语言处理技术帮助公司分析大量产品评论,并允许客户对特定产品提供反馈。

NLP 的未来

  • 人类可读的自然语言处理是人工智能领域最大的难题。它几乎等同于解决人工智能的核心问题,即让计算机拥有与人类一样的智能。
  • 借助自然语言处理技术,未来的机器将能够从在线信息中学习并将其应用于现实世界,尽管在这方面仍有很多工作要做。
  • 自然 Language Tool工具包(或称 NLTK)的效能持续提升。
  • 结合自然语言生成,计算机将更有能力接收和提供有用且丰富的信息或数据。

自然语言与计算机语言

以下是自然语言和计算机语言的主要区别:

参数 自然语言 计算机语言
歧义 它们的本质是模棱两可的。 它们的设计旨在做到明确无误。
冗余 自然语言采用大量冗余。 形式语言的冗余度较低。
字面意思 自然语言由习语和比喻构成。 形式语言的意思就是字面意思。

自然语言处理的优势

  • 用户可以询问任何主题的问题并在几秒钟内得到直接答复。
  • 自然语言处理系统以自然语言回答问题。
  • NLP系统提供精确的答案,不包含任何不必要或不需要的信息。
  • 答案的准确性会随着问题中提供的相关信息的数量而增加。
  • 自然语言处理帮助计算机用人类的语言与人类交流,并扩展其他与语言相关的任务。
  • 它使你能够以公正一致的方式,在不感到疲劳的情况下,进行比人类更多的基于语言的分析。
  • 它有助于构建高度非结构化的数据源。

NLP 的缺点

  • 复杂查询语言: 如果问题措辞不当或含糊不清,系统可能无法提供正确答案。
  • 该系统仅为一项特定任务而设计;由于其功能有限,无法适应新的领域和问题。
  • NLP系统可能缺少用户界面,以及允许用户与系统进行进一步交互的功能。

常见问题

分词将文本分解成称为词元的更小单元,词元可以是单词、子词、字符或句子。它是标注、解析或将文本输入模型之前的第一个预处理步骤。

词干提取通过简单的规则对词尾进行切割,例如将“studies”切成“studi”。词形还原则利用词汇和语法还原词形,例如将“studies”还原为“study”。词形还原更准确,但速度较慢。

命名实体识别 (NER) 能够检测并标注文本中的真实世界元素,例如人名、组织机构、地点和日期。它为搜索、问答和信息检索等应用提供支持。trac输电管道。

热门选择是 NLTK 用于教学和原型制作ping, 空间 用于快速生产流程,以及用于现代深度学习模型的 Hugging Face Transformers。

GPT模型是基于海量文本语料库训练的大型Transformer网络。它们代表了一种现代自然语言处理方法,能够生成和理解语言,只需极少的特定任务训练即可驱动聊天机器人、摘要器和翻译器。

机器学习利用已标注和未标注的文本训练模型,使其学习模式而非人工编写的规则。深度学习和词向量技术使这些模型能够捕捉上下文、含义以及词语之间的关系。

情感分析将文本分类为正面、负面或中性。企业利用这项技术来阅读产品评论、监控社交媒体,并大规模地评估客户满意度,而无需手动阅读每条信息。

客户服务、医疗保健和金融领域对人工智能自动化的需求正在迅速扩大市场,预计到 2026 年将达到约 34.83 亿美元,到 2032 年将达到约 93.76 亿美元。

总结一下这篇文章: