此词汇表定义了人工智能术语。
A
消融
一种用于评估特征或组件重要性的技术,方法是将相应特征或组件暂时从模型中移除。然后,您可以在不使用该特征或组件的情况下重新训练模型,如果重新训练后的模型性能明显下降,则表明移除的特征或组件可能很重要。
例如,假设您使用 10 个特征训练了一个分类模型,并在测试集上实现了 88% 的精确率。如需检查第一个特征的重要性,您可以仅使用其他 9 个特征重新训练模型。如果重新训练后的模型性能明显下降(例如,精确率为 55%),则表明移除的特征可能很重要。反之,如果重新训练后的模型表现同样出色,则该特征可能并不那么重要。
消融还可以帮助确定以下各项的重要性:
- 较大的组件,例如大型机器学习系统的整个子系统
- 流程或技术,例如数据预处理步骤
在这两种情况下,您都会观察到在移除组件后,系统的性能会发生怎样的变化(或不发生变化)。
A/B 测试
一种比较两种(或更多种)技术(即 A 和 B)的统计方法。通常,A 是现有技术,而 B 是新技术。A/B 测试不仅可以确定哪种技术的效果更好,还可以确定这种差异是否具有统计显著性。
A/B 测试通常会比较两种技术在单个指标上的表现;例如,两种技术在模型准确率方面的比较结果如何?不过,A/B 测试也可以比较任意有限数量的指标。
加速器芯片
一类专门的硬件组件,旨在执行深度学习算法所需的主要计算。
与通用 CPU 相比,加速器芯片(简称加速器)可以显著提高训练和推理任务的速度和效率。它们非常适合训练神经网络和处理类似的计算密集型任务。
加速器芯片的示例包括:
- Google 的张量处理单元 (TPU),具有专用于深度学习的硬件。
- NVIDIA 的 GPU 虽然最初是为图形处理而设计的,但旨在实现并行处理,从而显著提高处理速度。
准确性
正确的分类预测数量除以预测总数。具体来说:
例如,如果某个模型做出了 40 次正确预测和 10 次错误预测,那么其准确率为:
二元分类为不同类别的正确预测和错误预测提供了具体名称。因此,二元分类的准确率公式如下:
其中:
如需了解详情,请参阅机器学习速成课程中的分类:准确率、召回率、精确率和相关指标。
act
智能体循环中的一个阶段,在此阶段中,智能体会执行在推理阶段选择的操作。例如,行动阶段可以发送 API 请求。
action
在强化学习中,智能体在环境的状态之间转换的机制。智能体使用政策选择操作。
行动空间
代理可用于执行任务的一组资源。操作空间可能包括智能体可以调用的工具和 API,以及智能体拥有的权限。 一般来说,动作空间应足够大,以便智能体执行任务。如果动作空间过小,智能体可能没有足够的资源来执行任务。如果动作空间过大,智能体往往更容易出错。
激活函数
一种函数,可使神经网络能够学习特征与标签之间的非线性(复杂)关系。
常用的激活函数包括:
激活函数的图从不是单条直线。 例如,ReLU 激活函数的图由两条直线组成:
Sigmoid 激活函数的图如下所示:
如需了解详情,请参阅机器学习速成课程中的神经网络:激活函数。
主动学习
一种训练方法,采用这种方法时,算法会选择从中学习规律的部分数据。当有标签样本稀缺或获取成本高昂时,主动学习尤其有用。主动学习算法会选择性地寻找学习所需的特定范围的样本,而不是盲目地寻找各种各样的有标签样本。
AdaGrad
一种先进的梯度下降法,用于重新调整每个形参的梯度,以便有效地为每个形参指定独立的学习速率。如需查看完整说明,请参阅用于在线学习和随机优化的自适应次梯度方法。
改编
与调优或微调的含义相同。
代理
能够对用户输入进行推理,以便代表用户规划和执行操作的软件。
在强化学习中,智能体是使用政策来最大限度提高从环境的状态转换中获得的预期回报的实体。
代理型
agent 的形容词形式。Agentic 是指智能体所具备的特质(例如自主性)。
智能体循环
智能体反复执行的循环,直到满足终止条件。该周期通常包括以下四个阶段:
智能体工作流
一种动态流程,其中智能体自主规划和执行行动以实现目标。该过程可能涉及推理、调用外部工具和自行纠正方案。
智能体编排
跨多个子代理或 LLM 调用的任务的集中管理和路由。智能体编排功能可将复杂任务分解为更小的子任务,并将其分配给最能胜任的子智能体。
凝聚式层次聚类
请参阅层次聚类。
AI 生成的垃圾
生成式 AI 系统生成的输出,侧重于数量而非质量。例如,包含 AI 生成的垃圾的网页充斥着低成本制作的 AI 生成的低质量内容。
异常值检测
识别离群点的过程。例如,如果某个特征的平均值为 100,标准差为 10,那么异常检测功能应将 200 的值标记为可疑。
AR
增强现实的缩写。
PR 曲线下的面积
ROC 曲线下面积
请参阅 AUC(ROC 曲线下面积)。
人工通用智能
一种非人类机制,可展现广泛的问题解决能力、创造力和适应性。例如,展示通用人工智能的程序可以翻译文本、创作交响乐,并在尚未发明的游戏中表现出色。
人工智能
能够解决复杂任务的非人类程序或模型。 例如,翻译文本的程序或模型,以及根据放射影像识别疾病的程序或模型都展现出了人工智能。
从形式上讲,机器学习是人工智能的一个子领域。不过,近年来,一些组织开始交替使用人工智能和机器学习这两个术语。
Attention
一种用于神经网络的机制,用于指示特定字词或字词部分的重要性。注意力机制可压缩模型预测下一个 token/字词所需的信息量。典型的注意力机制可能包含一组输入的加权和,其中每个输入的权重由神经网络的另一部分计算得出。
另请参阅 自注意力机制和多头自注意力机制,它们是 Transformer 的构建块。
如需详细了解自注意力机制,请参阅机器学习速成课程中的 LLM:什么是大语言模型?。
属性
与特征的含义相同。
在机器学习公平性方面,属性通常是指与个人相关的特征。
属性抽样
一种用于训练决策森林的策略,其中每个决策树在学习条件时仅考虑随机选择的可能特征子集。一般来说,每个节点都会对不同的特征子集进行抽样。相比之下,在训练不进行属性抽样的决策树时,系统会考虑每个节点的所有可能特征。
AUC(ROC 曲线下面积)
一个介于 0.0 和 1.0 之间的数字,表示二元分类模型区分正类别和负类别的能力。 AUC 越接近 1.0,模型区分不同类别的能力就越好。
例如,下图展示了一个完美区分正类别(绿色椭圆)和负类别(紫色矩形)的分类模型。这个不切实际的完美模型的 AUC 为 1.0:
相反,下图显示了生成随机结果的分类模型的结果。此模型的 AUC 为 0.5:
是的,上述模型的 AUC 为 0.5,而不是 0.0。
大多数模型都介于这两个极端之间。例如,以下模型在一定程度上区分了正例和负例,因此其 AUC 介于 0.5 和 1.0 之间:
AUC 会忽略您为分类阈值设置的任何值。相反,AUC 会考虑所有可能的分类阈值。
如需了解详情,请参阅机器学习速成课程中的分类:ROC 和 AUC。
增强现实
一种将计算机生成的图像叠加到用户看到的真实世界上的技术,从而提供合成视图。
自动编码器
一种可学习从输入中提取最重要信息的系统。自动编码器是编码器和解码器的组合。自动编码器依赖于以下两步流程:
- 编码器将输入映射到(通常)有损的低维(中间)格式。
- 解码器通过将低维格式映射到原始高维输入格式来构建原始输入的有损版本。
通过让解码器尝试尽可能准确地从编码器的中间格式重建原始输入,对自动编码器进行端到端训练。由于中间格式比原始格式小(维度更低),因此自动编码器必须学习输入中哪些信息是必不可少的,并且输出不会与输入完全相同。
例如:
- 如果输入数据是图形,则非精确复制的图形与原始图形类似,但会进行一些修改。可能非精确副本会去除原始图形中的噪声或填充一些缺失的像素。
- 如果输入数据是文本,自动编码器会生成模仿(但不等同于)原始文本的新文本。
另请参阅变分自编码器。
自动评估
使用软件来判断模型输出的质量。
如果模型输出相对简单,脚本或程序可以将模型输出与标准回答进行比较。这种类型的自动评估有时称为程序化评估。ROUGE 或 BLEU 等指标通常有助于进行程序化评估。
如果模型输出复杂或没有唯一正确的答案,则有时会由一个名为自动评分器的单独机器学习程序执行自动评估。
与人工评估相对。
自动化偏差
是指针对自动化决策系统所给出的建议的偏差,在此偏差范围内,即使系统出现错误,决策者也会优先考虑自动化决策系统给出的建议,而不是非自动化系统给出的建议。
如需了解详情,请参阅机器学习速成课程中的公平性:偏差类型。
AutoML
用于构建机器学习 模型的任何自动化流程。AutoML 可以自动执行以下任务:
AutoML 对数据科学家很有用,因为它可以节省他们开发机器学习流水线的时间和精力,并提高预测准确率。对于非专业人士,它也很有用,因为它可以让他们更轻松地完成复杂的机器学习任务。
如需了解详情,请参阅机器学习速成课程中的自动化机器学习 (AutoML)。
自主智能体
一种通过规划、行动和适应来达成复杂目标的智能体,无需持续的人工干预。
自动评估器评估
一种用于评判生成式 AI 模型输出质量的混合机制,它将人工评估与自动评估相结合。自动评估器是一种基于人工评估生成的数据训练的机器学习模型。理想情况下,自动评估器会学习模仿人类评估者。虽然有预建的自动评分器,但最好是专门针对您要评估的任务进行微调的自动评分器。
自回归模型
一种模型,可根据其自身的先前预测推断预测结果。例如,自回归语言模型会根据之前预测的 token 来预测下一个 token。所有基于 Transformer 的大语言模型都是自回归模型。
相比之下,基于 GAN 的图像模型通常不是自回归的,因为它们通过一次前向传递生成图片,而不是以迭代方式分步生成图像。不过,某些图片生成模型是自回归模型,因为它们会分步生成图片。
辅助损失
一种与神经网络 模型的主要损失函数结合使用的损失函数,有助于在权重随机初始化的早期迭代期间加速训练。
辅助损失函数会将有效梯度推送到更早的层。这有助于通过解决梯度消失问题,在训练期间实现收敛。
前 k 名的平均精确率
一种用于总结模型在生成排名结果(例如图书推荐的编号列表)的单个提示上的表现的指标。k 处的平均精确率是指每个相关结果的k 处精确率值的平均值。 因此,前 k 个结果的平均精确率的公式为:
\[{\text{average precision at k}} = \frac{1}{n} \sum_{i=1}^n {\text{precision at k for each relevant item} } \]
其中:
- \(n\) 是列表中的相关商品数量。
与 k 处的召回率相对。
轴对齐条件
在决策树中,仅涉及单个特征的条件。例如,如果 area 是一个特征,则以下是轴对齐条件:
area > 200
与斜条件相对。
B
反向传播
训练神经网络需要多次迭代以下双向传递周期:
- 在前向传递期间,系统会处理一个包含 个示例的批次,以生成预测结果。系统会将每个预测值与每个标签值进行比较。预测值与标签值之间的差值就是相应示例的损失。系统会汇总所有示例的损失,以计算当前批次的总损失。
- 在反向传递(反向传播)期间,系统会通过调整所有隐藏层中所有神经元的权重来减少损失。
神经网络通常包含多个隐藏层中的许多神经元。每个神经元以不同的方式影响总体损失。 反向传播算法会确定是增加还是减少应用于特定神经元的权重。
学习速率是一种乘数,用于控制每次向后传递时每个权重增加或减少的程度。与较小的学习速率相比,较大的学习速率会更大幅度地增加或减少每个权重。
从微积分的角度来看,反向传播实现了微积分中的链式法则。也就是说,反向传播会计算误差相对于每个参数的偏导数。
多年前,机器学习从业者必须编写代码才能实现反向传播。Keras 等现代机器学习 API 现在会为您实现反向传播。好,
如需了解详情,请参阅机器学习速成课程中的神经网络。
装袋
一种用于训练集成的方法,其中每个组成模型都基于有放回抽样的随机训练示例子集进行训练。例如,随机森林是使用 Bagging 训练的决策树的集合。
术语“bagging”是“bootstrap aggregating”(自助抽样集成)的简称。
如需了解详情,请参阅“决策森林”课程中的随机森林。
词袋
词组或段落中的字词的表示法,不考虑字词顺序。例如,以下三个词组的词袋完全一样:
- the dog jumps
- jumps the dog
- dog jumps the
每个字词都映射到稀疏向量中的一个索引,其中词汇表中的每个字词都在该向量中有一个索引。例如,词组“the dog jumps”会映射到一个特征向量,该特征向量在字词“the”“dog”和“jumps”对应的三个索引处包含非零值。非零值可以是以下任一值:
- 1,表示某个字词存在。
- 某个字词出现在词袋中的次数。例如,如果词组为“the maroon dog is a dog with maroon fur”,那么“maroon”和“dog”都会表示为 2,其他字词则表示为 1。
- 其他一些值,例如,某个字词出现在词袋中的次数的对数。
baseline
一种用作参考点的模型,用于比较另一模型(通常是更复杂的模型)的效果。例如,逻辑回归模型可以作为深度模型的良好基准。
对于特定问题,基准有助于模型开发者量化新模型必须达到的最低预期性能,以便新模型发挥作用。
基础模型
一种预训练模型,可作为微调的起点,以解决特定任务或应用问题。
批处理
一次训练迭代中使用的示例集。批次大小决定了一个批次中的样本数量。
如需了解批次与周期之间的关系,请参阅周期。
如需了解详情,请参阅机器学习速成课程中的线性回归:超参数。
批量推理
对分为较小子集(“批次”)的多个无标签示例进行推理预测的过程。
批量推理可以利用加速器芯片的并行化功能。也就是说,多个加速器可以同时对不同批次未标记的示例进行推理预测,从而大幅提高每秒的推理次数。
如需了解详情,请参阅机器学习速成课程中的生产环境中的机器学习系统:静态推理与动态推理。
批次归一化
对隐藏层中激活函数的输入或输出进行归一化。批次归一化具有下列优势:
批次大小
一个批次中的样本数量。 例如,如果批次大小为 100,则模型在每次迭代中处理 100 个样本。
以下是常用的批次大小策略:
- 随机梯度下降法 (SGD),其中批次大小为 1。
- 完整批次,其中批次大小为整个训练集中的样本数量。例如,如果训练集包含 100 万个样本,则批次大小为 100 万个样本。完整批次通常是一种低效的策略。
- 小批次,其中批次大小通常介于 10 到 1000 之间。小批次通常是最有效的策略。
请参阅以下内容了解详细信息:
- 生产环境机器学习系统:静态推理与动态推理(机器学习速成课程)。
- 《深度学习调优指南》。
贝叶斯神经网络
一种概率神经网络,用于解释权重和输出的不确定性。标准神经网络回归模型通常会预测标量值;例如,某个标准模型预测房价为 853,000。相比之下,贝叶斯神经网络会预测值的分布情况;例如,某个贝叶斯模型预测房价为 853000,其中标准偏差为 67200。
贝叶斯神经网络根据 贝叶斯定理计算权重和预测的不确定性。如果需要量化不确定性,例如,在与医药相关的模型中,则贝叶斯神经网络非常有用。贝叶斯神经网络还有助于防止过拟合。
贝叶斯优化
一种概率回归模型技术,通过使用贝叶斯学习技术量化不确定性,优化计算成本高昂的目标函数,而不是直接优化目标函数。由于贝叶斯优化本身非常耗费资源,因此通常用于优化参数数量较少的评估成本较高的任务,例如选择超参数。
贝尔曼方程
在强化学习中,最优 Q 函数满足以下等式:
\[Q(s, a) = r(s, a) + \gamma \mathbb{E}_{s'|s,a} \max_{a'} Q(s', a')\]
强化学习算法应用此恒等式,使用以下更新规则创建 Q-learning:
\[Q(s,a) \gets Q(s,a) + \alpha \left[r(s,a) + \gamma \displaystyle\max_{\substack{a_1}} Q(s',a') - Q(s,a) \right] \]
除了强化学习之外,贝尔曼方程还可应用于动态规划。请参阅 维基百科中有关贝尔曼方程的条目。
BERT(基于 Transformer 的双向编码器表示法)
一种用于文本表示的模型架构。经过训练的 BERT 模型可以作为大型模型的一部分,用于文本分类或其他机器学习任务。
BERT 具有以下特征:
- 使用 Transformer 架构,因此依赖于自注意力。
- 使用 Transformer 的编码器部分。编码器的任务是生成良好的文本表示法,而不是执行分类等特定任务。
- 是否为双向。
- 使用遮盖进行无监督训练。
BERT 的变体包括:
如需简要了解 BERT,请参阅开源 BERT:最先进的自然语言处理预训练。
偏差(道德/公平性)
1. 对某些事物、人或群体有刻板印象、偏见或偏袒。这些偏差会影响数据的收集和解读、系统设计以及用户与系统的互动方式。此类偏差的形式包括:
2. 采样或报告过程中引入的系统性误差。 此类偏差的形式包括:
如需了解详情,请参阅机器学习速成课程中的公平性:偏差类型。
偏差(数学概念)或偏差项
距离原点的截距或偏移。偏差是机器学习模型中的一个形参,可用以下任一符号表示:
- b
- w0
例如,在下面的公式中,偏差为 b:
在简单的二维线性模型中,偏差只是指“y 轴截距”。 例如,下图中的直线的偏差为 2。
之所以存在偏差,是因为并非所有模型都从原点 (0,0) 开始。例如,假设某游乐园的门票为 2 欧元,客户每停留 1 小时需额外支付 0.5 欧元。因此,映射总费用的模型具有 2 的偏差,因为最低费用为 2 欧元。
如需了解详情,请参阅机器学习速成课程中的线性回归。
双向
一种用于描述评估目标文本部分之前和之后文本的系统的术语。相比之下,单向系统仅评估目标文本部分之前的文本。
例如,假设有一个遮盖式语言模型,它必须确定以下问题中带下划线的字词的概率:
你有什么_____?
单向语言模型必须仅根据“What”“is”和“the”这几个字词提供的上下文来确定概率。相比之下,双向语言模型还可以从“with”和“you”中获取上下文,这可能有助于模型生成更好的预测结果。
双向语言模型
一种语言模型,用于根据前文和后文确定给定 token 出现在文本摘录中给定位置的概率。
二元语法
一种 N 元语法,其中 N=2。
二元分类
一种分类任务,用于预测两个互斥的类别之一:
例如,以下两个机器学习模型都执行二元分类:
- 一种用于确定电子邮件是垃圾邮件(正类别)还是非垃圾邮件(负类别)的模型。
- 一种评估医疗症状以确定某人是否患有特定疾病(正类别)或未患有该疾病(负类别)的模型。
与多类别分类相对。
如需了解详情,请参阅机器学习速成课程中的分类。
二元条件
在决策树中,条件只有两种可能的结果,通常是是或否。例如,以下是一个二元条件:
temperature >= 100
与非二元条件相对。
如需了解详情,请参阅决策森林课程中的条件类型。
分箱
与分桶的含义相同。
黑盒模型
一种模型,其“推理”过程难以理解或无法理解。也就是说,虽然人类可以看到提示如何影响回答,但人类无法准确确定黑盒模型如何确定回答。换句话说,黑盒模型缺乏可解释性。
BLEU(双语替换评测)
一种介于 0.0 和 1.0 之间的指标,用于评估机器翻译的质量,例如从西班牙语到日语的翻译。
为了计算得分,BLEU 通常会将机器学习模型的翻译(生成的文本)与人类专家的翻译(参考文本)进行比较。生成文本和参考文本中 N 元语法的匹配程度决定了 BLEU 得分。
有关此指标的原始论文是《BLEU:一种用于自动评估机器翻译的方法》。
另请参阅 BLEURT。
BLEURT(基于 Transformer 的双语替换评测)
一种用于评估从一种语言到另一种语言(尤其是英语)的机器翻译的指标。
对于英语与另一种语言之间的翻译,BLEURT 与人工评分的契合度比 BLEU 更高。与 BLEU 不同,BLEURT 侧重于语义(含义)相似性,并且可以适应释义。
BLEURT 依赖于一个预训练的大语言模型(确切来说是 BERT),然后使用人工翻译人员提供的文本对该模型进行微调。
有关此指标的原始论文是 BLEURT: Learning Robust Metrics for Text Generation。
布尔值问题 (BoolQ)
一个用于评估 LLM 在回答是/否问题方面的熟练程度的数据集。 数据集中的每个挑战都包含三个组成部分:
- 查询
- 暗示查询答案的段落。
- 正确答案,即是或否。
例如:
- 问题:密歇根州有核电站吗?
- 段落:...three nuclear power plants supply Michigan with about 30% of its electricity.
- 正确答案:是
研究人员从匿名化的汇总 Google 搜索查询中收集问题,然后使用维基百科页面来确定信息。
如需了解详情,请参阅 BoolQ:探索自然是/否问题的惊人难度。
BoolQ 是 SuperGLUE 集成模型的一个组成部分。
BoolQ
布尔值问题的缩写。
增强学习
一种机器学习技术,以迭代方式将一组简单但不太准确的分类模型(也称为“弱分类器”)合成一个准确率高的分类模型(即“强分类器”),具体方法是对模型目前错误分类的样本进行权重上调。
如需了解详情,请参阅决策森林课程中的什么是梯度提升决策树?。
边界框
图片中感兴趣区域(例如下图中的狗)周围矩形的 (x, y) 坐标。
广播
将矩阵数学运算中某个运算数的形状扩展为与该运算兼容的维度。例如,线性代数要求矩阵加法运算中的两个运算数必须具有相同的维度。因此,您无法将形状为 (m, n) 的矩阵与长度为 n 的向量相加。为了使该运算有效,广播会在每列下复制相同的值,将长度为 n 的向量扩展成形状为 (m, n) 的矩阵。
如需了解详情,请参阅 NumPy 中的广播这篇文章的说明。
分桶
将单个特征转换为多个二元特征(称为桶或箱),通常根据值区间进行转换。截断特征通常是连续特征。
例如,您可以将温度范围划分为离散的区间,而不是将温度表示为单个连续的浮点特征,例如:
- ≤ 10 摄氏度为“寒冷”区间。
- 11-24 摄氏度为“温带”区间。
- >= 25 摄氏度为“温暖”区间。
模型将以相同方式处理同一分桶中的每个值。例如,值 13 和 22 都位于温和型分桶中,因此模型会以相同的方式处理这两个值。
如需了解详情,请参阅机器学习速成课程中的数值数据:分箱。
C
校准层
一种预测后调整,通常是为了降低预测偏差的影响。调整后的预测和概率应与观察到的标签集的分布一致。
候选集生成
推荐系统选择的初始推荐集。例如,假设某家书店有 10 万本书。在候选集生成阶段,推荐系统会针对特定用户生成一个小得多的合适书籍列表,比如 500 本。但即使向用户推荐 500 本也太多了。推荐系统的后续阶段(例如评分和重排序)会进一步将这 500 本书列表缩小为一个小得多且更实用的推荐集。
如需了解详情,请参阅推荐系统课程中的候选集生成概览。
候选采样
一种训练时进行的优化,会使用某种函数(例如 softmax)针对所有正类别标签计算概率,但仅随机抽取一部分负类别标签样本并计算概率。例如,给定一个标签为beagle和dog的实例,候选采样将针对以下类别计算预测概率和相应的损失项:
- beagle
- dog
- 其余负类别的随机子集(例如,猫、棒棒糖、栅栏)。
这种方法的理念是,只要正类别始终得到适当的正增强,负类别就可以从不太频繁的负增强中学习,这确实符合实际观察情况。
与计算所有负类别的预测结果的训练算法相比,候选采样在计算方面更高效,尤其是在负类别的数量非常庞大时。
分类数据
特征,拥有一组特定的可能值。例如,假设有一个名为 traffic-light-state 的分类特征,该特征只能具有以下三个可能值之一:
redyellowgreen
通过将 traffic-light-state 表示为分类特征,模型可以了解 red、green 和 yellow 对驾驶员行为的不同影响。
分类特征有时称为离散特征。
与数值数据相对。
如需了解详情,请参阅机器学习速成课程中的处理分类数据。
因果语言模型
与单向语言模型的含义相同。
如需对比语言建模中的不同方向性方法,请参阅双向语言模型。
CB
CommitmentBank 的缩写。
形心
由 k-means 或 k-median 算法确定的聚类中心。例如,如果 k 为 3,则 k-means 或 k-median 算法会找出 3 个形心。
如需了解详情,请参阅聚类课程中的聚类算法。
形心聚类
一类聚类算法,用于将数据整理到非分层聚类中。k-means 是使用最广泛的形心聚类算法。
与层次聚类算法相对。
如需了解详情,请参阅聚类课程中的聚类算法。
思维链提示
一种提示工程技术,可鼓励大语言模型 (LLM) 逐步说明其推理过程。例如,请考虑以下提示,并特别注意第二句话:
如果一辆汽车从 0 加速到 60 英里/小时需要 7 秒,那么驾驶员会感受到多少 g 的重力?在回答中,显示所有相关计算。
LLM 的回答可能会:
- 显示一系列物理公式,并在适当的位置代入值 0、60 和 7。
- 说明系统为何选择这些公式,以及各种变量的含义。
思维链提示会强制 LLM 执行所有计算,这可能会得出更正确的答案。此外,通过思维链提示,用户可以检查 LLM 的步骤,以确定回答是否合理。
字符 N 元语法 F 得分 (ChrF)
用于评估机器翻译模型的指标。 字符 N 元语法 F 分数用于确定参考文本中 N 元语法与机器学习模型生成的文本中 N 元语法的重叠程度。
字符 N 元语法 F 分数与 ROUGE 和 BLEU 系列中的指标类似,但有以下区别:
- 字符 N 元语法 F 分数基于字符 N 元语法。
- ROUGE 和 BLEU 基于字词 N 元语法或令牌进行操作。
聊天
与机器学习系统(通常是大语言模型)进行来回对话的内容。 聊天中的上一次互动(您输入的内容以及大语言模型的回答)会成为聊天后续部分的上下文。
聊天机器人是大语言模型的一种应用。
检查点
用于捕获模型参数在训练期间或训练完成后的状态的数据。例如,在训练期间,您可以执行以下操作:
- 停止训练,可能是出于有意,也可能是由于某些错误。
- 捕获检查点。
- 稍后,重新加载检查点,可能是在不同的硬件上。
- 重新开始训练。
选择合理的替代方案 (COPA)
一个用于评估 LLM 在识别前提的两个备选答案中哪个更优方面的能力的数据集。数据集中的每个挑战都包含三个组成部分:
- 前提,通常是陈述后跟问题
- 前提中提出的问题的两种可能答案,其中一种正确,另一种不正确
- 正确答案
例如:
- 前提:该男子弄断了脚趾。导致这种情况的原因是什么?
- 可能的回答:
- 他的袜子破了个洞。
- 他把锤子掉在了脚上。
- 正确答案:2
COPA 是 SuperGLUE 集成模型的一个组成部分。
引用精确度
一种可回答以下问题的指标:
在 LLM 的回答中,有多少百分比的引用实际上是正确且具有支持性的?
也就是说,有多少百分比的引用包含验证 LLM 回答中所述声明所需的准确事实或相关信息。
例如,如果 LLM 回答引用了 10 份文档,但其中只有 7 份引用正确且具有支持性,那么引用精确率将为 0.7。
引用召回率
一种可回答以下问题的指标:
LLM 在撰写回答时使用的源文档中有多少百分比实际上在回答中被引用?
例如,如果 LLM 依赖 20 份文档来撰写回答,但回答仅引用了其中 11 份文档,那么引用召回率为 0.55。
类别
标签可以所属的类别。 例如:
分类模型可预测类别。 相比之下,回归模型预测的是数字,而不是类别。
如需了解详情,请参阅机器学习速成课程中的分类。
类别平衡的数据集
一个包含 分类 标签的数据集,其中每个类别的实例数量大致相等。例如,假设有一个植物学数据集,其二元标签可以是本地植物或非本地植物:
- 如果某个数据集包含 515 种本地植物和 485 种非本地植物,则该数据集属于类别平衡的数据集。
- 包含 875 种本地植物和 125 种非本地植物的数据集属于类别不平衡的数据集。
在类平衡数据集和类不平衡数据集之间没有明确的界限。只有当在高度类别不平衡的数据集上训练的模型无法收敛时,这种区别才变得重要。如需了解详情,请参阅机器学习速成课程中的