概念词汇表:Y¶
本页整理拼音首字母为 Y 的中文概念词条。词条正文由单词源文件 include 生成。
因果推断¶
- 含义: 因果推断追问
如果我们真的改变某件事,结果会不会改变,并试图区分观察到的相关关系和真正的因果效果。 - 为什么重要: 特征重要度告诉我们预测模型大量使用了什么,但不能证明改变这个特征就一定会改变结果。
- 相关概念:
特征(feature),相关关系(correlation),干预(intervention),解释边界(interpretation boundary) - 中心 Section:
P4-15.2 - 出现 Section:
P4-15.2
样本单位¶
- 含义: 样本单位是在当前问题中被当作一件案例来读取的数据单位。它可以是一行记录、一个文档、一次事件,或模型一次接收的输入单位。
- 为什么重要: 如果样本单位的边界不清楚,数据集大小、标签含义、特征解释都会跟着混乱。理解样本单位,才能区分“数据很多”和“把什么算作一件案例”。
- 相关概念:
行,数据集,案例 - 核心 Section:
P3-4.1 - 出现 Section:
P2-11.2,P2-11.3,P2-12.3,P2-15.2,P3-1.1,P3-2.2,P3-3.2,P3-3.3,P3-4.2,P3-4.3,P3-5.1,P3-5.3,P3-5.4,P3-5.5,P3-5.6,P3-5.7,P7-index,P7-1.1,P7-1.3,P7-2.1,P7-3.2,P7-summary
样本偏差(sampling bias)¶
- 含义:样本偏差是指观测到的样本不能很好代表总体,并且向某个方向倾斜的状态。
- 为什么重要:如果用于学习或评估的数据本身有偏,模型分数就可能比真实目标情境中更好或更差。这个概念帮助读者追问:评估数据是否真能作为未来案例的合理代理。
- 相关概念:
样本,偏差,评估数据,泛化 - 核心 Section:
P2-5.3 - 出现 Section:
P4-4.1
验证数据(validation data)¶
- 含义:验证数据是在模型开发过程中,用来检查和调整模型设置的数据。它既不是直接参与训练的数据,也不同于最后确认用的测试数据。
- 为什么重要:仅仅看到较低的训练损失,并不能保证现实表现。验证数据提供了一个单独样本,用来在调节超参数或决定何时停止训练时,检查模型是否仍能适应新数据。
- 相关概念:
训练数据,测试数据,泛化,超参数 - 核心 Section:
P2-6.2 - 出现 Section:
P4-4.1,P4-4.2,P4-5.1,P4-5.2
优化(optimization)¶
- 含义: 优化是在给定目标和约束下,从多个候选中寻找更好值或更好设置的过程。在机器学习里,它常表现为让损失变小、让目标函数更符合当前目的。
- 为什么重要: 优化说明模型训练不是随便改变参数,而是按照某个标准寻找更好解。它也帮助读者区分
真正改进目标函数和只用 heuristic 先缩小候选范围这两件事。 - 相关概念:
目标函数,损失,评估指标 - 中心 Section:
P2-6.1 - 出现 Section:
P2-6.2,P2-6.3,P2-15.2,P4-3.1,P4-7.2,P4-7.3
优化器(optimizer)¶
- 含义:决定怎样更新模型参数以降低损失的学习算法。
- 为什么重要:即使用同一个损失函数和同一批数据,不同的更新规则也会改变学习速度、稳定性和收敛方式。理解优化器,才能把学习率、梯度和 Adam 读成改变学习路径的机制,而不只是配置项。
- 相关概念:
优化,梯度下降,学习率,反向传播,损失函数 - 中心 Section:
P5-7.1 - 出现 Section:
P5-6.1,P5-7.2,P5-7.3
异常值¶
- 含义: 异常值是相对于整体数据模式显得特别远或特别突出的值。
- 为什么重要: 异常值可能来自真实罕见情况、测量错误、输入错误或分布尾部。理解异常值,才能在图表和统计摘要中区分“值得检查的信号”和“需要排查的数据问题”。
- 相关概念:
分布,过滤,数据质量 - 核心 Section:
P2-13.1 - 出现 Section:
P2-5.2,P2-5.4,P2-13.2,P3-5.2,P4-2.2,P4-10.2,P4-10.3
预处理¶
- 含义: 预处理是在数据进入模型之前,把输入表示整理成当前模型能够计算的形式的准备步骤,例如处理缺失值、调整尺度、编码类别。
- 为什么重要: 同一个模型会因为输入准备方式不同而表现出很大差异。理解预处理,才能把“使用了数据”和“把数据准备成模型可读的输入”区分开,并避免把测试信息提前混入训练过程。
- 相关概念:
特征,特征选择,数据泄漏 - 核心 Section:
P4-7.2 - 出现 Section:
P2-12.3,P4-index,P3-5.5,P4-7.1,P4-7.3,P4-9.2,P4-12.2,P4-12.3,P4-3.1,P4-3.2,P4-4.2
预测¶
- 含义:预测是根据给定输入或当前信息估计下一个值、状态、类别或事件。
- 为什么重要:预测不只表示未来展望,也包括判断当前输入属于哪个结果。区分这一点,有助于把回归、分类、排序和控制等任务分开理解。
- 相关概念:
分类,回归,预测性展望,概率估计 - 中心 Section:
P1-10.1 - 出现 Section:
P1-5.2,P1-5.3,P1-7.4,P1-17.1,P1-17.3,P2-15.2,P3-9.9,P4-2.1,P4-5.2,P4-10.1
预测契约(prediction contract)¶
- 含义: 在预测问题中,明确约定哪些值算输入、要预测哪个结果、以及只能使用预测时点之前哪些信息。它不只是区分列名,还包括每一列是在什么时候生成的,以及在运营时点能否按同样规则重新构造。
- 为什么重要: 如果预测之后才生成的值泄漏进输入,分数可能变好看,但真实运营预测问题已经被破坏。预测契约让特征、目标候选、时间边界、防止泄漏和可复现性一起被检查。
- 相关概念:
特征,目标标签候选,数据泄漏,可复现性 - 核心 Section:
P3-9.7 - 出现 Section:
P3-9.7
原始数据¶
- 含义:原始数据是在被重新设计成分析问题或学习问题之前的起点记录。
- 为什么重要:有原始数据,并不等于已经有数据集或可学习任务。同一批记录会随着问题不同,被重新读成不同的样本单位、特征表、基准线和输出结构。
- 相关概念:
数据集,数据建模,样本单位,特征 - 核心 Section:
P3-1.1 - 出现 Section:
P3-index,P3-1.2,P3-2.2,P3-3.1,P3-3.2,P3-4.1,P3-4.2,P3-4.3,P3-5.4,P3-5.6,P3-summary,P4-1.2
业务决策(decision)¶
- 含义:业务决策是在 AI 系统中,把模型分数、规则、成本、风险、政策和可能的人工复核放在一起,决定实际业务行动的阶段。模型给出了一个数字,与根据这个数字决定要做什么,必须分开理解。
- 为什么重要:概率输出只是判断材料,不是最终业务决策本身。这个区分能帮助我们把自动处理、暂缓、追加提问、人工复核等行动分支和模型输出分开设计,也能更清楚地看出决策责任在哪里。
- 相关概念:
概率估计值(probability estimate),阈值(threshold),人工监督(human oversight) - 核心 Section:
P1-6.3
阈值¶
- 含义:阈值是把输出数字转换成运营行动的截断值,例如自动处理、人工复核或发出警报。
- 为什么重要:模型分数或比较值本身,不等于把它转成行动的规则。调整阈值可能改变误报、漏报、自动化范围和人工复核负担,而不一定需要重新训练模型。
- 相关概念:
概率估计,校准,分类 - 核心 Section:
P1-7.3 - 出现 Section:
P1-7.2,P3-2.2,P3-5.7,P3-6.2,P3-9.8,P3-9.12,P4-6.1,P4-6.2,P4-6.4,P4-11.1,P4-11.2,P4-14.1,P4-15.3,P7-7.4
语境依赖(context dependency)¶
- 含义:一个项目的含义或输出会随周围输入、前文或任务条件而改变的性质。
- 为什么重要:它是理解 LLM 行为的核心,因为同一个 token 或句子在不同 prompt 与语境下可能表现不同。
- 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
- 中心 Section:
P1-10.2
引用(quotation)¶
- 含义:明确区分并标明来源地直接使用他人原文的做法。
- 为什么重要:它很重要,因为直接文字比概括或改写需要更严格处理。
- 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
- 中心 Section:
P1-15.2
样本空间(sample space)¶
- 含义:概率问题中考虑的所有可能结果的集合。
- 为什么重要:它给概率陈述一个明确边界:概率是在这组可能结果上分配的。
- 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
- 中心 Section:
P2-5.1 - 出现 Section:
P2-5.2
延迟奖励(delayed reward)¶
- 含义:不是在导致它的动作之后立刻出现,而是在若干步骤之后才出现的奖励信号。
- 为什么重要:它说明强化学习为什么必须考虑长期后果,而不能只选择眼前看起来最好的动作。
- 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
- 中心 Section:
P1-8.3
隐私(privacy)¶
- 含义:对个人信息、个人语境以及个人对敏感数据使用控制权的保护。
- 为什么重要:它很重要,因为 AI 系统常常处理可能暴露个人的文本、日志、图像和记录。
- 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
- 中心 Section:
P1-15.3 - 出现 Section:
P1-10.3
语音生成(speech generation)¶
- 含义:根据文本、声学条件或其他模型输入生成语音音频的任务。
- 为什么重要:它说明生成式 AI 不限于文本或图像,而且输出模态会改变评估问题。
- 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
- 中心 Section:
P1-9.2
运动规划(motion planning)¶
- 含义:在约束条件下为智能体或系统寻找可行路径或运动序列的问题。
- 为什么重要:它把搜索、规划和机器人例子连接到在状态空间中选择动作的更大观念。
- 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
- 中心 Section:
P1-7.4
预训练(pretraining)¶
- 含义:模型在适配较窄任务之前,先学习通用模式的初始大规模训练阶段。
- 为什么重要:它解释了大型模型如何在微调或具体任务使用之前获得可复用能力。
- 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
- 中心 Section:
P1-11.3 - 出现 Section:
P1-9.3,P6-5.1,P6-5.2,P6-8.1,P6-8.2,P6-10.1,P6-20.1,P6-6.1