概念词汇表:D¶
本页整理拼音首字母为 D 的中文概念词条。词条正文由单词源文件 include 生成。
数据¶
- 含义: 数据是在不同角色中使用的信息:训练样本、评估材料、检索证据、用户输入、状态或运营记录。
- 为什么重要: 同一个 data 在训练和服务中作用不同。判断质量、责任或系统行为前,必须先问这些信息被用于什么目的。
- 相关概念:
模型输入(model input),模型输出(model output),监督学习标签(supervised learning label),原始数据(source data),出处追踪(provenance) - 核心 Section:
P1-4.2 - 出现 Section:
P1-2.3,P4-1.1,P1-3.2,P1-14.1
数据泄漏¶
- 含义: 数据泄漏是预测时本不该知道的信息进入训练或评估,使性能看起来不公平地变好。
- 为什么重要: 泄漏破坏公平实验边界。高分可能来自未来信息或接近答案的提示,而不是真正泛化。
- 相关概念:
数据集,验证,目标 - 核心 Section:
P2-12.3 - 出现 Section:
P3-4.2,P3-9.7,P3-9.13,P4-7.1,P4-7.2,P4-7.3
数据建模¶
- 含义: 数据建模是把原始记录设计成样本、特征、比较方式和输出结构,以回答具体问题的过程。
- 为什么重要: 记录多不等于学习问题已经形成。数据建模决定什么算一个案例、比较什么以及用什么输出关闭任务。
- 相关概念:
数据集,样本单位,比较报告,输出结构,任务定义 - 核心 Section:
P3-1.1 - 出现 Section:
P3-index,P3-1.2,P3-1.3,P3-2.1,P3-2.2,P3-3.1,P3-3.2,P3-summary
数据结构¶
- 含义: 数据结构是组织数据并支持特定操作的方式,如查找、插入、遍历或沿关系移动。
- 为什么重要: 合适结构取决于常问什么问题。列表、字典、树和图不同,是因为访问模式和成本不同。
- 相关概念:
抽象数据类型,线性结构,非线性结构 - 核心 Section:
P2-9.1 - 出现 Section:
P2-9.2,P2-9.3,P2-9.4
DBSCAN¶
- 含义:DBSCAN 是一种基于密度的聚类方法。它把点足够密集的区域看作簇,也可以把低密度区域里的点留下来作为噪声或异常点。
- 为什么重要:DBSCAN 展示了和 k-means 不同的直觉。它不是先指定簇的数量,也不假设所有簇都围绕中心点展开,而是追问点在当前距离规则下是否密集相连。
- 相关概念:
聚类,聚类簇,密度,异常值 - 中心 Section:
P4-17.1 - 出现 Section:
P4-17.3
数据集¶
- 含义: 数据集是为训练或评估准备的一组样本和变量,包含输入、目标、样本边界和划分选择。
- 为什么重要: 同一原始表可以构成不同学习问题。数据集设计常常先于模型选择影响性能和解释。
- 相关概念:
数据结构(data structure),特征,目标,样本单位,任务定义 - 核心 Section:
P2-12.3 - 出现 Section:
P2-12.1,P2-12.2,P3-2.1,P3-2.2,P3-3.2,P3-4.2,P3-9.2,P3-summary,P4-5.2
代理目标¶
- 含义:代理目标是在实际目标无法直接观测或出现得太晚时,临时当作目标使用的替代列。它可以让学习问题先成立,但并不会自动等同于实际目标。
- 为什么重要:代理目标上的好分数,并不保证原始目标也被预测好了。理解这个概念,才能把“现在可以先做一个问题”和“正在直接解决原始目标”分开,并记录代理列与实际目标之间的距离。
- 相关概念:
实际目标,代理标签,目标标签候选,标签 - 核心 Section:
P3-9.9 - 出现 Section:
P3-9.9
决策树¶
- 含义: 决策树通过连续提问条件并沿分支到达叶节点来做预测。
- 为什么重要: 决策树直观,但过深时容易记住训练数据偶然模式,体现可解释性与过拟合风险的权衡。
- 相关概念:
阈值(threshold),过拟合(overfitting),分类(classification),回归(regression) - 核心 Section:
P4-14.1 - 出现 Section:
P4-index,P4-3.2,P4-4.2,P4-5.1,P4-14.1,P4-14.2
解码器¶
- 含义: 解码器根据当前上下文和内部表示生成下一个 token 或输出序列。
- 为什么重要: 解码器解释编码器-解码器和 GPT 类模型的输出生成,把读取输入和逐步生成输出区分开。
- 相关概念:
编码器,编码器-解码器,GPT 模型(GPT) - 核心 Section:
P1-11.3 - 出现 Section:
P1-11.2,P6-5.1,P6-6.1
深度学习¶
- 含义: 深度学习使用多层神经网络共同学习中间表示和预测规则。
- 为什么重要: 它代表从手工特征转向学习表示的趋势,是机器学习中的神经网络方法,不等于所有 AI。
- 相关概念:
表示学习,参数,特征 - 核心 Section:
P1-2.3 - 出现 Section:
P1-1.3,P4-1.1,P4-index
导数¶
- 含义: 导数是瞬时变化率,表示输入极小变化时输出如何变化。
- 为什么重要: 导数把函数变化同优化和学习连接起来,是理解梯度和降低损失方向的基础。
- 相关概念:
变化率,斜率,梯度 - 核心 Section:
P2-4.3 - 出现 Section:
P2-4.4,P2-6.1,P2-6.3
扩散模型¶
- 含义: 扩散模型从噪声状态开始,经过多步逐渐去噪生成有意义的图像或表示。
- 为什么重要: 它说明生成不总是下一 token 续写,图像生成常依赖多步迭代精炼。
- 相关概念:
生成,下一输出生成,采样 - 核心 Section:
P1-10.2
维度¶
- 含义: 维度是表示向量或数据点时使用的数值个数或坐标轴数量。
- 为什么重要: 维度帮助理解向量形状、矩阵形状、特征数量以及高维搜索和可视化的困难。
- 相关概念:
向量,张量(tensor),矩阵 - 核心 Section:
P2-3.2 - 出现 Section:
P2-3.3,P2-11.1,P2-11.2,P4-18.1
降维¶
- 含义: 降维是在尽量保留重要结构的同时,把高维数据移动到更少轴上的方法。
- 为什么重要: 它让复杂数据更容易可视化或概括,但降维图并不是原始信息的完美副本。
- 相关概念:
无监督学习,维度,表示 - 核心 Section:
P4-18.1 - 出现 Section:
P1-8.2,P4-index,P4-2.2,P4-3.2,P4-7.2,P4-7.3,P4-7.4,P4-18.2
距离¶
- 含义: 距离是在表示空间中衡量两个向量相隔多远的数值标准。
- 为什么重要: 距离把“近”或“相似”变成可计算的排序规则,用于搜索和检索。
- 相关概念:
相似度,最近邻,向量空间,相似度搜索 - 核心 Section:
P1-13.2 - 出现 Section:
P1-13.2,P2-3.2,P4-6.4,P4-7.2,P4-7.3,P4-12.2,P4-12.3,P6-3.2
分布式表示¶
- 含义: 分布式表示把词或对象表达为分散在多个数值维度上的向量,而不是一个符号。
- 为什么重要: 它通过多维共享性质支持更灵活的泛化,让相关项目在空间中更接近。
- 相关概念:
嵌入,向量,语料库 - 核心 Section:
P1-11.1 - 出现 Section:
P1-9.3,P1-13.1,P5-2.2,P6-3.1,P6-20.2
分布¶
- 含义: 分布描述值集中在哪里、如何扩散以及整体形状如何。
- 为什么重要: 分布能揭示偏斜、离群点、多峰结构和平均值隐藏的变化。
- 相关概念:
概率,均值,方差 - 核心 Section:
P2-5.2 - 出现 Section:
P2-5.3,P2-13.1,P2-13.2,P4-6.3
对比学习¶
- 含义:对比学习利用应该靠近的成对项目和应该远离的成对项目,来学习表达空间中的排列方式。
- 为什么重要:embedding 质量不只取决于检索速度,还取决于模型学会把什么放近、把什么分开。对比学习能帮助读者抓住“同一意图或同一问题场景靠近,不同意图分开”的表达学习感觉。
- 相关概念:
正样本对(positive pair),负样本对(negative pair),嵌入(embedding),表示学习(representation learning) - 核心 Section:
P6-3.3 - 出现 Section:
P6-3.3
代理标签(proxy label)¶
- 含义:当真实目标延迟、不可得或难以直接观测时,用作实际替代的标签。
- 为什么重要:它帮助读者看到:可用标签不一定精确等于真正目标。
- 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
- 中心 Section:
P1-8.1
点预测(point prediction)¶
- 含义:返回一个具体值而不是分布或区间的预测。
- 为什么重要:它容易被读成最终答案,因此必须和带不确定性的预测区分开。
- 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
- 中心 Section:
P1-6.3
深度强化学习(deep reinforcement learning)¶
- 含义:使用深度神经网络来表示策略、价值函数或环境信号的强化学习方法。
- 为什么重要:它把强化学习问题与深度学习的表示能力连接起来,尤其适用于状态或观测过于复杂、不能用简单表格处理的情况。
- 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
- 中心 Section:
P1-8.3
带标签样本(labeled example)¶
- 含义:把输入与用于监督学习的目标标签或答案配成一对的训练样本。
- 为什么重要:它说明监督学习不仅需要数据,还需要已经定义答案标准的数据。
- 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
- 中心 Section:
P1-8.1
独热表示(one-hot representation)¶
- 含义:一种稀疏表示:用一个位置为 1、其余位置为 0 来标识一个类别。
- 为什么重要:它为理解稠密 embedding 提供简单对照,后者不仅表示身份,还可以表示相似性。
- 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
- 中心 Section:
P1-11.1
端到端学习(end-to-end learning)¶
- 含义:让模型从原始或轻度处理的输入直接连接到最终目标输出的学习设置。
- 为什么重要:它解释了为什么一些深度学习系统会用一个共同训练的流程替代人工设计的中间阶段。
- 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
- 中心 Section:
P1-9.2