概念词汇表:D¶
本页整理拼音首字母为 D 的中文概念词条。词条正文由单词源文件 include 生成。
数据¶
- 含义: 数据是在不同角色中使用的信息:训练样本、评估材料、检索证据、用户输入、状态或运营记录。
- 为什么重要: 同一个 data 在训练和服务中作用不同。判断质量、责任或系统行为前,必须先问这些信息被用于什么目的。
- 相关概念:
输入,输出,标签,示例,状态,资源 - 核心 Section:
P1-4.2 - 出现 Section:
P1-2.3,P1-3.2,P1-14.1
数据泄漏¶
- 含义: 数据泄漏是预测时本不该知道的信息进入训练或评估,使性能看起来不公平地变好。
- 为什么重要: 泄漏破坏公平实验边界。高分可能来自未来信息或接近答案的提示,而不是真正泛化。
- 相关概念:
数据集,验证,目标 - 核心 Section:
P2-12.3 - 出现 Section:
P4-7.1
数据建模¶
- 含义: 数据建模是把原始记录设计成样本、特征、比较方式和输出结构,以回答具体问题的过程。
- 为什么重要: 记录多不等于学习问题已经形成。数据建模决定什么算一个案例、比较什么以及用什么输出关闭任务。
- 相关概念:
数据集,样本,比较报告,输出结构,任务定义 - 核心 Section:
P3-1.1 - 出现 Section:
P3-index,P3-1.2,P3-1.3,P3-2.1,P3-2.2,P3-3.1,P3-3.2,P3-summary
数据结构¶
- 含义: 数据结构是组织数据并支持特定操作的方式,如查找、插入、遍历或沿关系移动。
- 为什么重要: 合适结构取决于常问什么问题。列表、字典、树和图不同,是因为访问模式和成本不同。
- 相关概念:
抽象数据类型,线性结构,非线性结构 - 核心 Section:
P2-9.1 - 出现 Section:
P2-9.2,P2-9.3,P2-9.4
DataFrame¶
- 含义: DataFrame 是 Pandas 的二维表结构,带有行列标签,并允许不同列保存不同类型。
- 为什么重要: DataFrame 让数据按案例和变量来读,是筛选、过滤、聚合和准备表格数据集的核心结构。
- 相关概念:
Series,行,列 - 核心 Section:
P2-12.1 - 出现 Section:
P2-12.2,P2-12.3
数据集¶
- 含义: 数据集是为训练或评估准备的一组样本和变量,包含输入、目标、样本边界和划分选择。
- 为什么重要: 同一原始表可以构成不同学习问题。数据集设计常常先于模型选择影响性能和解释。
- 相关概念:
DataFrame,特征,目标,样本,任务定义 - 核心 Section:
P2-12.3 - 出现 Section:
P3-2.1,P3-2.2,P3-3.2,P3-9.2
决策树¶
- 含义: 决策树通过连续提问条件并沿分支到达叶节点来做预测。
- 为什么重要: 决策树直观,但过深时容易记住训练数据偶然模式,体现可解释性与过拟合风险的权衡。
- 相关概念:
树,过拟合,划分 - 核心 Section:
P4-14.1 - 出现 Section:
P4-14.2
警报等级¶
- 含义:警报等级是更细的运营标签,用来表示审查紧急程度,例如观察、复核或行动。它不证明问题一定真实,而是标记该信号应多快、多仔细地检查。
- 为什么重要:单个差距很大并不总是意味着要立即行动,特别是在样本量小或信号可能只是一次性波动时。警报等级把差异大小、重复性、最近性和读者影响结合成更实际的检查顺序,帮助运营从原始信号走向优先审查。
- 相关概念:
行动区间,优先级,重新确认,状态检查,事件记录 - 中心 Section:
P7-7.4 - 出现 Section:
P7-summary
计算图¶
- 含义: 计算图把运算和数值依赖关系表示为相连节点,使前向和反向计算路径可见。
- 为什么重要: 计算图让反向传播和自动微分更容易理解,显示中间值依赖哪些运算以及梯度如何反向流动。
- 相关概念:
反向传播,梯度,自动微分 - 核心 Section:
P5-5.2 - 出现 Section:
P5-6.1
计算限制¶
- 含义: 计算限制是候选空间过大,无法在现实时间和资源内检查所有情况的状态。
- 为什么重要: 它说明完全搜索理论上可行,也可能在实践中不可用,因此需要启发式、剪枝、优先级和近似解。
- 相关概念:
搜索,搜索空间,穷举搜索 - 核心 Section:
P1-7.1 - 出现 Section:
P1-index,P1-6.1,P1-7.2,P1-7.4,P1-8.1
解码器¶
- 含义: 解码器根据当前上下文和内部表示生成下一个 token 或输出序列。
- 为什么重要: 解码器解释 Seq2Seq 和 GPT 类模型的输出生成,把读取输入和逐步生成输出区分开。
- 相关概念:
编码器,编码器-解码器,GPT - 核心 Section:
P1-11.3 - 出现 Section:
P1-11.2,P6-5.1,P6-20.1
深拷贝¶
- 含义: 深拷贝不仅复制外层容器,也复制嵌套内部值,使副本与原对象分离。
- 为什么重要: 当预处理或实验必须保留原始数据时,深拷贝能避免共享内部对象一起变化。
- 相关概念:
浅拷贝,引用,列表 - 核心 Section:
P2-8.7 - 出现 Section:
P2-11.4
深度学习¶
- 含义: 深度学习使用多层神经网络共同学习中间表示和预测规则。
- 为什么重要: 它代表从手工特征转向学习表示的趋势,是机器学习中的神经网络方法,不等于所有 AI。
- 相关概念:
表示学习,参数,特征 - 核心 Section:
P1-2.3 - 出现 Section:
P1-1.3
依赖¶
- 含义: 依赖是代码运行所依靠的外部包或环境条件。
- 为什么重要: 只有代码文件还不足以复现。依赖解释了同一代码为什么在一个环境能运行、另一个环境会失败。
- 相关概念:
包,可复现性,requirements.txt - 核心 Section:
P2-7.5 - 出现 Section:
P2-10.1,P2-10.2,P2-10.3
部署¶
- 含义: 部署是把检查后的文档、网站或服务结果反映到实际公开或用户可见状态。
- 为什么重要: 部署会改变用户看到的结果,因此需要分支、构建、链接和资产检查。
- 相关概念:
分支,静态部署,文档可复现性 - 核心 Section:
P7-7.1 - 出现 Section:
P2-14.2,P7-7.2
部署检查¶
- 含义: 部署检查确认构建状态、CI、公开地址以及最新内容是否真的可见。
- 为什么重要: 静态站点部署包含本地构建、工作流、Pages 更新和读者可见内容等不同状态,不能混为一谈。
- 相关概念:
部署,状态检查,事件记录,审查,最新性 - 核心 Section:
P7-7.1 - 出现 Section:
P7-7.2,P7-7.3
导数¶
- 含义: 导数是瞬时变化率,表示输入极小变化时输出如何变化。
- 为什么重要: 导数把函数变化同优化和学习连接起来,是理解梯度和降低损失方向的基础。
- 相关概念:
变化率,斜率,梯度 - 核心 Section:
P2-4.3 - 出现 Section:
P2-4.4,P2-6.1,P2-6.3
字典¶
- 含义: 字典是按键查找值的映射数据结构,而不是按位置查找。
- 为什么重要: 字典帮助读设置、JSON 响应、元数据和命名字段,区分按位置访问和按名称访问。
- 相关概念:
键,列表,映射 - 核心 Section:
P2-8.3 - 出现 Section:
P2-8.4,P2-9.4
扩散模型¶
- 含义: 扩散模型从噪声状态开始,经过多步逐渐去噪生成有意义的图像或表示。
- 为什么重要: 它说明生成不总是下一 token 续写,图像生成常依赖多步迭代精炼。
- 相关概念:
生成,下一输出生成,采样 - 核心 Section:
P1-10.2
维度¶
- 含义: 维度是表示向量或数据点时使用的数值个数或坐标轴数量。
- 为什么重要: 维度帮助理解向量形状、矩阵形状、特征数量以及高维搜索和可视化的困难。
- 相关概念:
向量,shape,矩阵 - 核心 Section:
P2-3.2 - 出现 Section:
P2-3.3,P2-11.1,P2-11.2
降维¶
- 含义: 降维是在尽量保留重要结构的同时,把高维数据移动到更少轴上的方法。
- 为什么重要: 它让复杂数据更容易可视化或概括,但降维图并不是原始信息的完美副本。
- 相关概念:
无监督学习,维度,表示 - 核心 Section:
P4-18.1 - 出现 Section:
P1-8.2,P4-2.2,P4-7.4,P4-18.2
直接谱系¶
- 含义: 直接谱系是为当前技术提供核心结构和问题设定的研究路径。
- 为什么重要: 它区分背景影响和结构祖先。解释 LLM 时,语言建模、Seq2Seq、Attention 和 Transformer 更直接。
- 相关概念:
周边证据,语言建模,Transformer - 核心 Section:
P6-19.2 - 出现 Section:
P1-9.3,P6-19.1
聚合¶
- 含义:聚合把许多行或许多数值变成更小的摘要值,例如平均值、总和、计数或比率。它让人按分组或摘要模式阅读表格,而不是逐行阅读每个值。
- 为什么重要:大表不会因为很大就自动回答问题。聚合帮助判断当前问题需要哪种摘要,以及某些模式是否只有分组之后才出现。它也提醒读者,单一平均值可能隐藏计数、比率或子群差异。
- 相关概念:
groupby,筛选,列 - 中心 Section:
P2-12.2 - 出现 Section:
P2-12.3,P3-1.2
有向图¶
- 含义: 有向图的连接带方向,因此起点和终点不同。
- 为什么重要: 方向会改变链接、依赖、关注或流动关系的意义,并引出可达性、环和顺序问题。
- 相关概念:
无向图,图,权重 - 核心 Section:
P2-9.3 - 出现 Section:
P2-9.4
数组¶
- 含义:数组是一种让值能按位置和索引读取的结构。在数值计算中,它通常指沿轴排列、具有形状的一块数值,并可被整体处理。
- 为什么重要:数组不只是容器,也是计算形状。理解数组能为 shape、axis、广播、切片和向量化运算做准备,也能把简单值列表和可成组计算的数据排列区分开来。
- 相关概念:
表,索引,数据结构 - 中心 Section:
P2-9.2 - 出现 Section:
P2-11.1,P2-11.2,P2-12.1
批归一化¶
- 含义: 批归一化利用一个批次中的均值和方差重新整理激活值分布,使下一层接收到更容易处理的数值范围。它不是只用于输入预处理,而是网络内部的稳定化步骤。
- 为什么重要: 在深层网络中,激活值分布不断变化会让训练变得不稳定。批归一化帮助稳定计算,也帮助读者理解为什么同一层在训练模式和评估模式下会使用不同的统计规则。
- 相关概念:
训练模式,评估模式,数值稳定性 - 核心 Section:
P5-8.3 - 出现 Section:
P5-6.3,P5-8.1
批次¶
- 含义: 批次是在一次处理中合在一起的一组项目。在运营语境中,它可以指把多个请求或任务一起处理;在深度学习中,它指一次送入计算的一组样本。共同点是把多个项目当作一个处理单位。
- 为什么重要: 批次会影响服务的吞吐量和成本,也会影响深度学习中的基本计算流程。批次大小会改变内存占用、梯度波动和训练速度,所以批次既是运营分组,也是训练过程的设计单位。
- 相关概念:
吞吐量,操作,张量 - 核心 Section:
P1-14.6 - 出现 Section:
P5-6.1,P5-9.2
发现¶
- 含义: 发现是在执行动作前先确认连接系统提供哪些工具、资源和能力的步骤。
- 为什么重要: 工具使用需要知道实际有什么、输入格式是什么、权限范围在哪里。
- 相关概念:
模型上下文协议, MCP,工具调用,资源 - 核心 Section:
P1-14.4
距离¶
- 含义: 距离是在表示空间中衡量两个向量相隔多远的数值标准。
- 为什么重要: 距离把“近”或“相似”变成可计算的排序规则,用于搜索和检索。
- 相关概念:
相似度,最近邻,向量空间,相似度搜索 - 核心 Section:
P1-13.2
分布式表示¶
- 含义: 分布式表示把词或对象表达为分散在多个数值维度上的向量,而不是一个符号。
- 为什么重要: 它通过多维共享性质支持更灵活的泛化,让相关项目在空间中更接近。
- 相关概念:
嵌入,向量,word2vec - 核心 Section:
P1-11.1 - 出现 Section:
P1-9.3,P1-13.1,P5-2.2,P6-3.1,P6-19.2
分布¶
- 含义: 分布描述值集中在哪里、如何扩散以及整体形状如何。
- 为什么重要: 分布能揭示偏斜、离群点、多峰结构和平均值隐藏的变化。
- 相关概念:
概率,均值,方差 - 核心 Section:
P2-5.2 - 出现 Section:
P2-5.3,P2-13.1,P2-13.2
布尔掩码¶
- 含义: 布尔掩码是用同样长度或兼容形状的真/假数组来选择值的方法。它不是直接写出位置编号,而是先计算条件是否成立,再保留条件为真的元素。
- 为什么重要: 在数据预处理和数组计算中,布尔掩码让选择逻辑从“第几个”转为“满足什么条件”。它不同于简单切片,因为结果形状和复制行为可能变化,读者需要用它来正确理解筛选样本和条件数组操作。
- 相关概念:
筛选,花式索引,复制 - 核心 Section:
P2-11.4 - 出现 Section:
P2-12.2
文档可复现性¶
- 含义: 文档可复现性是从相同原稿、代码、图像、设置和流程重新生成并解释同一文档结果的能力。
- 为什么重要: 公开文档不只取决于正文,资产、链接、构建设置和部署步骤都会影响最终页面。
- 相关概念:
可复现性,部署,Git - 核心 Section:
P2-14.2 - 出现 Section:
P7-7.1,P7-7.2
文档化¶
- 含义: 文档化是把学习内容或工作过程用可回读的结构记录下来。
- 为什么重要: 文档化把“感觉理解了”和“能够解释、验证、共享依据”区分开。
- 相关概念:
个人学习,证据审查,记录 - 核心 Section:
P1-16.1 - 出现 Section:
P1-16.2,P7-7.1,P7-7.2
Dropout¶
- 含义: Dropout 是训练时随机关闭部分节点输出或连接的正则化技术。
- 为什么重要: 它防止网络过度依赖少数路径,也解释训练模式和评估模式为什么不同。
- 相关概念:
正则化,泛化,训练模式 - 核心 Section:
P5-8.2 - 出现 Section:
P5-6.4,P5-8.1,P5-8.3,P5-summary
dtype¶
- 含义: dtype 表示 NumPy 数组中值使用哪种数据类型存储。
- 为什么重要: dtype 会影响内存和数值行为。同样可见的值,使用不同整数或浮点类型时可能表现不同。
- 相关概念:
ndarray,NumPy,shape - 核心 Section:
P2-11.1 - 出现 Section:
P2-11.2,P2-12.1,P2-12.2