跳转至

概念词汇表:S

本页整理拼音首字母为 S 的中文概念词条。词条正文由单词源文件 include 生成。

采样

  • 含义:采样是根据模型已经计算出的候选分布,选择一个实际输出片段的步骤。模型先估计哪些候选有多可信,然后 sampling 决定最终取出哪一个候选。对语言模型来说,这通常是从下一个 token 候选中选择一个;对图像生成来说,也可能表现为在下一步沿着某条概率性的去噪路径前进。
  • 为什么重要:sampling 解释了为什么同一个输入也可能生成不同结果,也帮助我们区分概率分布计算和实际输出选择。生成质量不只由模型权重决定,最后的选择步骤以及 temperature、top-k 等设置也会明显影响结果。理解 sampling,才能把模型认为哪些候选可信实际选中了什么分开看。
  • 相关概念:下一词元预测(next-token prediction)词元(token)扩散模型(diffusion model)
  • 中心 Section:P5-15.3
  • 出现 Section:P1-5.2P1-10.2P5-15.1P5-15.2P6-1.3P6-4.1P6-7.1P6-7.2

随机森林(random forest)

  • 含义:用受控随机性训练多棵决策树,再把它们的预测合在一起,得到更稳定结果的集成模型。
  • 为什么重要:单棵决策树容易阅读,但也容易受到训练数据中偶然模式的影响。随机森林通过聚合多棵树的判断,代表性地降低这种摇晃。
  • 相关概念:决策树, 集成, bootstrap, OOB 分数, 特征重要度
  • 中心 Section:P4-15.1
  • 出现 Section:P4-15.2, P4-15.3, P4-15.4

  • 含义: 状态空间搜索是在可能的状态、行动或候选路径中寻找目标或解答的过程。它不是一次性套用公式,而是在多个候选之间决定先看哪里、怎样继续前进。
  • 为什么重要: 许多早期 AI 问题、路径规划、游戏走法、组合优化和信息检索都包含搜索结构。理解搜索后,才能继续区分状态空间、启发式、候选整体检查和剪枝。
  • 相关概念: 启发式(heuristic), 知识表示(knowledge representation), 控制(control)
  • 核心 Section: P1-7.1
  • 出现 Section: P1-2.2

sigmoid

  • 含义: sigmoid 是一种 S 形函数,会把实数分数压缩到 0 与 1 之间。它常用于把一个分数读成偏向二元决策某一侧的值。
  • 为什么重要: 它能帮助读者区分模型分数与像概率一样的输出。模型先形成分数,再经过 sigmoid 变成更容易解释的值,而阈值或运行策略属于后续步骤。
  • 相关概念: 激活函数(activation function), 阈值(threshold), 二元分类(binary classification), 逻辑回归(logistic regression)
  • 核心 Section: P2-2.4
  • 出现 Section: P5-3.2, P5-3.5, P5-3.6

相似度检索

  • 含义:相似度检索会寻找与问题或文档的向量表达接近的其他向量,并选择相关候选。它不只寻找完全相同的字符串,而是在表达空间中寻找语义上接近的候选。
  • 为什么重要:相似度检索是 RAG 中寻找相关文档片段的核心步骤,因为它把 embedding 连接到实际检索流程。理解它也能看清关键词检索和向量检索并不只是竞争关系,有些问题需要两者结合,才能更稳定地找到依据。
  • 相关概念:嵌入(embedding)检索增强生成(RAG)向量(vector)相似度(similarity)top-k 检索(top-k)
  • 核心 Section:P1-13.2
  • 出现 Section:P1-13.3, P1-13.4, P6-3.1

softmax

  • 含义:softmax 会把多个 score 变成归一化后的值,让它们总和为 1,从而可以像候选项或 class 之间的 probability distribution 那样读取。
  • 为什么重要:softmax 连接 class score、类似 probability 的输出和最终候选选择。它说明为什么必须把所有候选 score 放在一起比较,以及为什么某个 class probability 总是相对于其他 class score 来决定。
  • 相关概念:指数函数(exponential function), 对数(logarithm), 分类(classification), 逻辑回归(logistic regression)
  • 中心 Section:P2-2.4
  • 出现 Section:P4-11.4, P5-3.6, P6-4.1

数据科学

  • 含义:数据科学是收集、清理、表示、建模和解释数据,以回答问题并支持决策的宽泛工作流程。
  • 为什么重要:数据建模只是这个流程中的一部分。区分数据科学和数据建模,可以避免把收集、清理、探索、建模、解释和决策支持看成同一件事。
  • 相关概念:数据建模数据集预处理探索决策
  • 核心 Section:P3-1.1
  • 出现 Section:P3-index, P3-summary, P4-1.2

输入上下文

  • 含义: 输入上下文是为了正确理解任务或响应而放入模型输入中的背景信息、文档材料和情境。
  • 为什么重要: 同一请求在不同读者、材料和范围下会需要不同答案。因此输入上下文选择是提示、RAG 和长文档工作的设计问题。
  • 相关概念: 提示, 指令, 示例
  • 核心 Section: P1-12.1

建模输出结构(output structure)

  • 含义: 建模输出结构是对计算结果形式的设计,例如比较报告、待复核候选队列或目标标签候选。它不只问“答案是什么”,还问“结果要装进什么形式,下一步由谁使用”。
  • 为什么重要: 同一份原始数据可以结束为比较表、人工复核流程,也可以成为后续训练候选。先确定输出结构,才能把复核流程、自动化步骤和预测问题分开设计。
  • 相关概念: 比较报告, 目标, 样本单位, 任务定义
  • 核心 Section: P3-2.2
  • 出现 Section: P3-index, P3-1.1, P3-1.2, P3-1.3, P3-2.1, P3-3.2, P3-4.3, P3-8.2, P3-8.4, P3-9.1, P3-9.2, P3-9.3, P3-9.5, P3-summary, P7-index, P7-1.1, P7-2.1, P7-5.1, P7-summary

算法(algorithm)

  • 含义: 算法是为解决问题而按顺序执行的一套明确步骤。在相同输入和条件下,它应当能把计算或判断过程写得足够清楚,便于重复。
  • 为什么重要: 在 AI 和机器学习里,执行计算的步骤和决定先检查哪些候选的 heuristic 属于不同层次。理解 algorithm,才能把训练、搜索和优化看成可重复的过程,而不是只靠直觉。
  • 相关概念: 启发式, 搜索, 优化
  • 中心 Section: P4-3.1
  • 出现 Section:

时间顺序切分(time split)

  • 含义:时间顺序切分是在时间顺序重要的数据中,把较早观测放在训练侧,把较晚观测放在验证或测试侧的划分方式。它不把记录随机混合,而是先保护真实预测时点之前和之后的边界。
  • 为什么重要:如果把有时间顺序的数据随机切分,模型可能像提前看到了未来模式一样,性能被夸大。时间顺序切分会追问:预测较晚案例时,是否只使用了更早的信息,从而帮助发现数据泄漏和评估设计问题。
  • 相关概念:数据泄漏评估设计预测契约
  • 核心 Section:P3-9.13
  • 出现 Section:P3-9.13, P4-4.1

实际目标

  • 含义:实际目标是真正想知道、想减少或想预测的结果。它有时可以在当前数据里直接看到,但在很多现实场景中会很晚才出现,甚至无法直接观测,因此需要和代理目标区分开。
  • 为什么重要:如果实际目标不清楚,就很难判断当前预测问题是在直接解决原始目标,还是只是在预测一个中间判断。这个概念能让使用代理目标时仍然保留原始目的,并说明后面的分数到底在衡量什么。
  • 相关概念:代理目标目标标签目标标签候选
  • 核心 Section:P3-9.9
  • 出现 Section:P3-9.9

sim-to-real gap

  • 含义: sim-to-real gap 是在 simulation 中训练或评估的 policy 转到现实世界时,因为噪声、延迟、摩擦、光照、罕见情况等差异而出现的性能或安全间隙。故意改变 simulation 条件,是减少对单一模拟设定过拟合的一种下位策略。
  • 为什么重要: simulation 常常让强化学习实验成为可能,但它不是现实的完整复制品。这个概念帮助读者避免把simulation 成功直接读成现实成功。
  • 相关概念: 仿真(simulation), 现实世界(real world), 安全性, 部署(deployment)
  • 核心 Section: P4-19.3
  • 出现 Section: P4-19.4

数学对数(logarithm)

  • 含义:指数运算的反运算,用来把乘法尺度转成加法尺度。
  • 为什么重要:它会在损失函数、概率、信息度量和 AI 中的数值变换里反复出现。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P2-2.4

数据稀疏性(sparsity)

  • 含义:大多数可能值、组合或向量维度为空、为零或很少被观测到的状态。
  • 为什么重要:它会影响表示、搜索、统计和模型泛化,因为许多组合几乎没有证据。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P1-11.1

搜索索引(search index)

  • 含义:为了高效检索文档、文本块或向量而预先准备的结构。
  • 为什么重要:它把检索质量连接到查询到来之前数据是怎样表示和组织的。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P1-13.4
  • 出现 Section:P6-13.2

搜索空间(search space)

  • 含义:搜索过程可能检查的状态、路径、解或候选集合。
  • 为什么重要:它很重要,因为计算困难往往来自这个空间有多大、结构怎样。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P1-7.1
  • 出现 Section:P1-7.2, P1-7.4, P2-summary

市场替代(market substitution)

  • 含义:某种使用可能替代原作品或其授权市场需求的版权与政策问题。
  • 为什么重要:它在判断受保护材料再使用是否会伤害原作者或市场时很重要。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P1-15.2

数据分布(data distribution)

  • 含义:描述数据中出现哪些值、这些值出现得多频繁以及分布多宽的模式。
  • 为什么重要:它很重要,因为模型行为不仅取决于单个样本,也取决于这些样本来自什么分布。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P2-5.2
  • 出现 Section:P2-5.5

受保护表达(protected expression)

  • 含义:受版权保护作品中的具体表达形式,不同于不受保护的事实、思想或方法。
  • 为什么重要:它很重要,因为 AI 学习材料必须把可复用思想和受保护的文字、图像、结构或其他表达分开。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P1-15.2

损失(loss)

  • 含义:表示模型输出离目标或学习目标有多远的数值信号。
  • 为什么重要:它通常是训练要降低的量,因此连接了模型输出、标签、梯度和优化。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P1-5.1
  • 出现 Section:P2-1.1, P2-1.2, P2-2.2, P2-2.3

随机过程(stochastic process)

  • 含义:按时间、步骤或其他顺序变量索引的一组随机变量。
  • 为什么重要:它帮助理解在序列中展开的不确定性,而不是只看单个孤立事件。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P1-6.2