概念词汇表:L¶
本页整理拼音首字母为 L 的中文概念词条。词条正文由单词源文件 include 生成。
语言模型¶
- 含义:语言模型估计词或 token 序列的可能性,常根据前文预测接下来可能出现的内容。
- 为什么重要:这个概念把 LLM 放回概率语言预测的历史脉络,而不是只把它看成聊天产品。
- 相关概念:
语言建模,统计语言模型,词元(token) - 中心 Section:
P1-11.1 - 出现 Section:
P1-10.2,P1-11.2,P1-11.3,P6-20.1,P6-20.2
语言建模¶
- 含义:语言建模是估计词或 token 序列概率结构的任务。
- 为什么重要:它解释了为什么下一 token 预测和序列概率是现代 LLM 及其早期前身的核心。
- 相关概念:
直接谱系,Transformer 架构(Transformer),嵌入 - 中心 Section:
P1-9.3 - 出现 Section:
P1-10.1,P1-11.1,P1-11.3,P6-20.2
学习到的表示¶
- 含义:学习到的表示是模型从数据中形成的内部形式,使当前任务中有用的差异更容易被利用。
- 为什么重要:这个概念区分人手工设计的特征和模型为当前任务学到的内部表示。
- 相关概念:
表示,表示学习,手工特征 - 中心 Section:
P1-9.1 - 出现 Section:
P5-10.1,P5-10.2
链式法则(chain rule)¶
- 含义: 链式法则是处理复合函数求导的规则。当计算经过多个步骤时,它说明前面变量的变化会怎样经过中间步骤影响后面的结果。
- 为什么重要: 反向传播会用链式法则在多层网络中计算梯度。理解它之后,就能把“数学规则”和“在神经网络中应用这条规则的计算过程”区分开。
- 相关概念:
反向传播(backpropagation),梯度(gradient),计算图(computation graph) - 核心 Section:
P2-4.6 - 出现 Section:
P5-5.1,P5-5.2
最小权限¶
- 含义:最小权限是只给人、工具或 AI 智能体当前任务所需访问范围的安全原则。
- 为什么重要:AI 系统常连接能改变真实状态的工具。限制访问范围可以减少错误、滥用或提示词注入造成的损害。
- 相关概念:
权限,审批,安全,AI 智能体,工具使用 - 中心 Section:
P1-15.3 - 出现 Section:
P1-14.5,P1-14.6,P7-6.2
极限¶
- 含义:极限描述输入接近某个点或条件时,函数值趋近于哪里。
- 为什么重要:极限支撑变化、连续性和导数的数学语言,尤其在直接代入不够时很重要。
- 相关概念:
收敛,函数,变化率 - 中心 Section:
P2-2.3 - 出现 Section:
P2-4.1,P2-4.2
线性回归¶
- 含义:线性回归先用最简单的线性形式描述输入特征和连续输出之间的关系。
- 为什么重要:它在使用复杂模型前提供简单的回归基准,也支持基于系数的解释。
- 相关概念:
回归,斜率,误差 - 中心 Section:
P4-10.1 - 出现 Section:
P4-10.2,P4-10.3,P4-11.1
大语言模型¶
- 含义:大语言模型是在大规模文本上训练、用于预测和生成 token 序列的语言模型。
- 为什么重要:LLM 是生成式 AI 体验的中心之一,但要和完整聊天产品、工具系统或全部 AI 区分开。
- 相关概念:
生成式 AI,机器学习,深度学习,语言模型,对话式 LLM - 中心 Section:
P1-1.3 - 出现 Section:
P1-9.3,P4-1.1,P1-11.3,P6-1.2,P6-20.1,P6-summary
LLM 响应生成(response generation)¶
- 含义:LLM 响应生成是 LLM 接收 prompt 后生成自然语言回复的执行过程。它可以理解为使用已学习参数、输入 prompt 和采样设置,继续产生输出 token 的过程。
- 为什么重要:LLM 的 inference 结果常常表现为自然语言句子,而不是分类标签或数字,因此很容易把模型执行和真实思考过程混在一起。这个概念能帮助我们理解:即使回复看起来自然,它的事实性、依据和逻辑连接仍然需要另外检查。
- 相关概念:
推断(inference),提示(prompt),采样(sampling),生成(generation) - 核心 Section:
P1-5.2
log loss¶
- 含义:log loss 是一种损失。model 给正确答案的 probability 越低,它就越大;如果错误预测还很自信,惩罚会更强。
- 为什么重要:log loss 常出现在 classification model、logistic regression 和 neural network 输出解释中。它能说明为什么训练会推动 model 提高正确 class 的 probability,也能说明为什么自信地犯错会付出更大的代价。
- 相关概念:
对数(logarithm),损失函数(loss function),逻辑回归(logistic regression),最大似然估计(maximum likelihood estimation) - 中心 Section:
P2-2.4 - 出现 Section:
P4-11.3
逻辑回归¶
- 含义:逻辑回归是一种线性分类模型,会把线性分数转换为类似概率的值来进行类别判断。
- 为什么重要:它是简单可解释的分类基准,也帮助区分模型分数、类似概率的输出、阈值和最终类别。
- 相关概念:
分类,阈值,决策边界 - 中心 Section:
P4-11.1 - 出现 Section:
P4-3.2,P4-4.2,P4-11.2,P4-11.3,P4-11.4
长上下文¶
- 含义:长上下文指在一个任务中保留并使用长输入信息的设计问题。
- 为什么重要:长输入不只是更大的 token 限制,还涉及成本、延迟、检索、摘要和记忆管理。
- 相关概念:
上下文窗口,检索增强生成,稀疏注意力 - 中心 Section:
P6-4.5 - 出现 Section:
P5-14.2,P6-4.2,P6-4.3,P6-4.4
长期依赖¶
- 含义:长期依赖是指序列中很早的信息仍然重要,但顺序模型难以长期保留它的问题。
- 为什么重要:它解释了基本循环模型为什么难以处理远处信息,以及门控记忆设计和注意力为什么重要。
- 相关概念:
循环神经网络,隐藏状态,注意力 - 中心 Section:
P5-12.2 - 出现 Section:
P1-9.3,P5-12.1,P5-13.1,P5-13.2,P5-14.1,P5-14.2
损失曲线¶
- 含义:损失曲线是显示损失如何随训练步骤或 epoch 变化的折线图。
- 为什么重要:它比单个最终损失值更容易显示训练流程、不稳定、停滞和过拟合。
- 相关概念:
折线图,损失函数,准确率 - 中心 Section:
P2-13.2 - 出现 Section:
P2-13.3,P2-15.1
损失函数¶
- 含义:损失函数把预测错误转换成训练要尽量降低的数字。
- 为什么重要:训练需要一个可降低的数值目标。损失函数定义模型把哪种错误视为代价。
- 相关概念:
误差,目标函数,梯度下降 - 中心 Section:
P2-6.2 - 出现 Section:
P2-6.3,P2-13.2,P2-15.1,P5-4.1,P5-4.2
逻辑推理(reasoning)¶
- 含义:把前提、规则、证据或中间步骤连接起来得出结论的过程。
- 为什么重要:它必须和模型执行、预测、生成区分开,因为这些可能是不同的技术过程。
- 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
- 中心 Section:
P1-5.3
流形(manifold)¶
- 含义:整体上可能弯曲、但在局部小区域中可以像较简单坐标空间那样处理的空间。
- 为什么重要:它帮助解释为什么高维数据有时可以通过较低维的结构来研究。
- 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
- 中心 Section:
P2-3.2