概念词汇表:L¶
本页整理拼音首字母为 L 的中文概念词条。词条正文由单词源文件 include 生成。
标签¶
- 含义:标签是为当前任务附加到数据案例上的目标答案或目标输出。它定义模型应当预测什么,例如类别名或数值目标。
- 为什么重要:标签定义监督学习目标,因此标签定义改变时,任务和评估也会改变。模糊或不一致的标签会在训练前就限制模型质量。
- 相关概念:
示例,数据,输出,标注,目标 - 中心 Section:
P1-4.2 - 出现 Section:
P1-2.1,P1-3.2,P1-8.1
标注¶
- 含义:标注是按照文档化规则给数据案例附加目标答案或类别标记的工作。
- 为什么重要:模型质量可能和标注规则一样受算法影响。标注让读者追问答案由谁定义、按什么标准定义。
- 相关概念:
标签,监督学习,目标,任务定义 - 中心 Section:
P1-8.1
语言模型¶
- 含义:语言模型估计词或 token 序列的可能性,常根据前文预测接下来可能出现的内容。
- 为什么重要:这个概念把 LLM 放回概率语言预测的历史脉络,而不是只把它看成聊天产品。
- 相关概念:
语言建模,统计语言模型,token - 中心 Section:
P1-11.1 - 出现 Section:
P1-10.2,P1-11.2,P1-11.3,P6-19.1,P6-19.2
语言建模¶
- 含义:语言建模是估计词或 token 序列概率结构的任务。
- 为什么重要:它解释了为什么下一 token 预测和序列概率是现代 LLM 及其早期前身的核心。
- 相关概念:
直接谱系,Transformer,嵌入 - 中心 Section:
P1-9.3 - 出现 Section:
P1-10.1,P1-11.1,P1-11.3,P6-19.2
延迟¶
- 含义:延迟是用户发送请求后,到收到首个响应或最终结果之前等待的时间。
- 为什么重要:模型质量好还不够,用户等待太久也会降低体验。延迟把模型、检索、工具调用和后处理连接到服务体验。
- 相关概念:
成本,吞吐量,流式输出,重试 - 中心 Section:
P1-14.6 - 出现 Section:
P1-14.5
层归一化¶
- 含义:层归一化会在单个样本的表示内部整理数值尺度,使后续层接收更稳定的值。
- 为什么重要:深层 Transformer 模块需要稳定的数值尺度。层归一化帮助注意力和前馈模块反复堆叠时保持可训练和可用。
- 相关概念:
Transformer,残差连接,前馈网络 - 中心 Section:
P5-14.1 - 出现 Section:
P5-14.2
学习到的表示¶
- 含义:学习到的表示是模型从数据中形成的内部形式,使当前任务中有用的差异更容易被利用。
- 为什么重要:这个概念区分人手工设计的特征和模型为当前任务学到的内部表示。
- 相关概念:
表示,表示学习,手工特征 - 中心 Section:
P1-9.1 - 出现 Section:
P5-10.1,P5-10.2
学习率¶
- 含义:学习率控制优化沿着降低损失的方向移动时,每次更新步子有多大。
- 为什么重要:学习率在稳定前进和速度之间调节。步子太大或太小都会破坏训练或让训练过慢。
- 相关概念:
梯度下降,梯度,优化 - 中心 Section:
P2-6.3 - 出现 Section:
P5-7.1,P5-7.2,P5-7.3
最小权限¶
- 含义:最小权限是只给人、工具或智能体当前任务所需访问范围的安全原则。
- 为什么重要:AI 系统常连接能改变真实状态的工具。限制访问范围可以减少错误、滥用或提示词注入造成的损害。
- 相关概念:
权限,审批,安全,智能体,工具使用 - 中心 Section:
P1-15.3 - 出现 Section:
P1-14.5,P1-14.6,P7-6.2
图例¶
- 含义:图例是说明图中线条、颜色、点或数据系列分别代表什么的说明框。
- 为什么重要:没有正确图例,图表比较很容易被误读。图例把视觉标记和数据系列连接起来。
- 相关概念:
图,准确率,损失曲线 - 中心 Section:
P2-13.3 - 出现 Section:
P2-15.1
极限¶
- 含义:极限描述输入接近某个点或条件时,函数值趋近于哪里。
- 为什么重要:极限支撑变化、连续性和导数的数学语言,尤其在直接代入不够时很重要。
- 相关概念:
收敛,函数,变化率 - 中心 Section:
P2-2.3 - 出现 Section:
P2-4.1,P2-4.2
提示词的限制¶
- 含义:提示词的限制是指即使措辞更清楚,也无法自动解决事实性、最新性、安全性或长文一致性等问题的边界。
- 为什么重要:它把提示词书写和系统设计分开。有些失败需要检索、评估、审批或人工评审,而不只是更好的措辞。
- 相关概念:
提示词,评估,幻觉 - 中心 Section:
P1-12.3
折线图¶
- 含义:折线图把按顺序排列的值连接起来,常用于显示一个量随时间或迭代如何变化。
- 为什么重要:折线图是读取趋势、训练曲线、函数形状和时间变化的基本形式。
- 相关概念:
图,损失曲线,轴 - 中心 Section:
P2-13.2 - 出现 Section:
P2-13.3
线性回归¶
- 含义:线性回归先用最简单的线性形式描述输入特征和连续输出之间的关系。
- 为什么重要:它在使用复杂模型前提供简单的回归基准,也支持基于系数的解释。
- 相关概念:
回归,斜率,残差 - 中心 Section:
P4-10.1 - 出现 Section:
P4-10.2,P4-10.3
线性结构¶
- 含义:线性结构把数据看作有顺序的序列,位置和前后关系很重要。
- 为什么重要:它把数组、列表、栈、队列等顺序结构与树和图区分开。
- 相关概念:
非线性结构,数组,数据结构 - 中心 Section:
P2-9.1 - 出现 Section:
P2-9.4
列表¶
- 含义:列表是有顺序的值集合,可以通过索引访问,也可以被循环遍历。
- 为什么重要:列表是基础编程容器,也是以后区分列表、数组、向量和张量的参照点。
- 相关概念:
索引,字典,循环 - 中心 Section:
P2-8.2 - 出现 Section:
P2-8.3,P2-8.4,P2-8.7,P2-9.1
大语言模型¶
- 含义:大语言模型是在大规模文本上训练、用于预测和生成 token 序列的语言模型。
- 为什么重要:LLM 是生成式 AI 体验的中心之一,但要和完整聊天产品、工具系统或全部 AI 区分开。
- 相关概念:
生成式 AI,机器学习,深度学习,GPT,对话式 LLM - 中心 Section:
P1-1.3 - 出现 Section:
P1-9.3,P1-11.3,P6-19.1,P6-summary
loc¶
- 含义:
loc是 Pandas 中按标签而不是整数位置选择行和列的工具。 - 为什么重要:它帮助读者把按语义标签选择和用
iloc按整数位置选择区分开。 - 相关概念:
索引,列,iloc - 中心 Section:
P2-12.2 - 出现 Section:
P2-12.3
本地环境¶
- 含义:本地环境是在用户自己电脑上运行代码所需的程序、文件、包、路径和设置集合。
- 为什么重要:同一代码在不同机器和设置下可能表现不同。本地环境解释版本、包、路径和虚拟环境问题。
- 相关概念:
运行时,虚拟环境,工作目录 - 中心 Section:
P2-7.1 - 出现 Section:
P2-7.4,P2-7.5,P2-10.2
日志¶
- 含义:日志是按时间顺序记录系统或一次运行做了什么的记录,包括输入、步骤、工具调用、响应和错误。
- 为什么重要:最终答案很少显示一次运行为什么成功或失败。日志支持评审、责任追踪、可复现性和运行调试。
- 相关概念:
追踪,测试框架,可复现性,责任 - 中心 Section:
P7-6.2 - 出现 Section:
P1-14.3,P1-14.5,P1-15.3,P7-6.1,P7-7.1,P7-7.2
逻辑回归¶
- 含义:逻辑回归是一种线性分类模型,会把线性分数转换为类似概率的值来进行类别判断。
- 为什么重要:它是简单可解释的分类基准,也帮助区分模型分数、类似概率的输出、阈值和最终类别。
- 相关概念:
分类,阈值,决策边界 - 中心 Section:
P4-11.1 - 出现 Section:
P4-11.2
长上下文¶
- 含义:长上下文指在一个任务中保留并使用长输入信息的设计问题。
- 为什么重要:长输入不只是更大的 token 限制,还涉及成本、延迟、检索、摘要和记忆管理。
- 相关概念:
上下文窗口,检索增强生成,稀疏注意力 - 中心 Section:
P6-4.3 - 出现 Section:
P5-14.2
长期依赖¶
- 含义:长期依赖是指序列中很早的信息仍然重要,但顺序模型难以长期保留它的问题。
- 为什么重要:它解释了基本循环模型为什么难以处理远处信息,以及 LSTM、GRU 和注意力为什么重要。
- 相关概念:
循环神经网络,LSTM,注意力 - 中心 Section:
P5-12.2 - 出现 Section:
P1-9.3,P5-12.1,P5-13.1,P5-13.2,P5-14.1,P5-14.2
循环¶
- 含义:循环是在多个值或步骤上重复同一过程,而不必反复书写同一段代码。
- 为什么重要:循环把集合从存储的数据变成重复执行的动作,并连接到预处理和训练迭代等概念。
- 相关概念:
可迭代对象,迭代器,列表 - 中心 Section:
P2-8.4 - 出现 Section:
P2-8.5,P2-10.3
LoRA¶
- 含义:LoRA 是一种高效适应方法,尽量保持基础模型不变,只训练较小的附加更新部分。
- 为什么重要:它在只改提示词和完整微调之间提供实际折中,降低训练和存储成本。
- 相关概念:
微调,参数,量化 - 中心 Section:
P6-8.2 - 出现 Section:
P6-9.4,P6-9.5
损失曲线¶
- 含义:损失曲线是显示损失如何随训练步骤或 epoch 变化的折线图。
- 为什么重要:它比单个最终损失值更容易显示训练流程、不稳定、停滞和过拟合。
- 相关概念:
折线图,损失函数,准确率 - 中心 Section:
P2-13.2 - 出现 Section:
P2-13.3,P2-15.1
损失函数¶
- 含义:损失函数把预测错误转换成训练要尽量降低的数字。
- 为什么重要:训练需要一个可降低的数值目标。损失函数定义模型把哪种错误视为代价。
- 相关概念:
误差,目标函数,梯度下降 - 中心 Section:
P2-6.2 - 出现 Section:
P2-6.3,P2-13.2,P2-15.1,P5-4.1,P5-4.2
LSTM,长短期记忆¶
- 含义:LSTM 是一种循环神经网络结构,用门控机制控制序列中保留、遗忘和更新哪些信息。
- 为什么重要:它展示了在注意力成为主流之前,循环模型如何加入记忆控制机制来处理序列上下文。
- 相关概念:
循环神经网络,GRU,隐藏状态 - 中心 Section:
P1-11.2 - 出现 Section:
P5-12.1,P5-12.2