概念词汇表:C¶
本页整理拼音首字母为 C 的中文概念词条。词条正文由单词源文件 include 生成。
缓存¶
- 含义: 缓存是把反复需要的输入、查询结果或计算结果临时保存起来,以便之后复用,而不是每次都重新计算。
- 为什么重要: 当相同提示片段、检索结果或计算经常重复时,缓存可以同时降低成本和延迟。但缓存过旧会影响最新性和准确性,所以它是性能与新鲜度之间的权衡。
- 相关概念:
成本,延迟,批次 - 核心 Section:
P1-14.6
校准¶
- 含义: 校准检查模型给出的概率分数是否符合真实发生频率。例如分数约为 0.70 的样本,实际正确率是否也接近 70%。
- 为什么重要: 高分不一定就是可信概率。把分数用于人工复核、自动批准或风险告警时,校准会直接影响运营决策是否安全。
- 相关概念:
概率,分类,评估 - 核心 Section:
P1-6.2 - 出现 Section:
P1-6.3,P1-7.3,P4-6.4,P4-11.1,P4-15.3
思维链,CoT¶
- 含义: 思维链是一种提示策略,要求模型展示中间推理步骤,而不是只给最终答案。
- 为什么重要: 它可以让复杂条件问题的结论路径更容易检查,但展示推理并不自动保证事实正确。这个概念帮助区分推理路径检查和外部证据验证。
- 相关概念:
提示工程,自洽性,对齐 - 核心 Section:
P6-10.3
文本块¶
- 含义: 文本块是把长文档切成较小段落或片段后用于搜索、检索和比较的单位。
- 为什么重要: RAG 质量不仅取决于嵌入模型,也取决于切块方式。块太小会丢上下文,块太大又会混入噪声。
- 相关概念:
嵌入,文档,检索增强生成, RAG - 核心 Section:
P1-13.1 - 出现 Section:
P1-13.2,P1-13.3,P1-14.2,P6-12.1,P6-12.2
类¶
- 含义: 类定义一种对象应该拥有哪些属性和方法,是创建同类对象的蓝图。
- 为什么重要: 理解类可以解释为什么相似对象共享结构和行为,也能帮助读者把 DataFrame、Tokenizer、Model 等库对象读成某种定义的实例。
- 相关概念:
对象,方法,属性 - 核心 Section:
P2-8.6 - 出现 Section:
P2-9.1,P2-12.3
分类¶
- 含义: 分类是把输入样本归入预先定义好的类别或标签之一的问题类型。它是在已知选项中选择,而不是自由生成新输出。
- 为什么重要: 许多 AI 实务问题,如垃圾邮件判断、异常告警和批准保留,都可以转化为分类问题。它也帮助区分回归、聚类、生成和阈值决策。
- 相关概念:
聚类,预测,标签,回归,阈值 - 核心 Section:
P1-8.1 - 出现 Section:
P1-1.2,P5-15.1
客户端¶
- 含义: 客户端是向服务器或服务发送请求并接收响应的一侧组件。浏览器、API 调用代码或桌面应用都可以是客户端。
- 为什么重要: 客户端和服务器的区分能说明谁发起请求、谁处理请求。在 MCP 场景中,也能区分用户应用、连接客户端和提供工具的服务器。
- 相关概念:
主机,服务器,模型上下文协议, MCP,应用 - 核心 Section:
P1-14.4 - 出现 Section:
P1-14.6,P6-11.1
聚类标签¶
- 含义: 聚类标签是聚类算法为区分不同簇而分配的编号或标记。它通常只是识别符,不自带人类语义。
- 为什么重要: 读者容易把聚类标签误认为监督学习标签。聚类后仍需要人解释每个组,才能赋予有意义的名称。
- 相关概念:
聚类,标签,无监督学习 - 核心 Section:
P1-8.2
聚类¶
- 含义: 聚类是在没有预设答案标签的数据中寻找相似项目分组的无监督问题类型。
- 为什么重要: 聚类说明学习也可以是发现结构,而不是匹配已知答案。但聚类编号本身不解释含义,仍需要人的解释步骤。
- 相关概念:
分类,预测,数据集 - 核心 Section:
P4-17.1 - 出现 Section:
P1-1.2,P1-8.2,P4-2.2,P4-17.2,P4-18.2
CNN,卷积神经网络¶
- 含义: 卷积神经网络通过多层反复读取局部视觉模式,并把它们组合成更高层表示。
- 为什么重要: CNN 是图像识别中层级表示学习的代表例子,说明为什么局部模式读取、卷积和池化比把整张图像完全展平更有效。
- 相关概念:
图像识别,学习到的表示,AlexNet - 核心 Section:
P1-9.1 - 出现 Section:
P5-11.1,P5-11.2,P5-11.3
代码单元¶
- 含义: 代码单元是笔记本中实际输入并执行代码的单元。运行它会改变变量、输出、内存和运行时状态。
- 为什么重要: 代码单元解释了笔记本不同于普通脚本的地方。可见顺序不一定等于执行顺序,所以需要追踪哪些单元运行过。
- 相关概念:
笔记本,Markdown 单元,输出 - 核心 Section:
P2-10.1 - 出现 Section:
P2-10.2,P2-10.3,P2-11.2
Colab¶
- 含义: Colab 是 Google 提供的托管式 Jupyter 笔记本环境,可以在浏览器中运行。
- 为什么重要: Colab 降低了安装门槛,但运行资源位于本机之外的临时会话中。读者需要理解运行时重置、文件持久性、路径和包状态等限制。
- 相关概念:
Jupyter,运行时,可复现性 - 核心 Section:
P2-10.2 - 出现 Section:
P2-3.5,P2-7.1,P2-10.1
列¶
- 含义: 列是表中向下排列的一组值,通常代表一个变量、特征、属性、状态或目标候选。
- 为什么重要: 表格数据的许多判断都从理解每列含义开始。列概念帮助区分输入特征、元数据、目标候选和分组变量。
- 相关概念:
行,DataFrame,特征 - 核心 Section:
P2-12.1 - 出现 Section:
P2-12.2,P2-12.3,P2-15.2
组合爆炸¶
- 含义: 组合爆炸是可能选择或路径数量迅速增长,导致无法实际检查全部情况的现象。
- 为什么重要: 它解释了为什么穷举检查常常不可行,也说明启发式、剪枝和近似策略为什么重要。
- 相关概念:
搜索,启发式,优化 - 核心 Section:
P1-6.1 - 出现 Section:
P1-7.1
提交¶
- 含义: 提交是把有意义的修改连同消息一起记录到仓库历史中的变更单位。
- 为什么重要: 仅保存文件不能说明修改意图和范围。提交让之后的审查、比较、回退和协作都有可检查的历史单位。
- 相关概念:
Git,暂存区,仓库 - 核心 Section:
P2-14.1 - 出现 Section:
P2-14.2
比较报告¶
- 含义: 比较报告是整理近期状态与基准线差异的输出结构,让人决定先检查什么。
- 为什么重要: 当数据或标签还不足以直接做预测任务时,比较报告很有用。它把“让模型直接决定”和“让人先读差异”区分开。
- 相关概念:
基准线,审查,目标,输出结构 - 核心 Section:
P3-9.2 - 出现 Section:
P3-index,P3-1.1,P3-3.2,P3-8.2,P3-9.1,P3-9.3,P3-9.4,P3-9.5,P3-9.6,P3-summary
比较结果¶
- 含义: 比较结果是在相同条件下并排查看基准与当前值、基准模型与改进模型、旧设置与新设置后得到的实际差异。
- 为什么重要: 没有比较结果,“变好”容易停留在印象。它把分数、样本、表格和执行摘要连接成变化记录。
- 相关概念:
比较表,基准线,执行摘要,下一个问题,评估 - 核心 Section:
P7-1.2 - 出现 Section:
P7-index,P7-2.2,P7-summary
比较表¶
- 含义: 比较表把模型、设置、样本或期间等对象放在共同列上,以便读取差异。
- 为什么重要: 改进主张只有在基准和比较单位明确时才有意义。比较表把这些单位保留下来,支持复盘和下一次实验。
- 相关概念:
基准线,错误案例,复盘,审查,评估指标 - 核心 Section:
P7-2.1 - 出现 Section:
P7-index,P7-1.1,P7-1.3,P7-2.2,P7-5.1,P7-summary
计算图¶
- 含义: 计算图把运算和数值依赖关系表示为相连节点,使前向和反向计算路径可见。
- 为什么重要: 计算图让反向传播和自动微分更容易理解,显示中间值依赖哪些运算以及梯度如何反向流动。
- 相关概念:
反向传播,梯度,自动微分 - 核心 Section:
P5-5.2 - 出现 Section:
P5-6.1
计算限制¶
- 含义: 计算限制是候选空间过大,无法在现实时间和资源内检查所有情况的状态。
- 为什么重要: 它说明完全搜索理论上可行,也可能在实践中不可用,因此需要启发式、剪枝、优先级和近似解。
- 相关概念:
搜索,搜索空间,穷举搜索 - 核心 Section:
P1-7.1 - 出现 Section:
P1-index,P1-6.1,P1-7.2,P1-7.4,P1-8.1
虚构性生成¶
- 含义: 虚构性生成是模型自信地构造听起来像事实但缺乏依据的内容。
- 为什么重要: 这个概念帮助区分流畅文本和有根据的文本,也解释为什么即使答案自然,仍需要来源检查和人工审查。
- 相关概念:
幻觉,证据,事实性,审查 - 核心 Section:
P1-10.3 - 出现 Section:
P1-12.3,P1-13.2,P7-5.2
机密信息¶
- 含义: 机密信息是不一定属于个人信息、但外泄会伤害组织、客户、合同或运营的内部信息。
- 为什么重要: 生成式 AI 输入和日志可能复制或暴露组织内部资料。这个概念避免把非个人的内部材料误认为可以随意输入工具。
- 相关概念:
敏感信息,安全,隐私,日志,权限 - 核心 Section:
P1-15.3 - 出现 Section:
P1-14.5,P1-15.2,P1-16.2
一致性¶
- 含义: 一致性是相似条件下输出保持相似判断标准和表达方向的性质。
- 为什么重要: 一次看起来不错的输出不足以判断质量。一致性关注类似输入是否按同一标准处理,是生成式 AI 评估的重要轴。
- 相关概念:
评估,可复现性,提示限制,质量,人工评估 - 核心 Section:
P1-12.3
泛化¶
- 含义:泛化是指模型学到的关系在训练时没有见过的新数据上仍然大体有效。它表示模型抓住了更一般的模式,而不是只记住训练样本。
- 为什么重要:泛化区分了真正的学习和单纯记忆。即使训练分数很好,也需要验证数据和测试数据来确认模型能否应对相似的新情况。过拟合和欠拟合都可以看作泛化失败的不同形式。
- 相关概念:
过拟合,欠拟合 - 中心 Section:
P1-3.2 - 出现 Section:
P5-8.1,P5-8.2
约束¶
- 含义: 约束是结果必须遵守的限制,例如长度、范围、必须包含的元素或禁止内容。
- 为什么重要: 约束把提示变成更清楚的工作边界和审查标准,有助于控制范围、证据要求和禁止行为。
- 相关概念:
提示,输出格式,指令 - 核心 Section:
P1-12.1
上下文¶
- 含义: 上下文是为了正确理解任务或响应而提供的背景信息、文档材料和情境。
- 为什么重要: 同一请求在不同读者、材料和范围下会需要不同答案。因此上下文选择是提示、RAG 和长文档工作的设计问题。
- 相关概念:
提示,指令,示例 - 核心 Section:
P1-12.1
上下文窗口¶
- 含义: 上下文窗口是模型在一次输入输出计算中能够同时参考的最大 token 范围。
- 为什么重要: 长文档、长对话和检索片段都必须被选择或总结后放入上下文窗口。窗口更大不等于可以不选择重点。
- 相关概念:
token,分词,检索增强生成, RAG - 核心 Section:
P6-4.2 - 出现 Section:
P6-2.1
上下文表示¶
- 含义: 上下文表示是同一个词或 token 会随周围语境变化的内部向量表示。
- 为什么重要: 它说明模型不是只保存固定词义,而是根据当前句子角色重新形成表示。
- 相关概念:
嵌入,BERT,编码器 - 核心 Section:
P1-11.3 - 出现 Section:
P6-20.1
控制¶
- 含义: 控制是系统根据当前状态和目标选择下一步行动或调整值,并把它作用到环境中的问题类型。
- 为什么重要: 控制把信息输出和改变外部世界的行动区分开,因此在速度、移动、时序或系统状态受影响时,安全和责任更敏感。
- 相关概念:
规划,行动,影响 - 核心 Section:
P1-1.2
收敛¶
- 含义: 收敛是数值或序列在反复步骤中越来越接近某个值或稳定状态的过程。
- 为什么重要: 收敛帮助解释迭代计算和训练曲线,区分趋于稳定、发散、振荡和不稳定学习。
- 相关概念:
极限,变化率,优化 - 核心 Section:
P2-2.3 - 出现 Section:
P2-6.3
对话式 LLM¶
- 含义: 对话式 LLM 是在 LLM 之上加入指令遵循、对话格式、安全调校和界面层后形成的用户体验。
- 为什么重要: 它把语言模型和聊天产品区分开。同一个基础模型也会因系统提示、安全规则、工具和 UI 流程而表现不同。
- 相关概念:
GPT,预训练,指令调优 - 核心 Section:
P6-5.2
卷积¶
- 含义: 卷积是让小滤波器在输入上滑动,并在每个位置计算局部模式响应的运算。
- 为什么重要: 卷积是 CNN 读取局部视觉模式的核心运算,解释特征图以及同一检测器如何应用到图像多个位置。
- 相关概念:
CNN,卷积神经网络,池化,特征图 - 核心 Section:
P5-11.2
复制¶
- 含义: 复制是创建与原始数据分离的新对象,使之后的修改不会直接改变源对象。
- 为什么重要: 在 NumPy 和数据预处理中,切片、花式索引和布尔掩码与原始数据的关系可能不同。理解复制可以避免意外污染源数据。
- 相关概念:
共享底层对象,布尔掩码,花式索引 - 核心 Section:
P2-11.4 - 出现 Section:
P2-8.7,P2-12.1
版权¶
- 含义: 版权是法律对文字、图像、图表、代码等具体创造性表达的保护权利。
- 为什么重要: 使用书籍、文章、图像、代码或图表作为 AI 输入或公开草稿时必须考虑版权。公开可见不等于可以自由复用。
- 相关概念:
引用,许可证,训练数据 - 核心 Section:
P1-15.2 - 出现 Section:
P1-10.3
语料库¶
- 含义: 语料库是为训练、分析或评估语言模型和嵌入而收集的文本集合。
- 为什么重要: 语言模型从所见文本的分布中学习。语料的领域、时期、风格、清洗、偏见和覆盖范围会强烈影响模型能力。
- 相关概念:
语言模型,数据,word2vec - 核心 Section:
P1-11.1 - 出现 Section:
P1-11.3,P6-2.5,P6-19.1
余弦相似度¶
- 含义: 余弦相似度衡量两个向量方向有多相似,重点在夹角而不是绝对长度。
- 为什么重要: 在文本嵌入搜索中,方向常比大小更重要。这个概念解释了如何把语义相似读成方向接近。
- 相关概念:
相似度,距离,相似度搜索 - 核心 Section:
P1-13.2 - 出现 Section:
P1-13.1,P2-3.2,P2-3.4
成本¶
- 含义: 成本是运行服务所需的资源负担,包括模型调用、工具执行、存储、网络、评估、时间、基础设施和人工审查。
- 为什么重要: AI 功能不只要能运行一次,还要能以可承受成本反复运营。成本必须和延迟、吞吐量、质量及审查负担一起判断。
- 相关概念:
延迟,吞吐量,操作,质量,自动评估 - 核心 Section:
P1-14.6 - 出现 Section:
P1-7.1,P1-14.5,P1-16.3,P6-16.2,P6-17.1
凭据¶
- 含义: 凭据是密码、API key、token 或 cookie 等用于验证身份、访问权限或请求有效性的证明值。
- 为什么重要: 凭据出现在 AI 输入、日志或测试输出中,可能导致账号被盗用或服务被滥用,因此需要脱敏、最小权限和输入限制。
- 相关概念:
敏感信息,机密信息,安全,日志,权限 - 核心 Section:
P1-15.3 - 出现 Section:
P1-14.5,P1-16.2