跳转至

概念词汇表:T

本页整理拼音首字母为 T 的中文概念词条。词条正文由单词源文件 include 生成。

推荐任务(recommendation task)

  • 含义: 推荐任务是在多个候选中选择接下来值得展示、阅读或尝试的项目的建模任务。它通常不是生成全新内容,而是根据当前输入、上下文和目标排序候选。
  • 为什么重要: 推荐任务帮助读者看到 AI 不只是在回答问题或生成文本,也会改变用户接触信息、商品、内容和行动选项的顺序。
  • 相关概念: 预测(prediction), 排序(ranking), 候选(candidate), 模型输出(model output)
  • 核心 Section: P1-1.2
  • 出现 Section: P1-1.1, P1-1.2

提示词(prompt)

  • 含义:prompt 是为了生成当前回答而交给模型的完整输入。它不只是单行问题,也包括指令、上下文、示例、约束和输出格式,最好理解为当前任务条件的输入设计包。
  • 为什么重要:用户不用重新训练模型,也可以通过 prompt 调整当前回答条件。这个概念能帮助读者区分改变模型本身与改变一次回答的输入条件,也能解释为什么同一个模型会因为上下文、示例和要求的格式不同而给出不同方向的回答。
  • 相关概念:指令(instruction)输入上下文(input context)上下文学习(in-context learning)输出格式(output format)
  • 核心 Section:P1-12.1
  • 出现 Section:P1-12.1P6-2.4P6-10.1P6-10.3P7-5.1

token

  • 含义:token 是模型处理文本时切分出来的基本计算单位。它不一定等于一个词;一个词可能被拆成多个 token,几个短表达也可能被当作一个片段处理。人眼看到的一整句话,在模型内部会变成 token 序列来计算。
  • 为什么重要:必须区分人阅读的词和模型实际计算的单位,才能正确理解 next-token prediction 与 LLM 生成过程。成本、上下文窗口长度和 token 覆盖问题都从这个计算单位开始。理解 token 以后,prompt 设计和上下文长度限制为什么要看 token 数,而不只是字符数,也会更清楚。
  • 相关概念:下一词元预测(next-token prediction)语言建模(language modeling)嵌入(embedding)分词(tokenization)上下文窗口(context window)
  • 中心 Section:P6-2.1
  • 出现 Section:P1-10.2P5-13.1P5-13.2P6-2.1P6-2.2P6-2.3P6-2.4P6-2.5P7-4.1P7-4.2

token 化(tokenization)

  • 含义:token 化把原始文本转换成模型可以处理的 token 序列。人看到的一整句话,在模型那里会变成按顺序排列的 token 片段。
  • 为什么重要:token 化会影响 token 数、成本、上下文占用、切块边界和输入解释。在 P3-6.2 中,这个想法被类比用于区段 token:把原始曲线改写成更短的序列,从而比较顺序和方向。
  • 相关概念:词元(token), 上下文窗口(context window), 字节对编码(BPE, Byte Pair Encoding)
  • 核心 Section:P6-2.2
  • 出现 Section:P3-6.2P6-2.2P6-2.3P6-2.4P6-2.5P7-4.1P7-4.2P7-5.1

Transformer

  • 含义:Transformer 是以 attention 为中心,让序列中多个位置可以彼此参考的神经网络结构系列。它不只按从前到后的顺序传递信息,而是并行比较不同位置之间的关系,并据此形成上下文表示。由于 token 含义本身不能表示顺序,Transformer 还会单独供应位置信息。
  • 为什么重要:Transformer 是现代 LLM 的核心结构基础之一,但需要和预训练、规模化、部署方式一起阅读。这个概念帮助读者理解,LLM 不只是“很大的模型”,而是 attention 结构和大规模学习策略结合后的结果。它也说明为什么语言模型从 RNN 式顺序处理,转向更直接比较长距离上下文关系的结构。
  • 相关概念:注意力(attention)语言建模直接谱系
  • 核心 Section:P1-11.3
  • 出现 Section:P1-9.3, P5-13.2, P5-14.1, P5-14.2, P5-15.1, P6-4.1, P6-4.2, P6-4.3, P7-5.1

透明性(transparency)

  • 含义:系统的数据使用、判断逻辑、限制和输出能够被检查或解释的程度。
  • 为什么重要:当 AI 系统影响人或运营时,它支持问责、信任和错误分析。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P1-15.1

提示词结构化(prompt structuring)

  • 含义:把指令、上下文、示例、约束和输出格式组织起来,使模型更可靠地执行任务的做法。
  • 为什么重要:它把 prompt 写作从一句话变成输入设计问题。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P1-12.2

提示词工程(prompt engineering)

  • 含义:设计 prompt、指令、上下文和示例来引导模型输出的实践。
  • 为什么重要:它常常是控制 LLM 行为的第一个实践手柄,但仍需要和检索、工具、评估等边界区分开。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P6-11.1
  • 出现 Section:P1-12.1, P1-12.2

统计语言模型(statistical language model)

  • 含义:根据文本中的统计模式为词或 token 序列分配概率的语言模型。
  • 为什么重要:它提供了从基于计数的语言建模走向神经语言模型和 LLM 的历史桥梁。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P1-11.1
  • 出现 Section:P1-9.3, P1-13.2, P1-13.3, P6-20.1

统计推断(statistical inference)

  • 含义:在考虑不确定性的同时,根据样本数据对总体或过程作出结论的过程。
  • 为什么重要:它把基于证据的估计和仅仅描述手头样本区分开。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P1-5.3

统计样本(sample)

  • 含义:为分析或估计而观察到的总体或过程的一部分。
  • 为什么重要:它很重要,因为数据结论取决于样本是否代表正在讨论的更大情境。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P2-5.3
  • 出现 Section:P1-17.2, P2-5.4, P2-6.1

提示词注入(prompt injection)

  • 含义:不可信输入试图覆盖指令或重新引导模型行为的攻击或失效模式。
  • 为什么重要:它很重要,因为 LLM 应用常把用户输入、检索文本和系统指令混在同一个上下文窗口中。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P1-15.3
  • 出现 Section:P1-10.3, P1-14.2, P1-14.4, P1-14.5