Part 6 收尾¶
Section ID:
P6-summaryVersion:v2026.07.24
Part 6 以 LLM 为中心案例来阅读生成式 AI。核心不是把 LLM 等同于整个生成式 AI,而是把它作为一条代表路径,用来把生成式 AI 的产出物、输入表示、候选生成、证据补强、工具执行、评价、运营记录放在同一条流程中观察。
这个 Part 的起点不是 模型回答得好不好。我们先把人收到的产出物看成检查对象,再看这个产出物怎样经过 token 与 embedding 变成可计算的输入,并在 Transformer 与 GPT 系列结构中累积为下一候选选择。之后确认了 prompt、RAG、向量数据库、工具使用、agent、MCP、harness、评价、运营约束为什么不是彼此分开的主题,而是让生成式 AI 使用过程变得可检查的装置。
必须留下的感觉¶
- 生成式 AI 的输出是需要检查的产出物。
- LLM 的生成不是一次性取出完成答案,而是反复处理候选分布与选择的流程。
- 文本生成会经过 token 与 embedding,变成可计算的表示。
- Transformer 与 GPT 结构要读成反映上下文并制造下一个候选的流程。
- 预训练、微调、指令微调、对齐各自改变的学习对象和调整对象不同。
- prompt 会调整输入指示,但不能解决所有最新性、证据性和执行问题。
- RAG 与向量数据库会在回答之前接上外部证据候选,并让我们同时查看候选的原文与元数据。
- 工具使用与 agent 会连接模型外部的查询、计算和执行,并根据中间观察改变下一步行动。
- MCP 与 harness 处理的不是模型能力本身,而是工具连接形式、执行记录、可复现性、可检查性。
- 好句子与可服务的回答不同,评价、成本、延迟、失败应对、执行记录要一起看。
- 发展史与 BERT 系列是背景地图,用来避免过度放大 GPT 中心主线。
容易误解的地方¶
| 误解 | 需要重新抓住的标准 |
|---|---|
| LLM 等于整个生成式 AI | LLM 是这个 Part 中说明生成式 AI 的中心案例。不能把图像、语音、视频生成都直接断定为同一结构。 |
| token ID 数字越大,意义越重要 | token ID 更接近词表中的编号,意义比较要在 embedding 向量和相似度中处理。 |
| 向量越近就越是正确答案 | 接近的向量只是缩小候选范围的信号。最终答案还需要检查原文、元数据、最新性和业务条件。 |
| prompt 写得好,大多数问题就能解决 | 最新文档确认、外部查询、计算执行、权限批准、失败记录,都需要 prompt 外部的结构。 |
| 回答自然就可以放进服务 | 可服务的回答必须同时通过质量标准、自动评价、人工检查、成本、延迟、失败应对、执行记录。 |
| agent 会自动把事情做到最后 | agent 需要同时具备计划、行动、观察、结束条件和人工检查标准,才能安全地阅读。 |
Part 6 中闭合的流程¶
| 流程 | 闭合的标准 |
|---|---|
| 从产出物开始 | 生成式 AI 输出是结果物,因此不能只看对错,还要一起检查证据、形式、风险、可用性。 |
| 下沉到输入表示 | 人写的句子会变成 token、token ID、embedding,这一区分会改变成本、上下文长度、检索、候选比较。 |
| 阅读生成结构 | GPT 系列的长答案是下一 token 候选选择反复累积的结果,输出设置会改变稳定性与多样性的平衡。 |
| 区分回答习惯 | 预训练建立宽广的语言基础,微调、指令微调和对齐会按目的与允许标准调整回答习惯。 |
| 接上证据与执行 | 超出 prompt 能处理的边界时,就需要 RAG、向量数据库、工具使用、agent 结构。 |
| 留下连接与记录 | MCP 帮助以一定形式连接工具和资源,harness 则包住执行过程,让原因和结果能够被重新查看。 |
| 以服务状态检查 | LLM 评价不只看回答句子,还要一起看自动评价、人工评价、运营约束、失败应对。 |
| 以背景和比较取得平衡 | 发展史与 BERT 系列提供比较轴,避免让 GPT 中心说明覆盖所有语言模型说明。 |
交给项目的标准¶
Part 7 会通过实际项目产出物确认这条流程。现在重要的问题不是先问 要做什么生成式 AI 功能,而是先问 请求、输入、证据、输出、评价、失败应对、记录要怎样留下来。
进入 Part 7 之前,只要留下下面这些问题即可。
- 请求是否固定为一句目标和输入单位?
- 是否在没有基准点(baseline)的情况下就说它变好了?
- 如果使用 RAG,是否先留下了检索证据和失败候选,而不是只留下回答?
- 如果使用工具或 agent,是否留下了以什么顺序调用了哪些工具、在哪里停止?
- 自动评价反复检查什么,人工评价负责哪些语境判断?
- 成本、延迟、使用量限制、故障记录是否能连接到下一次修改?
这些问题必须留下来,Part 7 的项目才不会只以代码执行结束,而会以可以重新检查和修改的学习记录收尾。