P1-10.2 生成下一个输出(next-output generation)的直觉¶
Section ID:
P1-10.2Version:v2026.07.20
在 10.1 中,我们区分了分类(classification)、预测(prediction)和生成(generation)。分类是选择类别,预测是估计值或状态,生成是创建符合条件的新内容。
这里要说明的只是一个很大的直觉:生成究竟是如何发生的。
这里的核心问题是:生成式 AI 会不会一次性拿出完整答案,还是会把小的输出片段接续起来,一步步构成结果?
入门阶段有用的基准线是:
生成式 AI 通常会基于条件(condition)产出下一个输出片段,
再把这个结果当作下一步条件的一部分,继续构造完整内容。
在 Part 1 中,本节先建立 生成下一个输出(next-output generation)、下一 token 预测(next-token prediction) 的入门直觉,以及 音频样本(audio sample) 的顺序生成和 diffusion model 渐进恢复直觉之间的基本区分。10.1 先区分了 分类/预测/生成 的输出差异,这里只抓住其中 生成 是如何延续下去的计算直觉。更细的结构和公式会在后面的 Part 再讨论。
但这并不意味着所有模型都用同一种方式工作。文本生成(text generation)、语音生成(audio generation)、图像生成(image generation)都可以共享“重复生成”的大直觉,但实际的生成单位和算法并不相同。
这里先固定 生成到底是一次拿出完成品,还是把小输出片段接续起来 这个问题。tokenization 会在 Part 6 的 P6-1.1 和 P6-1.2 重新讨论;下一 token 预测(next-token prediction) 会在 P6-5.1 讨论;sampling 和 temperature 会在 Part 5 的 P5-15.3 与 Part 6 的 P6-5.2 讨论;Transformer 结构会在 P1-11.3、Part 5、Part 6 再出现;prompt 与评估会在 P1-12.1 到 P1-12.3 中继续讨论。diffusion model 的详细结构不会在这里先展开。
生成下一个输出、下一 token、音频样本、diffusion 在开始时都可能听起来像同一种生成算法。先用一句很短的话把它们区分开:
| 术语 | 极简含义 | 本节中的作用 |
|---|---|---|
| 生成下一个输出 | 把小的输出片段接起来构成完整内容的直觉 | 观察生成过程的大框架 |
| 下一 token 预测 | 根据上下文计算下一个 token 候选项的方式 | 文本生成的基本直觉 |
| 音频样本生成 | 根据已有波形继续产生下一个样本的方式 | 语音生成的顺序直觉 |
| diffusion 恢复 | 逐步减少噪声并恢复图像的方式 | 图像生成与文本生成不同的地方 |
| sampling | 从候选项中真正选出输出的过程 | 解释同样输入为何仍会得到不同结果的一部分原因 |
这里至少要保留的区分是:文本看下一个 token、语音看下一个样本、图像更像恢复过程、sampling 是选择步骤。
本节的基准直觉是:
读取条件。
计算可能的下一个输出候选项。
选择或恢复一个输出。
再以这个结果继续下一步。
另外,这里也不会讨论 怎样判断一个生成结果是好的。这个问题会在 10.3 里再分成 质量、依据、安全、权利与责任 来看。
连接小输出片段的生成基准¶
- 看到生成式 AI 看起来像一次性拿出完整产出物,但更安全的理解是它经历了重复生成的过程。
- 理解在文本生成中,
下一 token(next token)这个单位很重要。 - 了解在语音生成中,也可以顺序处理
音频样本(audio sample)或波形片段。 - 区分图像生成不能只用“下一个像素”来解释,尤其 diffusion 系列更适合理解成逐步从噪声中恢复。
- 记住
生成下一个输出只是入门直觉,并不是所有生成模型的完整算法说明。
三个基准¶
这里不去学习生成算法细节,而是聚焦在抓住生成如何延续的直觉。只要抓住下面三个基准,整体脉络就会清楚。
| 基准 | 为什么重要 | 本节所需的理解水平 |
|---|---|---|
| 生成不是一次拿出完成品,而是可以逐步延续 | 让生成式 AI 看起来更像现实的计算过程,而不是魔法。 | 只要理解它会不断接续小的输出片段即可。 |
| 在文本里,下一个 token(next token) 的直觉很关键 | 这是之后进入 LLM 说明时最重要的抓手。 | 知道模型不是一次选整句话,而是在不断选择下一个 token 候选项即可。 |
| 图像和语音也有重复生成的共同点,但单位和方式不同 | 防止把所有生成模型误解成同一种算法。 | 只要理解“重复生成”是共同直觉,而不是完全相同的实现即可。 |
文本是通过接续下一个 token 来形成的¶
LLM(large language model) 的文本生成通常以 token(token) 为单位来说明。token 不一定和人类看到的单词(word)完全相同,它是模型为处理文本而切分出的基本单位。
如果把 token 的形成过程极度简化,可以这样看:
原句:
再次学习 AI方便人读的词语单位:
再次 / 学习 / AI模型可能处理的 token 示例:
再 / 次 / 学习 / AI
这只是教学上的示意,不是真实 tokenizer 的原样输出。实际 tokenization 会依模型和 tokenizer 而变化。有时一个词会被拆成多个 token,有时空格或符号也会成为 token 边界的一部分。
这里真正重要的只有一点:
LLM 不是像人那样直接读取整句文本,
而是把句子拆成名为 token 的可计算片段来处理。
假设用户输入:
输入:
请用一句话说明为什么要重新学习 AI。
模型并不是从某个“完整句子仓库”里拿出成品,而是把前面的上下文(context)当作条件,计算下一个可能出现的 token 候选分布,再把被选中的 token 接到输出后面。
简化后可以写成:
上下文:
重新学习 AI 的原因是下一个 token 候选项:
为了
因为
重建
恢复
...
一个 token 被选中后,上下文就会改变。
上下文:
重新学习 AI 的原因是 为了下一个 token 候选项:
重建
恢复
理解
适应
...
不断重复这个过程,句子就会形成。
重新学习 AI 的原因是为了重建基础,并适应新的技术变化。
GPT-3 论文把 GPT-3 描述为一个拥有 175B 参数的自回归语言模型(autoregressive language model)。自回归(autoregressive) 这个词正好和这里的直觉相连:前面的输出与上下文会成为下一个输出的条件。
下一个 token 并不是唯一正确答案¶
如果只把下一 token 预测(next-token prediction)理解成“猜中唯一正确答案”,就很容易错过生成式 AI 的一个关键特征。即使在同样的上下文里,也可能有多个合理的下一个 token 候选项。
上下文:
今天会议的重点是可能的下一个 token:
日程
风险
决定
成本
模型可以为这些候选项分别打分。但最终真正选中哪一个,还会受模型设定和生成方式影响。
正因为如此,生成结果通常具有下面这些性质:
| 性质 | 含义 |
|---|---|
| 概率性选择(probabilistic choice) | 同样输入也可能得到不同输出。 |
| 上下文依赖(context dependency) | 之前输入了什么,会改变接下来的候选项。 |
| 累积效应(accumulation effect) | 前面选出的输出会成为后面输出的条件。 |
| 错误累积(error accumulation) | 前面的错误选择可能扰动后面的整句话。 |
因此,把生成式 AI 的输出理解成“把计算出的候选项不断接续起来形成的内容”会更安全。即使句子看起来很合理,也不代表依据会自动得到保证。
语音也可以理解成顺序生成¶
语音生成(audio generation)同样可以用顺序生成的直觉来理解。WaveNet 论文提出了能够直接处理原始音频波形(raw audio waveform)的生成模型,并把波形(waveform)的联合概率(joint probability)写成以前面样本为条件的一系列条件概率的乘积。
入门阶段的基准线可以写成:
之前的音频样本
-> 下一个样本的候选分布
-> 选择一个样本
-> 进入下一步
这和文本中的下一 token 生成看起来很像,但生成单位不同。
| 领域 | 生成单位示例 | 直觉 |
|---|---|---|
| 文本 | token(token) | 通过接续下一个 token 来构成句子 |
| 语音 | 音频样本(audio sample)、波形片段 | 通过接续下一个波形值来构成声音 |
这个比较的目的并不是说“文本和语音使用同一种模型”。更准确的目的只是说明:生成并不是一次性拿出完成品,而是可以被理解为根据条件把下一块内容不断接起来的过程。
只用“下一个像素”解释图像是不够的¶
图像生成(image generation)需要更谨慎地解释。如果只说“模型一个像素一个像素地猜下去”,那对部分模型也许成立,但不足以解释现代图像生成的整体情况。
尤其是 diffusion model 系列,它和文本生成那种从左到右不断接上下一个 token 的方式不同。Ho 等人的 denoising diffusion probabilistic model(DDPM) 使用了加噪过程和反向恢复(reverse process)。从入门角度,可以这样理解:
从随机噪声开始。
利用条件和学习到的模式稍微减少一点噪声。
把这个过程重复很多步。
逐渐恢复成更接近图像的状态。
Latent Diffusion Models 论文表明,diffusion 过程可以在更低维的 latent space 中进行,并通过基于 cross-attention 的 conditioning 应用于 text-to-image synthesis 等任务。
因此,更安全的表述方式是:
文本生成:
容易解释成不断接续下一个 token 的顺序生成。图像生成:
更重要的是理解成在条件之下逐步恢复噪声或潜在表征。
两者也有共同点。它们都会根据条件逐步构造产出物。但生成单位和计算方式并不相同。
同一个 prompt 会因生成方式不同而被不同处理¶
假设用户提出这样的请求:
prompt:
请为重新学习 AI 的人制作一张平静风格的封面图。
如果是文本模型,它可能生成一段说明文字或类似 prompt 的句子:
输出示例:
在昏暗的书桌上摆着一台笔记本电脑和一本摊开的笔记本,
屏幕上隐约浮现着神经网络图示。
如果是图像生成模型,它则可能把同一句话当作条件,逐步构造图像表征。
条件:
平静的封面、AI 再学习、笔记本电脑、笔记本、神经网络图示生成:
从噪声或潜在表征开始,逐步恢复成图像
从用户视角看,这两者都叫“生成”。但模型内部使用的生成单位并不相同。
生成包含修改与重复¶
生成式 AI 的一个重要使用经验是:一次输出通常并不是结束。用户会先看到结果,再调整条件。
第一次请求:
请简短地总结。第二次请求:
请改成更学术一些的表达。第三次请求:
请补充一个初次阅读者也能理解的例子。
在这个流程中,模型的输出会再次成为下一次输入的一部分。
用户条件
-> 模型输出
-> 人类审阅
-> 修改条件
-> 新输出
这也直接连接到本书的制作方式。AI 工具产出的草稿并不是最终原稿,而是下一轮审阅与修改的材料。生成可以给出内容,但这个内容是否正确、是否有依据、是否符合当前原稿脉络,仍然要由人来判断。
检查清单¶
- 我可以说明生成式 AI 更安全的理解方式是重复生成过程,而不是一次拿出完成品。
- 我可以解释文本生成中 token(token) 与下一 token 预测(next-token prediction) 的直觉。
- 我可以说明下一个 token 不是唯一正确答案,而是从候选分布中被选出的输出。
- 我可以解释语音生成中顺序处理音频样本(audio sample)的直觉。
- 我可以说明为什么图像生成,尤其 diffusion model,不能被简化成下一像素预测。
- 我可以说明为什么生成结果需要人类审阅与反复修改。
- 我可以说明“下一个输出单位是什么”以及“这个单位是在什么条件下被选择或恢复的”。
- 我可以区分文本、语音、图像生成虽然都属于重复生成,但单位和方式并不相同。
来源与参考资料¶
- Tom B. Brown et al., Language Models are Few-Shot Learners, arXiv, 2020, 确认日期: 2026-06-23.
- Aäron van den Oord et al., WaveNet: A Generative Model for Raw Audio, arXiv, 2016, 确认日期: 2026-06-23.
- Jonathan Ho, Ajay Jain, Pieter Abbeel, Denoising Diffusion Probabilistic Models, arXiv, 2020, 确认日期: 2026-06-23.
- Robin Rombach et al., High-Resolution Image Synthesis with Latent Diffusion Models, arXiv, 2021, 确认日期: 2026-06-23.