跳转至

P1-10.2 生成下一个输出(next-output generation)的直觉

Section ID: P1-10.2 Version: v2026.07.20

在 10.1 中,我们区分了分类(classification)、预测(prediction)和生成(generation)。分类是选择类别,预测是估计值或状态,生成是创建符合条件的新内容。

这里要说明的只是一个很大的直觉:生成究竟是如何发生的。

这里的核心问题是:生成式 AI 会不会一次性拿出完整答案,还是会把小的输出片段接续起来,一步步构成结果?

入门阶段有用的基准线是:

生成式 AI 通常会基于条件(condition)产出下一个输出片段,
再把这个结果当作下一步条件的一部分,继续构造完整内容。

在 Part 1 中,本节先建立 生成下一个输出(next-output generation)下一 token 预测(next-token prediction) 的入门直觉,以及 音频样本(audio sample) 的顺序生成和 diffusion model 渐进恢复直觉之间的基本区分。10.1 先区分了 分类/预测/生成 的输出差异,这里只抓住其中 生成 是如何延续下去的计算直觉。更细的结构和公式会在后面的 Part 再讨论。

但这并不意味着所有模型都用同一种方式工作。文本生成(text generation)、语音生成(audio generation)、图像生成(image generation)都可以共享“重复生成”的大直觉,但实际的生成单位和算法并不相同。

这里先固定 生成到底是一次拿出完成品,还是把小输出片段接续起来 这个问题。tokenization 会在 Part 6 的 P6-1.1 和 P6-1.2 重新讨论;下一 token 预测(next-token prediction) 会在 P6-5.1 讨论;sampling 和 temperature 会在 Part 5 的 P5-15.3 与 Part 6 的 P6-5.2 讨论;Transformer 结构会在 P1-11.3、Part 5、Part 6 再出现;prompt 与评估会在 P1-12.1 到 P1-12.3 中继续讨论。diffusion model 的详细结构不会在这里先展开。

生成下一个输出下一 token音频样本diffusion 在开始时都可能听起来像同一种生成算法。先用一句很短的话把它们区分开:

术语 极简含义 本节中的作用
生成下一个输出 把小的输出片段接起来构成完整内容的直觉 观察生成过程的大框架
下一 token 预测 根据上下文计算下一个 token 候选项的方式 文本生成的基本直觉
音频样本生成 根据已有波形继续产生下一个样本的方式 语音生成的顺序直觉
diffusion 恢复 逐步减少噪声并恢复图像的方式 图像生成与文本生成不同的地方
sampling 从候选项中真正选出输出的过程 解释同样输入为何仍会得到不同结果的一部分原因

这里至少要保留的区分是:文本看下一个 token语音看下一个样本图像更像恢复过程sampling 是选择步骤

本节的基准直觉是:

读取条件。
计算可能的下一个输出候选项。
选择或恢复一个输出。
再以这个结果继续下一步。

另外,这里也不会讨论 怎样判断一个生成结果是好的。这个问题会在 10.3 里再分成 质量依据安全权利与责任 来看。

连接小输出片段的生成基准

  • 看到生成式 AI 看起来像一次性拿出完整产出物,但更安全的理解是它经历了重复生成的过程。
  • 理解在文本生成中,下一 token(next token) 这个单位很重要。
  • 了解在语音生成中,也可以顺序处理 音频样本(audio sample) 或波形片段。
  • 区分图像生成不能只用“下一个像素”来解释,尤其 diffusion 系列更适合理解成逐步从噪声中恢复。
  • 记住 生成下一个输出 只是入门直觉,并不是所有生成模型的完整算法说明。

三个基准

这里不去学习生成算法细节,而是聚焦在抓住生成如何延续的直觉。只要抓住下面三个基准,整体脉络就会清楚。

基准 为什么重要 本节所需的理解水平
生成不是一次拿出完成品,而是可以逐步延续 让生成式 AI 看起来更像现实的计算过程,而不是魔法。 只要理解它会不断接续小的输出片段即可。
在文本里,下一个 token(next token) 的直觉很关键 这是之后进入 LLM 说明时最重要的抓手。 知道模型不是一次选整句话,而是在不断选择下一个 token 候选项即可。
图像和语音也有重复生成的共同点,但单位和方式不同 防止把所有生成模型误解成同一种算法。 只要理解“重复生成”是共同直觉,而不是完全相同的实现即可。

文本是通过接续下一个 token 来形成的

LLM(large language model) 的文本生成通常以 token(token) 为单位来说明。token 不一定和人类看到的单词(word)完全相同,它是模型为处理文本而切分出的基本单位。

如果把 token 的形成过程极度简化,可以这样看:

原句:
再次学习 AI

方便人读的词语单位:
再次 / 学习 / AI

模型可能处理的 token 示例:
再 / 次 / 学习 / AI

这只是教学上的示意,不是真实 tokenizer 的原样输出。实际 tokenization 会依模型和 tokenizer 而变化。有时一个词会被拆成多个 token,有时空格或符号也会成为 token 边界的一部分。

这里真正重要的只有一点:

LLM 不是像人那样直接读取整句文本,
而是把句子拆成名为 token 的可计算片段来处理。

假设用户输入:

输入:
请用一句话说明为什么要重新学习 AI。

模型并不是从某个“完整句子仓库”里拿出成品,而是把前面的上下文(context)当作条件,计算下一个可能出现的 token 候选分布,再把被选中的 token 接到输出后面。

简化后可以写成:

上下文:
重新学习 AI 的原因是

下一个 token 候选项:
为了
因为
重建
恢复
...

一个 token 被选中后,上下文就会改变。

上下文:
重新学习 AI 的原因是 为了

下一个 token 候选项:
重建
恢复
理解
适应
...

不断重复这个过程,句子就会形成。

重新学习 AI 的原因是为了重建基础,并适应新的技术变化。

GPT-3 论文把 GPT-3 描述为一个拥有 175B 参数的自回归语言模型(autoregressive language model)。自回归(autoregressive) 这个词正好和这里的直觉相连:前面的输出与上下文会成为下一个输出的条件。

下一个 token 并不是唯一正确答案

如果只把下一 token 预测(next-token prediction)理解成“猜中唯一正确答案”,就很容易错过生成式 AI 的一个关键特征。即使在同样的上下文里,也可能有多个合理的下一个 token 候选项。

上下文:
今天会议的重点是

可能的下一个 token:
日程
风险
决定
成本

模型可以为这些候选项分别打分。但最终真正选中哪一个,还会受模型设定和生成方式影响。

正因为如此,生成结果通常具有下面这些性质:

性质 含义
概率性选择(probabilistic choice) 同样输入也可能得到不同输出。
上下文依赖(context dependency) 之前输入了什么,会改变接下来的候选项。
累积效应(accumulation effect) 前面选出的输出会成为后面输出的条件。
错误累积(error accumulation) 前面的错误选择可能扰动后面的整句话。

因此,把生成式 AI 的输出理解成“把计算出的候选项不断接续起来形成的内容”会更安全。即使句子看起来很合理,也不代表依据会自动得到保证。

语音也可以理解成顺序生成

语音生成(audio generation)同样可以用顺序生成的直觉来理解。WaveNet 论文提出了能够直接处理原始音频波形(raw audio waveform)的生成模型,并把波形(waveform)的联合概率(joint probability)写成以前面样本为条件的一系列条件概率的乘积。

入门阶段的基准线可以写成:

之前的音频样本
-> 下一个样本的候选分布
-> 选择一个样本
-> 进入下一步

这和文本中的下一 token 生成看起来很像,但生成单位不同。

领域 生成单位示例 直觉
文本 token(token) 通过接续下一个 token 来构成句子
语音 音频样本(audio sample)、波形片段 通过接续下一个波形值来构成声音

这个比较的目的并不是说“文本和语音使用同一种模型”。更准确的目的只是说明:生成并不是一次性拿出完成品,而是可以被理解为根据条件把下一块内容不断接起来的过程。

只用“下一个像素”解释图像是不够的

图像生成(image generation)需要更谨慎地解释。如果只说“模型一个像素一个像素地猜下去”,那对部分模型也许成立,但不足以解释现代图像生成的整体情况。

尤其是 diffusion model 系列,它和文本生成那种从左到右不断接上下一个 token 的方式不同。Ho 等人的 denoising diffusion probabilistic model(DDPM) 使用了加噪过程和反向恢复(reverse process)。从入门角度,可以这样理解:

从随机噪声开始。
利用条件和学习到的模式稍微减少一点噪声。
把这个过程重复很多步。
逐渐恢复成更接近图像的状态。

Latent Diffusion Models 论文表明,diffusion 过程可以在更低维的 latent space 中进行,并通过基于 cross-attention 的 conditioning 应用于 text-to-image synthesis 等任务。

因此,更安全的表述方式是:

文本生成:
容易解释成不断接续下一个 token 的顺序生成。

图像生成:
更重要的是理解成在条件之下逐步恢复噪声或潜在表征。

两者也有共同点。它们都会根据条件逐步构造产出物。但生成单位和计算方式并不相同。

同一个 prompt 会因生成方式不同而被不同处理

假设用户提出这样的请求:

prompt:
请为重新学习 AI 的人制作一张平静风格的封面图。

如果是文本模型,它可能生成一段说明文字或类似 prompt 的句子:

输出示例:
在昏暗的书桌上摆着一台笔记本电脑和一本摊开的笔记本,
屏幕上隐约浮现着神经网络图示。

如果是图像生成模型,它则可能把同一句话当作条件,逐步构造图像表征。

条件:
平静的封面、AI 再学习、笔记本电脑、笔记本、神经网络图示

生成:
从噪声或潜在表征开始,逐步恢复成图像

从用户视角看,这两者都叫“生成”。但模型内部使用的生成单位并不相同。

生成包含修改与重复

生成式 AI 的一个重要使用经验是:一次输出通常并不是结束。用户会先看到结果,再调整条件。

第一次请求:
请简短地总结。

第二次请求:
请改成更学术一些的表达。

第三次请求:
请补充一个初次阅读者也能理解的例子。

在这个流程中,模型的输出会再次成为下一次输入的一部分。

用户条件
-> 模型输出
-> 人类审阅
-> 修改条件
-> 新输出

这也直接连接到本书的制作方式。AI 工具产出的草稿并不是最终原稿,而是下一轮审阅与修改的材料。生成可以给出内容,但这个内容是否正确、是否有依据、是否符合当前原稿脉络,仍然要由人来判断。

检查清单

  • 我可以说明生成式 AI 更安全的理解方式是重复生成过程,而不是一次拿出完成品。
  • 我可以解释文本生成中 token(token) 与下一 token 预测(next-token prediction) 的直觉。
  • 我可以说明下一个 token 不是唯一正确答案,而是从候选分布中被选出的输出。
  • 我可以解释语音生成中顺序处理音频样本(audio sample)的直觉。
  • 我可以说明为什么图像生成,尤其 diffusion model,不能被简化成下一像素预测。
  • 我可以说明为什么生成结果需要人类审阅与反复修改。
  • 我可以说明“下一个输出单位是什么”以及“这个单位是在什么条件下被选择或恢复的”。
  • 我可以区分文本、语音、图像生成虽然都属于重复生成,但单位和方式并不相同。

来源与参考资料