P5-15.1 从深度学习视角看生成式 AI 时,什么会改变¶
Section ID:
P5-15.1Version:v2026.07.21
在 P5-14 中,我们已经看到 Transformer 能直接重新参考长上下文,能一次计算多个 token 之间的关系,也能让很深的 block 重复保持稳定。Part 5 最后的问题是:为什么这些结构会成为理解生成式 AI(generative AI)的准备。这个问题不仅是在问模型计算什么,也在问计算结果以什么形式到达用户面前。
即使同样是深度学习模型,输出是一个标签或一个分数时,和输出是用户可以阅读和修改的句子、图像、代码等生成物时,判断标准也会不同。标签通常是工作流程里的一个信号。生成物则可能直接成为用户要阅读的回答、报告草稿、说明文字或代码片段。因此,要理解生成式 AI,首先要抓住输出从结果信号变成需要检查的结果物的这一刻。
Part 5 不会完整解释生成式 AI 的使用方法。prompt、token、GPT、RAG、tool use、agent 会在 Part 6 中深入讨论。这里先准备进入 Part 6 前需要的一个视角。
分类模型通常把输入整理成标签或分数。生成式 AI 会再往前一步,试图组合出适合当前输入的输出物。因此,从深度学习视角看生成式 AI,首先就是把问题从哪个标签是对的改成什么输出物正在以适合当前上下文的方式被生成。
从标签到输出物的输出视角¶
分类模型(classification model)通常会为输入选择一个类别。
| 输入场景 | 分类模型主要给出的内容 |
|---|---|
维修报告 温度已恢复,但压力仍有波动 | 部分恢复、残余异常 等状态标签 |
| 设备照片 | 混合罐、阀门、仪表板 等对象标签 |
| 客户询问 | 退款请求、故障报告、重启请求 等类型标签 |
这些输出很有用。标签可以帮助路由请求、做统计,也可以快速划分风险等级。但生成式 AI 的使用体验会移动到标签之后的实际输出物。
| 同一个输入场景 | 生成式 AI 可以生成的输出 | 还要检查的标准 |
|---|---|---|
| 维修报告 | 同时包含恢复状态和残余风险的摘要句 | 是否没有漏掉当前状态,并且自然衔接 |
| 设备照片 | 设备说明或替代文本草稿 | 照片中的核心对象和关系是否保留在说明中 |
| 客户询问 | 包含重启步骤、确认问题和注意事项的回应草稿 | 是否具有用户可以检查和修改的句子结构 |
因此,生成式 AI 不能只用“是否选对标签”来判断。还要看输出是否符合当前上下文,是否自然衔接,以及是否能作为实际输出物被用户检查。从这里开始,模型评价不只包含对/错,还会包含是否符合上下文、是否足够具体、是否可以被检查等标准。
“生成输出本身”是什么意思¶
生成输出本身不是说模型可以无约束地随便编造。从深度学习视角看,它更接近于:模型利用从数据中学到的模式、表示结构和延续可能性,组合出新的结果。
文本生成会看下面这些问题。
- 哪些表达会自然接在另一些表达后面
- 某类请求常见什么回答结构
- 哪些警告语和后续动作经常一起出现
图像生成会看下面这些问题。
- 哪些颜色、轮廓、布局经常一起出现
- 哪些局部结构会看起来像一个对象
- 哪些风格和构图在同一条件下是自然的
关键是不要把生成式 AI 只理解成“从答案表里取出一个答案”的系统。它更像是根据学到的模式,为当前输入组合出合适输出物的模型体验。
这种差异在输出被实际使用的地方会更明显。
| 输出形式 | 容易先问的问题 | 生成式 AI 视角下增加的问题 |
|---|---|---|
| 标签 | 它属于哪个类别? | 这个标签后面还需要什么说明或动作? |
| 分数 | 它有多高或多低? | 如果把这个分数写成用户能理解的句子,会漏掉什么? |
| 生成物 | 结果出来了吗? | 上下文、自然度、可检查性是否同时满足? |
也就是说,生成式 AI 的输出既是模型计算的结果,也是人要阅读和判断的对象。模型内部仍然会为候选计算分数或概率等数字。只是到了生成式 AI 中,这些数字不会停在选择一个最终标签上,而会被用来选择并连接输出片段,例如下一个词、下一段句子片段、图像中的下一个构成要素。
例如,重启产线之前后面可以接上 确认 interlock、确认传感器状态、先低速启动 等多个表达。模型会用数字比较这些候选,但用户最终看到的不是数字表,而是由一个或多个片段连接而成的说明句。因此,看深度学习的输出侧时,不能停在哪个数字最大,还要准备继续看这些数字怎样连接成实际句子或图像片段。
为什么输出物不一定固定成一个答案¶
如果模型要生成输出物,一个固定答案可能不够。批次检查结果 后面可以自然接上 需要重新确认、负责人确认后再重启、10 分钟后重新测量 等多个句子。
因此,Part 5 最后一章会把这个流程分成三步。P5-15.1 像现在这样收住输出视角怎样改变。P5-15.2 会看模型怎样保留可能输出候选的相对可信度。P5-15.3 会看实际输出怎样从这些候选中被一个个选出来。
所以,第一次准备理解生成式 AI 时,需要的不是使用技巧列表。我们首先要理解:为什么输出物不一定像一个固定答案那样运作,以及为什么这个输出物会成为用户必须检查的对象。可能候选怎样留下来、实际输出怎样被选出来,会在接下来的两个 Section 中依次讨论。prompt 写法和实际服务使用方法,会在 Part 6 中建立在这个结构感之上继续讨论。
案例与示例¶
假设运维团队问:请告诉我停线后的重启顺序。分类模型可以把它标成 重启流程询问。这对路由和统计有用。
但生成式 AI 的用户通常不会停在这个标签上。用户期待的是 确认 interlock -> 低速重启 -> 确认传感器稳定 -> 回到正常速度 这样的实际说明。这里需要的输出不是类别名,而是用户可以检查的回应草稿。
| 容易先看的标准 | 生成式 AI 视角下还要看的标准 |
|---|---|
| 询问类型是否分类正确? | 实际说明是否符合当前设备上下文? |
| 回答看起来是否合理? | 行动顺序和风险提示是否有遗漏? |
| 句子是否生成得很长? | 是否被组织成用户可以检查和修改的形式? |
这个案例要确认的结果是:生成式 AI 不会停在 重启流程询问 这个标签,而是试图生成适合当前上下文的输出物。至于怎样信任、修改并接入服务,会在 Part 6 中重新讨论。
练习与例子¶
看下面三个输入时,先自己分成三项。第一,分类模型可能先给出什么标签。第二,生成式 AI 可能生成什么输出物。第三,检查这个生成物时还要看什么标准。然后再和下面的表格对照。
| 输入 | 分类模型视角 | 生成式 AI 视角 | 追加检查标准 |
|---|---|---|---|
压力异常导致产线停止 | 压力异常、产线停止 等标签 | 重启前检查步骤和风险提示句 | 顺序是否连贯,并且没有危险遗漏 |
| 一张设备照片 | 设备或部件标签 | 照片说明、检查对象摘要、替代文本草稿 | 是否没有断言照片中看不见的内容 |
帮我整理会议记录 | 摘要请求 这样的请求类型 | 包含决定事项、待办、负责人的摘要 | 决定事项和待办是否被分开 |
重点不是哪一边更好。分类和生成解决的是不同问题。但使用生成式 AI 时,输出物本身会成为用户体验,所以必须把生成了什么和用什么标准检查结果放在一起看。
同一个生成物一旦加上检查标准,差异会更清楚。
| 输入 | 难以检查的生成物 | 更容易检查的生成物 |
|---|---|---|
压力异常导致产线停止 | 确认问题后重新启动 | 重新确认压力数值,检查 interlock 和管路泄漏可能性,然后判断是否低速重启 |
帮我整理会议记录 | 会议讨论了多个事项,需要后续处理 | 分成决定事项、负责人、下一步行动的摘要 |
确认说明可以这样整理。
- 状态标签可以快速划分问题,但重启说明必须同时包含行动顺序和风险提示。
- 照片标签会告诉我们对象名称,但说明文字必须区分看得见的内容和看不见的内容。
- 请求类型标签对工作流分类有用,但会议摘要必须把决定、负责人、待办结构化,方便用户再次确认。
这个练习要确认的结果是:生成式 AI 不是单纯生成更长的输出,而是组合出用户可以阅读和判断的输出物。这个输出物怎样作为多个候选之一被保留下来,又怎样被选择出来,会在接下来的两个 Section 中继续讨论。
检查清单¶
- 能解释生成式 AI 和分类、预测模型会产生不同的输出体验吗?
- 能说明 Part 6 深入分析生成式 AI 之前,Part 5 需要准备什么深度学习视角吗?
- 能把标签、分数、生成输出物区分成不同输出形式吗?
- 能解释“生成输出”不是无约束编造,而是基于学到的模式组合新结果吗?
- 能说明为什么输出物不一定固定成一个答案,所以候选分布和 sampling 会在接下来的两个 Section 中变得必要吗?
出处与参考资料¶
- Ian Goodfellow, Yoshua Bengio, Aaron Courville,
Deep Learning, MIT Press, 2016,Chapter 5Machine Learning Basics与 Chapter 20Deep Generative Models,确认日期:2026-07-21。https://www.deeplearningbook.org/ - Chloe Autio, Reva Schwartz, Jesse Dunietz, Shomik Jain, Martin Stanley, Elham Tabassi, Patrick Hall, Kamie Roberts,
Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, NIST AI 600-1, 2024,确认日期:2026-07-21。https://doi.org/10.6028/NIST.AI.600-1 - Tom B. Brown et al.,
Language Models are Few-Shot Learners, NeurIPS 2020,确认日期:2026-07-21。https://papers.neurips.cc/paper/2020/hash/1457c0d6bfcb4967418bfb8ac142f64a-Abstract.html