Part 5 收尾:深度学习整理¶
Section ID:
P5-summaryVersion:v2026.07.20
Part 5 是这样一个区段:它真正解释了在机器学习共同问题之上,更大的函数家族 神经网络(neural network) 是怎样被堆起来的。如果说 Part 4 以数据切分、泛化、评估为中心建立了阅读模型的标准,那么 Part 5 则是在保持这个标准的同时,必须回收 学习更深表征的结构 与 真正把这个结构训练起来的过程。
这个 Part 的核心,不是把深度学习背成单纯 层很多的模型,而是把它读成一个重复结构:输入经由权重(weight)与激活函数(activation function)逐步变成不同表征,再通过损失(loss)与反向传播(backpropagation)去调整这些表征。
换句话说,Part 5 是第一个必须真正解释 Part 1 到 Part 4 中那些以 后面再解释 留下来的感知机、表征学习、损失函数、反向传播、优化器(optimizer)、卷积神经网络(CNN)、Transformer 的正文 Part。
这个核心可以重新压成下面三行。
| 先留下来的阅读顺序 | 为什么这个顺序重要 |
|---|---|
| 先看结构 | 只有先知道它在解决什么输入结构问题,模型名才没那么容易混。 |
| 从损失过渡到 gradient | 损失数值必须变成每个参数的修正信号,学习才会显出来。 |
| 最后看优化器和正则化 | 这样才能把性能差异分开读成结构原因还是学习稳定化原因。 |
这里一个重要原则是,不要把 Part 5 结束成 下一 Part 的预告片。CNN、RNN、Attention、Transformer 都会连到后面的 LLM 说明,但这种连接必须遵守 先闭合当前结构,再在下一 Part 里扩展到别的问题,而不是把解释推成 后面再看。
复习时,与其只重读这个总结页就停下来,不如在术语开始模糊的地方回到概念词汇表,把对应词条和它指向的 Core Section 一起再看一遍,会更稳定。
重新整理 Part 5 的复习流程¶
这个文档按下面顺序来读,整体流程会更清楚。
- 先重新抓住 Part 5 整体是按什么大流程构成的。
- 再把必须记住的概念和容易误解的地方一起整理。
- 接着确认 Part 5 有意没有在这里收掉的问题是什么。
- 最后再连接这些问题怎样在下一 Part 里重新打开。
这一 Part 走过的核心流程¶
Part 5 的流程可以整理如下。
- 先看感知机与多层神经网络。
- 再把激活函数、输出层、损失连起来。
- 再看从损失走向 gradient 的反向传播与自动微分。
- 再看学习与模型执行的区分。
- 再看优化器、正则化、dropout。
- 再看 GPU、batch、tensor 计算。
- 再把表征学习读成结构分叉的入口。
- 再看 CNN、RNN、LSTM、GRU。
- 再看 Attention 与 self-attention。
- 再看 Transformer。
- 再看生成模型与采样。
- 最后整理它如何连到下一 Part 的 LLM 与生成式 AI。
如果把这个流程压成一句话,就是下面这样。
深度学习不是背下一个大函数的技术,而是一种把数据不断变成更合适表征、再把这个过程的误差送回去调整的学习体系。
在 Part 5 里,这个结构会立刻重新连到下面这些问题。
| 在 Part 5 抓住的结构感觉 | 下一 Part 会再次读到的问题 |
|---|---|
| 把输入变成表征 | 句子会被切成什么 token 单位? |
| 把损失变成 gradient 来调整 | 为什么 next-token prediction 会连到可学习的生成问题? |
| Attention 与 Transformer 处理上下文 | 为什么长上下文和生成服务会成为可能? |
| 生成与采样会改变结果 | 为什么回答质量与服务质量要一起看? |
如果把这整个流程像复习地图一样再压成最短形式,可以写成下面这样。
flowchart TD
A["把输入变成更好的表征"]
B["用损失衡量误差"]
C["把调整信号向后传回"]
D["用优化器与正则化稳定学习"]
E["分叉到 CNN、RNN、注意力、Transformer"]
F["把模型输出变成生成结果"]
A --> B
B --> C
C --> D
D --> E
E --> F
也就是说,说自己学完了 Part 5,意味着 改变表征的结构、调整误差的过程、按数据结构分叉、选择生成输出 已经能够连成一条线。
按当前目录来看,这个流程更自然的重读方式是 神经网络的基本计算结构 -> 输出与损失信号 -> 学习循环与稳定化 -> 计算扩展 -> 表征学习与结构分叉 -> 生成模型与采样。
这时,把后半段再慢一点重新捆一次也很有帮助。Chapter 12 到 Chapter 15 是一个抓手变化过程:先从 顺序状态怎样被带过去,再到 能不能现在重新看回所需位置,再到 为什么把这种参照计算做成并行块重复,最后到 怎样从得到的候选里选出真实输出。只有先抓住这个把手,RNN -> attention -> Transformer -> 生成 才不会被读成快速更换模型名字,而会被读成结构想法一步步变化的流程。
如果只把后半段转变再压一次,就会变成下面这样。
| 后半段结构流程 | 要抓住的核心问题 |
|---|---|
| 顺序状态 | 前面的状态能不能稳定带到当前判断里? |
| 直接参照 | 需要的位置现在能不能重新看回去? |
| 并行块 | 为什么必须把这种参照计算捆成可重复的块结构? |
| 生成候选选择 | 怎样从算出的分布里挑出真实输出? |
在这个收尾页里,尤其重要的是不要把 Part 5 结束成 看了很多结构名字的 Part,而要把它重新绑成 表征学习 -> 结构分叉 -> 生成基础 的一条流。只有这样,读者才能解释的不是 我已经知道 Transformer 了,而是 为什么这个结构会成为生成式语言模型的基础。
如果把后半段几个结构章再压成最短形式,就是下面这个表。
| 结构章 | 比起名字更先读的问题 |
|---|---|
| 卷积神经网络(CNN) | 为什么图像里局部模式会先变得重要? |
| 循环神经网络(RNN)/ 长短期记忆(LSTM)/ 门控循环单元(GRU) | 为什么顺序与累计状态会改变当前判断? |
| 注意力(Attention)/ 自注意力(self-attention) | 为什么远处线索必须现在重新参照? |
| Transformer | 为什么关系计算必须捆成并行块结构? |
| 生成 / 采样 | 为什么在生成分布之后还要单独选择实际输出? |
必须记住的概念¶
经过 Part 5 之后,最该长久留下来的概念如下。
| 区分 | 要记住的视角 |
|---|---|
| 感知机 | 它是在输入与权重的线性组合之上放上判断结构的最小起点。 |
| 隐藏层 | 中间层不只是计算步骤,而是把输入变成不同表征的位置。 |
| 激活函数 | 如果没有非线性,就算堆深,表达能力增长也会受限。 |
| 输出层与损失 | 输出的解释方式与损失函数必须一起按问题类型选择。 |
| 反向传播与自动微分 | 反向传播是从损失出发向后计算 gradient 的过程,自动微分是根据顺向计算记录自动组织这个计算的技术。 |
| 优化器 | 即使目标都是减小损失,实际更新规则也可以不同。 |
| 正则化 | 好的学习不是只在训练中越拟合越好,而是让模型在没见过的数据上也不容易垮掉。 |
| GPU 与 batch | 深度学习的扩散不只是好想法,也和并行计算环境一起发生。 |
| 表征学习 | 深度学习转折点的核心,在于让模型自己学习特征,而不是由人手写特征。 |
| CNN / RNN / Attention | 随着数据类型与依赖结构不同,有利的模型设计也发生了变化。 |
| Transformer | self-attention 与并行结构成为了 LLM 时代的基础。 |
| 生成与采样 | 生成式 AI 会直接生成输出,而实际结果会受采样策略影响。 |
把这些概念再重新捆时,按两条轴分开会更不容易乱。
| 先分开的轴 | 这里放什么 | 为什么要分开读 |
|---|---|---|
| 结构 | 感知机、隐藏层、CNN、RNN、Attention、Transformer、生成结构 | 它说明输入会被变成什么形式,以及在处理什么依赖。 |
| 学习过程 | 损失、gradient 计算、反向传播、自动微分、优化器、正则化、dropout、batch | 它说明即使是同一种结构,学习稳定性、泛化、计算成本也会不同。 |
也就是说,在 Part 5 里,重要的是养成把 用了什么结构 和 怎样把这个结构训练起来 分开读的习惯。
容易误解的地方¶
在 Part 5 里尤其要小心下面这些误解。
- 深度学习并不是
和机器学习完全不同的东西,而是机器学习中扩展成更大表征学习结构的一条支流。 - 层更多并不会自动让模型更好。
- 不能因为损失降了,就马上断定实际质量也变好了。
- 反向传播不是整个学习过程的名字,而是 gradient 计算过程;自动微分则用代码执行记录把这个过程自动化。
- GPU 不只是加速装置,而是影响了深度学习研究方向本身的计算环境。
- 有了 Attention 并不代表 RNN 家族完全失去意义。更准确地说,是大语言模型的主流结构改变了。
- 理解了 Transformer,并不等于已经理解了整个 LLM。下一 Part 还要一起看 token、pretraining、alignment、工具连接。
- 如果生成结果很奇怪,只解读成
模型不知道还不够。采样方式、上下文长度、输入结构也要一起看。 - 如果 Part 5 只是介绍结构名字然后匆匆带过,下一 Part 的 LLM 说明也会再次弱成表面术语介绍。
这一 Part 不在这里结束的问题¶
Part 5 把重点放在解释深度学习的结构与学习过程上,因此下面这些问题被有意交给下一 Part。
- 真实服务里输入句子会被切成什么 token 单位?
- 为什么 Transformer 会连到长对话、摘要、代码生成这类用户体验?
- 在服务层面,怎样补强生成结果的质量与依据?
换句话说,Part 5 是闭合 结构基础 的 Part,而不是在这里把 LLM 的整体服务体验一次说完的 Part。
也就是说,Part 5 最后的问题不能停在 有哪些结构,而必须走向 这些结构怎样连到真实生成式 AI 服务体验。
如果把这个转变压到最短,可以写成下面这样。
- Part 5 解释
为什么需要这样的计算结构。 - 下一 Part 解释
为什么这些结构会连到真实的生成式 AI 理解与使用。
进入下一 Part 前要确认的问题¶
在进入 Part 6 之前,你应当能回答下面这些问题。
- 能解释感知机、多层神经网络、隐藏层之间的关系吗?
- 能说明为什么需要激活函数吗?
- 能说明输出层与损失函数为什么会和问题类型连在一起吗?
- 能说明损失怎样变成每个参数的 gradient 信号,以及反向传播与自动微分各自承担什么角色吗?
- 能说明优化器与学习率怎样影响学习稳定性吗?
- 能说明正则化与 dropout 怎样和过拟合连在一起吗?
- 能说明为什么 GPU、batch、tensor 计算会和深度学习扩散连在一起吗?
- 能说明 CNN、RNN、Attention、Transformer 分别是在什么数据结构或问题上出现的吗?
- 能说明生成模型与分类模型的差别吗?
- 能说明采样会影响生成质量与多样性吗?
Part 5 收尾¶
经过 Part 5 之后,你不该再只把深度学习看成 有很多权重的复杂黑箱。输入变成表征、损失被计算、误差被重新传回去、并行计算资源支撑整个过程、Attention 与 Transformer 打开长上下文与生成问题,这条大流程应该已经开始成形。
只有抓住了这条流程,下一 Part 才不会只把 LLM 当成知名产品名称或 API 调用对象,而能解释它们是建立在什么输入单位与计算结构之上的。
这也正是 Part 5 的目的。
在这里最后还要再固定一点:说自己完成了 Part 5,并不意味着 看过很多深度学习术语,而是意味着 能说出什么结构问题出现了什么计算答案。
| 完成 Part 5 时应该留下的东西 | 仍然交给下一 Part 的东西 |
|---|---|
| 能解释从感知机到 Transformer 的结构分叉原因 | 分词、预训练、检索结合、工具连接、运营细节 |
| 能把损失、gradient 计算、反向传播、自动微分、优化器、正则化与结构分开说明 | 服务设置、推理成本、长上下文运营优化 |
能把生成模型与采样解释成 分布学习 与 输出选择 | LLM 产品体验与服务设计判断 |
检查清单¶
- 经过 Part 5 之后,你有没有形成把
结构与学习过程分开读的习惯? - 你能不能把 Transformer 不只解释成知名结构,而是解释成
把关系计算捆成并行块的结构? - 你能不能把生成与采样解释成不是
下一 Part 才新出现的话题,而是在这里已经闭合结构起点的话题?
来源与参考资料¶
这个文档是对 Part 5 全体内容的内部总结,不直接引用外部资料。