Part 5. 深度学习¶
Section ID: P5-index Version: v2026.07.20
Part 5 是正式解释神经网络与深度学习的 Part。Part 1、Part 2、Part 4 已经多次预告了感知机、表征学习、反向传播、优化器、卷积神经网络(CNN)、循环神经网络(RNN)、注意力(Attention)、Transformer 等主题,但那时的角色主要是先画出地形图并补回基础。到了 Part 5,这些解释不再往后推。从这里开始,必须真正回收 为什么需要这样的结构、它是怎样被训练的、什么差异让模型结构分叉开来。
这个 Part 的核心目的,是让读者能够把深度学习解释成计算结构与学习结构,而不是黑箱名字。很多读者已经多次听过神经网络、CNN、Transformer 这些名称,但往往还不能把 输入怎样变成表征、误差怎样被重新传回去、为什么 GPU 和 batch 重要、为什么注意力成为结构转折点 串成一条完整的说明。
所以 Part 5 会沿着下面六条轴线真正回收这些解释。
- 神经网络的基本计算结构
- 输出与损失信号
- 学习循环与稳定化
- 计算扩展
- 表征学习与结构分叉
- 生成模型与采样
如果把这个顺序像学习地图一样一次压缩,可以写成下面这样。
flowchart TD
subgraph A["神经网络基础"]
A1["感知机与多层结构"] --> A2["激活、输出、损失"]
A2 --> A3["反向传播"]
end
subgraph B["训练与规模"]
B1["优化器与正则化"] --> B2["批量、张量、GPU"]
B2 --> B3["表征学习"]
end
subgraph C["结构分叉"]
C1["CNN 处理局部模式"] --> C2["RNN 处理序列状态"]
C2 --> C3["注意力与自注意力"]
C3 --> C4["Transformer 模块"]
C4 --> C5["生成与采样"]
end
A3 --> B1
B3 --> C1
也就是说,Part 5 是一个逐步把抓手从 基本计算结构 -> 输出与损失 -> 学习循环 -> 计算扩展 -> 结构分叉 -> 生成 移过去的 Part。
换句话说,Part 5 是第一个真正解释 Part 1 到 Part 4 中那些以 后面再解释 留下来的深度学习核心概念的 Part。如果这里的解释偏弱,下一 Part 关于 LLM 和生成式 AI 的内容也会再次滑回表面的术语介绍。
Part 5 不能被读成 深度学习预告片。因此,默认原则是让 CNN、RNN、Attention、Transformer 各自在这个 Part 内先闭合 为什么在这种数据结构问题上会出现这样的设计,而与 Part 6 的连接只保留为一个很短的下一步提示。
如果在读这一 Part 时核心术语的基线又开始变模糊,默认参考点是回到概念词汇表,把各个词条的 Core Section 与 Appears In 一起看,沿着那个复习路径重新接回去。
如果把这个标准按当前 Part 5 目录再压成一行,可以得到下面这个表。
| 当前 Part 5 先闭合的内容 | 交给 Part 6 的内容 |
|---|---|
| 感知机、损失、反向传播、优化器(optimizer)、正则化(regularization)、CNN、RNN、Attention、Transformer、生成与采样的基本结构与角色 | 分词(tokenization)、预训练(pretraining)、指令微调(instruction tuning)、检索增强生成(RAG)、工具使用(tool use)、agent、服务运营 |
这个 Part 也会预先准备好在 Part 6 以及更后面的 Part 里再次出现的解释对象。
- 表征学习之后会继续连到 token、上下文窗口、embedding 的解释。
- 生成与采样之后会继续连到生成结果比较与 decoding 判断。
- Attention 与 Transformer 之后会继续连到检索结合、依据选择与评估结构解释。
- 学习过程与稳定化之后会继续连到质量判断、失败分析与运营评估的阅读。
同时,很重要的一点是不要太早只用一句话把这些连接匆匆带过去。Part 5 后半段不是背 RNN 之后是 attention,再之后是 Transformer 的顺序,而是抓住这样一种把手变化:把顺序状态往后传的结构 -> 重新看回所需位置的结构 -> 把这种参照计算打包成可重复并行块的结构 -> 从候选分布里选出实际输出的问题。只有先抓住这种缓慢的转变感觉,后半段才会作为结构变化流程留下来,而不是变成模型名字罗列。
如果只把后半段的转变再压成最短形式,就是下面这样。
| 后半段先变化的抓手 | 这一阶段要抓住的问题 |
|---|---|
| 顺序状态 | 先前状态怎样被带到当前判断里? |
| 直接参照 | 现在能不能重新看回所需的前面位置? |
| 并行块 | 为什么要把这种参照计算打包成可重复的块结构? |
| 生成候选选择 | 怎样从算出的分布里选出真实输出? |
这一 Part 的目的¶
这个 Part 是为了从 表征学习结构、学习过程、模型结构分叉 三个层次重新理解深度学习的区段。
前面的 Part 已经多次预告,表征学习、反向传播与优化器、CNN/RNN/Transformer 结构会在后面重新回来。
Part 5 的责任,就是兑现这个承诺。所以这个 Part 不能停在 神经网络也是重要技术 这样的程度,至少必须真正解释下面这些问题。
- 单个感知机与多层神经网络有什么不同?
- 如果没有激活函数,为什么深度会失去意义?
- 损失与反向传播究竟在计算什么?
- SGD 与 Adam 有什么不同?
- 正则化与 dropout 试图阻止什么?
- CNN、RNN、Attention、Transformer 各自想解决什么样的数据结构问题?
- 为什么生成模型与采样会连到下一 Part 的生成式 AI?
当前阅读原则¶
Part 5 依照下面这些原则来读会更稳定。
| 原则 | 含义 |
|---|---|
| 先闭合结构 | 每一章都应当在当前章内结束 问题是什么、什么计算结构给出了回答。 |
| 把学习过程单独分开 | loss、gradient、optimizer、regularization 不与结构名称混读,而是放在学习过程这一轴上。 |
| 与 Part 6 的连接只留得很短 | 可以说明 为什么需要下一 Part,但不要把当前章的关键解释往后推。 |
这里很重要的是不要把下面两条轴混在一起。
| 当前阅读的轴 | 代表问题 | 这一 Part 的代表项目 |
|---|---|---|
| 结构问题 | 应该怎样表示这种输入结构? | 感知机、CNN、RNN、Attention、Transformer、生成结构 |
| 学习过程问题 | 怎样把这个结构稳定地训练起来? | 损失、gradient 计算、反向传播、自动微分、优化器、正则化、dropout、batch |
在 Part 5 前半段,尤其先固定下面这个连接标准。
| 先读的结构轴 | 紧接着要问的问题 | 下一步转过去的学习过程轴 |
|---|---|---|
| 感知机与多层结构 | 输入怎样变成中间表征? | 损失、反向传播、优化器怎样修正这个结构? |
| 激活函数 | 为什么深度会从单纯的线性重复变成有意义的表征扩展? | 学习稳定化、初始化、正则化 |
| CNN / RNN / Attention / Transformer | 是什么数据结构问题让设计分叉开来? | 各种结构在实际中怎样被稳定训练 |
只有抓住这个区分,才能把 是因为 CNN 更好所以性能提升了 与 是因为换了优化器让学习更稳定所以性能提升了 分开来读。
这个区分也可以先固定成下面三行。
| 阅读深度学习的最小顺序 | 为什么这个顺序要先来 |
|---|---|
| 先看结构 | 只有先知道它想解决什么输入结构问题,模型名才不会那么混乱。 |
| 从损失过渡到 gradient | 损失数值必须变成每个参数的修正信号,学习才会真正继续。 |
| 最后看优化器和正则化 | 这样才能把性能差异分开读成结构原因还是学习稳定化原因。 |
这一 Part 解释什么,不解释什么¶
Part 5 是真正执行深度学习正文解释的 Part。因此,下面这些内容会在正文范围内解释。
- 感知机、多层结构、激活函数、输出层、损失、gradient 计算、反向传播、自动微分之间的连接
- 优化器(optimizer)、正则化(regularization)、dropout、训练/评估模式(training/eval mode)等学习过程与稳定化感
- 为什么 GPU、batch、tensor 计算要和深度学习扩散一起读
- 为什么表征学习会成为 CNN、RNN、Attention、Transformer 等结构分叉的入口
- CNN、RNN、LSTM、GRU、Attention、Transformer、生成与采样的结构位置
Part 5 的责任,是把 为什么需要这些结构和过程 连接起来说明。因此,这个 Part 的开始页会先展示正文要回收的几条轴线:结构、损失与 gradient、学习稳定化、计算扩展、表征学习与结构分叉、生成与采样。各章则会沿着这条流程,在 Section 单位重新闭合结构说明和学习过程说明。
这一 Part 的目标¶
读完 Part 5 之后,目标是形成大致如下层级的理解。
- 能解释感知机、多层神经网络、隐藏层(hidden layer)之间的关系。
- 能把激活函数(activation function)、输出层(output layer)、损失函数(loss function)的作用连起来解释。
- 能说明反向传播(backpropagation)与自动微分(automatic differentiation)怎样把损失变成每个参数的 gradient 信号。
- 能把学习(learning)与模型执行(inference)的差别说成计算阶段与更新阶段的差别。
- 能解释 SGD、Adam 这类优化器为什么会有不同的更新手感。
- 能解释正则化(regularization)、dropout、泛化(generalization)之间的关系。
- 能说明 GPU、batch、tensor 计算为什么和深度学习扩散直接相关。
- 能解释 CNN、RNN、LSTM、GRU、Attention、Transformer 分别是在什么输入结构与依赖性问题上出现的。
- 能解释生成模型(generative model)与采样(sampling)的基本直觉。
从为后续 Part 5 做准备的角度,这些目标也可以重新读成下面这些问题。
| 在 Part 5 需要理解的结构 | 下一 Part 会再次读到的问题 |
|---|---|
| 表征学习 | 为什么输入会再次被读成 token 与 embedding 表征? |
| 生成与采样 | 为什么 next-token prediction 与 decoding 会变得重要? |
| Attention 与 Transformer | 为什么它们会成为长上下文与生成服务的基础? |
| 学习稳定化与泛化 | 为什么评估与运营判断要分开带走? |
这一 Part 必须真正回收的前文预告¶
Part 5 必须真正补上前面各 Part 延后的解释。尤其下面这些项目,不能只是 名字再次出现,而必须在这里有正文解释。
| 前面 Part 延后的主题 | 这个 Part 里必须真正解释的内容 |
|---|---|
| 表征学习 | 人工写特征与模型直接学习表征之间的差别 |
| 损失函数与优化 | 为什么需要损失,以及梯度(gradient)与优化器(optimizer)怎样连接 |
| 反向传播与自动微分 | 从损失出发的 gradient 怎样沿着计算记录组织成每个参数的信号 |
| CNN、RNN、Transformer | 为什么模型设计会随着数据结构与依赖结构而分叉 |
| GPU 与并行处理 | 为什么深度学习扩散不能和计算资源分开看 |
| 生成与采样 | 分类式输出与生成式输出的差别,以及通向下一 Part 的起点 |
如果这个标准缺失,Part 5 就会再次变弱成 深度学习关键词列表。
面向入门读者的阅读标准¶
这个 Part 是第一次让计算结构说明密度明显升高的区段。与其一下子抓住所有公式和实现细节,不如先用下面三个问题来读,会更稳定。
| 先抓住的问题 | 为什么需要这个问题 | 在这一 Part 抓到什么程度就够 |
|---|---|---|
现在解释的是 改变表征的结构,还是 调整学习的过程? | 隐藏层、激活函数、CNN 是结构,损失、梯度、优化器是学习过程。 | 先把结构与学习过程分开读。 |
这个模型是为了 连接或记住什么 而设计的? | CNN、RNN、Attention、Transformer 都是从不同的输入结构问题里出来的。 | 区分各结构更擅长图像、顺序还是长上下文。 |
现在的改进是因为 更深的表征,还是因为 更稳定的学习? | 深度学习说明里,结构改进与学习稳定化技巧经常混在一起。 | 把模型结构轴与优化器/正则化轴分开读。 |
这个流程最短可以整理成下面这样。
深度学习会叠加把输入变成更好表征的结构。损失与反向传播告诉这个结构该怎样修正,优化器与正则化让学习更稳定。CNN、RNN、Attention、Transformer 则是为了回答不同的数据结构问题而出现的。
它解释什么¶
Part 5 大体可以读成 神经网络基本计算、学习过程与稳定化、主要深度学习结构 三个捆绑。
首先在前半段,会把感知机、多层结构、激活函数、输出层、损失函数与 gradient 计算放在一起处理。这个区段说明神经网络并不只是 层很多的函数,而是一个把输入逐步变成不同表征,并把损失重新拆成每个参数的 gradient 信号的结构。
中段会处理学习循环、模型执行与学习的差异、优化器、正则化、GPU、batch、tensor 计算。这个区段解释的不只是模型结构,还包括 学习在现实中怎样变得可能,并扩展到更大的计算。
接着会把表征学习重新立为结构分叉的入口。只有先区分人直接制作特征和模型学习表征的方式,CNN、RNN、Attention、Transformer 才会被读成回答不同数据结构问题的设计,而不是单纯的模型名称。
后半段会处理 CNN、RNN、LSTM、GRU、Attention、Transformer、生成与采样。这个区段存在的意义,是在进入下一 Part 之前先显示出 为什么在 LLM 之前必须先经历这样的结构转折。
特别是 Chapter 11 到 Chapter 15,与其读成 模型名称介绍,不如更准确地读成 究竟是什么数据结构问题让这种设计出现了。
| Chapter | 先抓住的数据结构问题 | 当前 Part 必须闭合的核心 |
|---|---|---|
| Chapter 11 CNN | 图像里相近位置会一起构成意义的问题 | 一个反复读取并汇总局部模式的结构 |
| Chapter 12 RNN / LSTM / GRU | 顺序数据里前面的状态必须留到后面判断的问题 | 一个承接状态并更好保留长期记忆的结构 |
| Chapter 13 Attention / self-attention | 远处线索必须在当前计算里重新参考的问题 | 从状态传递转向关系重参照的结构转折 |
| Chapter 14 Transformer | 必须同时推进并行计算与长上下文重参照的问题 | 把 self-attention、feed-forward、稳定化绑在一起的重复块结构 |
| Chapter 15 生成/采样 | 超越标签选择、需要制造新输出并挑选实际候选的问题 | 生成分布与采样选择共同决定质量这一点 |
为什么需要这一 Part¶
重新学习深度学习时,最常见的混乱是 模型结构、学习过程、计算环境 会在同一句话里混在一起。
例如,如果分不清一次性能提升到底是因为:
- 使用了更深的结构
- activation 或 loss 设计变了
- optimizer 或 regularization 更稳定
- 因为 GPU 与并行处理所以能做更大的实验
那么最后理解到的就不是深度学习,而只是术语列表。
Part 5 正是为了减少这种混乱而建立共同结构。只有在这里先把计算结构和学习结构分开看到,下一 Part 再遇到 Transformer 与 LLM 时,才更容易读出 为什么这种结构会连到生成。
同时,一旦理解了这个结构,后面的 Part 里你也会更清楚哪些问题是输入表征问题,哪些是生成结果比较问题,哪些是依据解释与评估问题。
完成这一 Part 后会留下的理解¶
完成这一 Part 之后,你应该把深度学习看成一个由输入变换、误差计算、学习调整、结构分叉、生成连接串起来的结构。
输入通过线性组合与非线性变换被改变的过程、损失把误差变成数字的过程、反向传播与自动微分把这个损失变成每个参数的 gradient 信号的过程、优化器与正则化调整学习的过程、CNN/RNN/Attention/Transformer 回答不同结构问题的过程、生成与采样通向下一 Part 生成式 AI 的过程,都应该在同一条流程里变得可见。
一旦形成这种理解,就能摆脱 深度学习就是把神经网络叠得更深 这种表面说法,也能减少 只要懂 Transformer 就够了 这样的误解。Part 5 是真正执行深度学习正文解释、并把后面各 Part 托起来的那个 Part。
完成标准¶
- 能解释感知机、多层神经网络、隐藏层之间的关系。
- 能解释为什么激活函数、输出层、损失函数必须一起读。
- 能说出损失怎样变成每个参数的 gradient 信号,以及反向传播和自动微分怎样承担这个计算。
- 能解释学习与模型执行的差别。
- 能解释优化器与正则化想解决什么问题。
- 能说出 CNN、RNN、Attention、Transformer 是在什么结构问题里出现的。
- 能解释生成模型与采样的基本直觉。
检查清单¶
- 你现在读这一 Part,是把它当成
深度学习名称介绍,还是当成闭合结构问题、学习过程、生成连接的 Part? - 你能不能把 CNN、RNN、Attention、Transformer 都解释成
它们是在什么数据结构问题上出现的答案? - 你能不能区分,交给 Part 6 的不是
当前 Part 没解释完的缺口,而是建立在这些结构之上的下一层?
来源与参考资料¶
这个概览页是整理 Part 5 目的与学习路径的内部概览,不直接引用外部资料。