跳转至

Part 5 收尾:深度学习整理

Section ID: P5-summary Version: v2026.07.20

Part 5 是这样一个区段:它真正解释了在机器学习共同问题之上,更大的函数家族 神经网络(neural network) 是怎样被堆起来的。如果说 Part 4 以数据切分、泛化、评估为中心建立了阅读模型的标准,那么 Part 5 则是在保持这个标准的同时,必须回收 学习更深表征的结构真正把这个结构训练起来的过程

这个 Part 的核心,不是把深度学习背成单纯 层很多的模型,而是把它读成一个重复结构:输入经由权重(weight)与激活函数(activation function)逐步变成不同表征,再通过损失(loss)与反向传播(backpropagation)去调整这些表征。

换句话说,Part 5 是第一个必须真正解释 Part 1 到 Part 4 中那些以 后面再解释 留下来的感知机、表征学习、损失函数、反向传播、优化器(optimizer)、卷积神经网络(CNN)、Transformer 的正文 Part。

这个核心可以重新压成下面三行。

先留下来的阅读顺序 为什么这个顺序重要
先看结构 只有先知道它在解决什么输入结构问题,模型名才没那么容易混。
从损失过渡到 gradient 损失数值必须变成每个参数的修正信号,学习才会显出来。
最后看优化器和正则化 这样才能把性能差异分开读成结构原因还是学习稳定化原因。

这里一个重要原则是,不要把 Part 5 结束成 下一 Part 的预告片。CNN、RNN、Attention、Transformer 都会连到后面的 LLM 说明,但这种连接必须遵守 先闭合当前结构,再在下一 Part 里扩展到别的问题,而不是把解释推成 后面再看

复习时,与其只重读这个总结页就停下来,不如在术语开始模糊的地方回到概念词汇表,把对应词条和它指向的 Core Section 一起再看一遍,会更稳定。

重新整理 Part 5 的复习流程

这个文档按下面顺序来读,整体流程会更清楚。

  1. 先重新抓住 Part 5 整体是按什么大流程构成的。
  2. 再把必须记住的概念和容易误解的地方一起整理。
  3. 接着确认 Part 5 有意没有在这里收掉的问题是什么。
  4. 最后再连接这些问题怎样在下一 Part 里重新打开。

这一 Part 走过的核心流程

Part 5 的流程可以整理如下。

  1. 先看感知机与多层神经网络。
  2. 再把激活函数、输出层、损失连起来。
  3. 再看从损失走向 gradient 的反向传播与自动微分。
  4. 再看学习与模型执行的区分。
  5. 再看优化器、正则化、dropout。
  6. 再看 GPU、batch、tensor 计算。
  7. 再把表征学习读成结构分叉的入口。
  8. 再看 CNN、RNN、LSTM、GRU。
  9. 再看 Attention 与 self-attention。
  10. 再看 Transformer。
  11. 再看生成模型与采样。
  12. 最后整理它如何连到下一 Part 的 LLM 与生成式 AI。

如果把这个流程压成一句话,就是下面这样。

深度学习不是背下一个大函数的技术,而是一种把数据不断变成更合适表征、再把这个过程的误差送回去调整的学习体系。

在 Part 5 里,这个结构会立刻重新连到下面这些问题。

在 Part 5 抓住的结构感觉 下一 Part 会再次读到的问题
把输入变成表征 句子会被切成什么 token 单位?
把损失变成 gradient 来调整 为什么 next-token prediction 会连到可学习的生成问题?
Attention 与 Transformer 处理上下文 为什么长上下文和生成服务会成为可能?
生成与采样会改变结果 为什么回答质量与服务质量要一起看?

如果把这整个流程像复习地图一样再压成最短形式,可以写成下面这样。

flowchart TD
  A["把输入变成更好的表征"]
  B["用损失衡量误差"]
  C["把调整信号向后传回"]
  D["用优化器与正则化稳定学习"]
  E["分叉到 CNN、RNN、注意力、Transformer"]
  F["把模型输出变成生成结果"]

  A --> B
  B --> C
  C --> D
  D --> E
  E --> F

也就是说,说自己学完了 Part 5,意味着 改变表征的结构调整误差的过程按数据结构分叉选择生成输出 已经能够连成一条线。

按当前目录来看,这个流程更自然的重读方式是 神经网络的基本计算结构 -> 输出与损失信号 -> 学习循环与稳定化 -> 计算扩展 -> 表征学习与结构分叉 -> 生成模型与采样

这时,把后半段再慢一点重新捆一次也很有帮助。Chapter 12 到 Chapter 15 是一个抓手变化过程:先从 顺序状态怎样被带过去,再到 能不能现在重新看回所需位置,再到 为什么把这种参照计算做成并行块重复,最后到 怎样从得到的候选里选出真实输出。只有先抓住这个把手,RNN -> attention -> Transformer -> 生成 才不会被读成快速更换模型名字,而会被读成结构想法一步步变化的流程。

如果只把后半段转变再压一次,就会变成下面这样。

后半段结构流程 要抓住的核心问题
顺序状态 前面的状态能不能稳定带到当前判断里?
直接参照 需要的位置现在能不能重新看回去?
并行块 为什么必须把这种参照计算捆成可重复的块结构?
生成候选选择 怎样从算出的分布里挑出真实输出?

在这个收尾页里,尤其重要的是不要把 Part 5 结束成 看了很多结构名字的 Part,而要把它重新绑成 表征学习 -> 结构分叉 -> 生成基础 的一条流。只有这样,读者才能解释的不是 我已经知道 Transformer 了,而是 为什么这个结构会成为生成式语言模型的基础

如果把后半段几个结构章再压成最短形式,就是下面这个表。

结构章 比起名字更先读的问题
卷积神经网络(CNN) 为什么图像里局部模式会先变得重要?
循环神经网络(RNN)/ 长短期记忆(LSTM)/ 门控循环单元(GRU) 为什么顺序与累计状态会改变当前判断?
注意力(Attention)/ 自注意力(self-attention) 为什么远处线索必须现在重新参照?
Transformer 为什么关系计算必须捆成并行块结构?
生成 / 采样 为什么在生成分布之后还要单独选择实际输出?

必须记住的概念

经过 Part 5 之后,最该长久留下来的概念如下。

区分 要记住的视角
感知机 它是在输入与权重的线性组合之上放上判断结构的最小起点。
隐藏层 中间层不只是计算步骤,而是把输入变成不同表征的位置。
激活函数 如果没有非线性,就算堆深,表达能力增长也会受限。
输出层与损失 输出的解释方式与损失函数必须一起按问题类型选择。
反向传播与自动微分 反向传播是从损失出发向后计算 gradient 的过程,自动微分是根据顺向计算记录自动组织这个计算的技术。
优化器 即使目标都是减小损失,实际更新规则也可以不同。
正则化 好的学习不是只在训练中越拟合越好,而是让模型在没见过的数据上也不容易垮掉。
GPU 与 batch 深度学习的扩散不只是好想法,也和并行计算环境一起发生。
表征学习 深度学习转折点的核心,在于让模型自己学习特征,而不是由人手写特征。
CNN / RNN / Attention 随着数据类型与依赖结构不同,有利的模型设计也发生了变化。
Transformer self-attention 与并行结构成为了 LLM 时代的基础。
生成与采样 生成式 AI 会直接生成输出,而实际结果会受采样策略影响。

把这些概念再重新捆时,按两条轴分开会更不容易乱。

先分开的轴 这里放什么 为什么要分开读
结构 感知机、隐藏层、CNN、RNN、Attention、Transformer、生成结构 它说明输入会被变成什么形式,以及在处理什么依赖。
学习过程 损失、gradient 计算、反向传播、自动微分、优化器、正则化、dropout、batch 它说明即使是同一种结构,学习稳定性、泛化、计算成本也会不同。

也就是说,在 Part 5 里,重要的是养成把 用了什么结构怎样把这个结构训练起来 分开读的习惯。

容易误解的地方

在 Part 5 里尤其要小心下面这些误解。

  • 深度学习并不是 和机器学习完全不同的东西,而是机器学习中扩展成更大表征学习结构的一条支流。
  • 层更多并不会自动让模型更好。
  • 不能因为损失降了,就马上断定实际质量也变好了。
  • 反向传播不是整个学习过程的名字,而是 gradient 计算过程;自动微分则用代码执行记录把这个过程自动化。
  • GPU 不只是加速装置,而是影响了深度学习研究方向本身的计算环境。
  • 有了 Attention 并不代表 RNN 家族完全失去意义。更准确地说,是大语言模型的主流结构改变了。
  • 理解了 Transformer,并不等于已经理解了整个 LLM。下一 Part 还要一起看 token、pretraining、alignment、工具连接。
  • 如果生成结果很奇怪,只解读成 模型不知道 还不够。采样方式、上下文长度、输入结构也要一起看。
  • 如果 Part 5 只是介绍结构名字然后匆匆带过,下一 Part 的 LLM 说明也会再次弱成表面术语介绍。

这一 Part 不在这里结束的问题

Part 5 把重点放在解释深度学习的结构与学习过程上,因此下面这些问题被有意交给下一 Part。

  • 真实服务里输入句子会被切成什么 token 单位?
  • 为什么 Transformer 会连到长对话、摘要、代码生成这类用户体验?
  • 在服务层面,怎样补强生成结果的质量与依据?

换句话说,Part 5 是闭合 结构基础 的 Part,而不是在这里把 LLM 的整体服务体验一次说完的 Part。

也就是说,Part 5 最后的问题不能停在 有哪些结构,而必须走向 这些结构怎样连到真实生成式 AI 服务体验

如果把这个转变压到最短,可以写成下面这样。

  • Part 5 解释 为什么需要这样的计算结构
  • 下一 Part 解释 为什么这些结构会连到真实的生成式 AI 理解与使用

进入下一 Part 前要确认的问题

在进入 Part 6 之前,你应当能回答下面这些问题。

  • 能解释感知机、多层神经网络、隐藏层之间的关系吗?
  • 能说明为什么需要激活函数吗?
  • 能说明输出层与损失函数为什么会和问题类型连在一起吗?
  • 能说明损失怎样变成每个参数的 gradient 信号,以及反向传播与自动微分各自承担什么角色吗?
  • 能说明优化器与学习率怎样影响学习稳定性吗?
  • 能说明正则化与 dropout 怎样和过拟合连在一起吗?
  • 能说明为什么 GPU、batch、tensor 计算会和深度学习扩散连在一起吗?
  • 能说明 CNN、RNN、Attention、Transformer 分别是在什么数据结构或问题上出现的吗?
  • 能说明生成模型与分类模型的差别吗?
  • 能说明采样会影响生成质量与多样性吗?

Part 5 收尾

经过 Part 5 之后,你不该再只把深度学习看成 有很多权重的复杂黑箱。输入变成表征、损失被计算、误差被重新传回去、并行计算资源支撑整个过程、Attention 与 Transformer 打开长上下文与生成问题,这条大流程应该已经开始成形。

只有抓住了这条流程,下一 Part 才不会只把 LLM 当成知名产品名称或 API 调用对象,而能解释它们是建立在什么输入单位与计算结构之上的。

这也正是 Part 5 的目的。

在这里最后还要再固定一点:说自己完成了 Part 5,并不意味着 看过很多深度学习术语,而是意味着 能说出什么结构问题出现了什么计算答案

完成 Part 5 时应该留下的东西 仍然交给下一 Part 的东西
能解释从感知机到 Transformer 的结构分叉原因 分词、预训练、检索结合、工具连接、运营细节
能把损失、gradient 计算、反向传播、自动微分、优化器、正则化与结构分开说明 服务设置、推理成本、长上下文运营优化
能把生成模型与采样解释成 分布学习输出选择 LLM 产品体验与服务设计判断

检查清单

  • 经过 Part 5 之后,你有没有形成把 结构学习过程 分开读的习惯?
  • 你能不能把 Transformer 不只解释成知名结构,而是解释成 把关系计算捆成并行块的结构
  • 你能不能把生成与采样解释成不是 下一 Part 才新出现的话题,而是 在这里已经闭合结构起点的话题

来源与参考资料

这个文档是对 Part 5 全体内容的内部总结,不直接引用外部资料。