跳转至

Part 5. 深度学习

Section ID: P5-index Version: v2026.07.20

Part 5 是正式解释神经网络与深度学习的 Part。Part 1、Part 2、Part 4 已经多次预告了感知机、表征学习、反向传播、优化器、卷积神经网络(CNN)、循环神经网络(RNN)、注意力(Attention)、Transformer 等主题,但那时的角色主要是先画出地形图并补回基础。到了 Part 5,这些解释不再往后推。从这里开始,必须真正回收 为什么需要这样的结构它是怎样被训练的什么差异让模型结构分叉开来

这个 Part 的核心目的,是让读者能够把深度学习解释成计算结构与学习结构,而不是黑箱名字。很多读者已经多次听过神经网络、CNN、Transformer 这些名称,但往往还不能把 输入怎样变成表征误差怎样被重新传回去为什么 GPU 和 batch 重要为什么注意力成为结构转折点 串成一条完整的说明。

所以 Part 5 会沿着下面六条轴线真正回收这些解释。

  1. 神经网络的基本计算结构
  2. 输出与损失信号
  3. 学习循环与稳定化
  4. 计算扩展
  5. 表征学习与结构分叉
  6. 生成模型与采样

如果把这个顺序像学习地图一样一次压缩,可以写成下面这样。

flowchart TD
  subgraph A["神经网络基础"]
    A1["感知机与多层结构"] --> A2["激活、输出、损失"]
    A2 --> A3["反向传播"]
  end

  subgraph B["训练与规模"]
    B1["优化器与正则化"] --> B2["批量、张量、GPU"]
    B2 --> B3["表征学习"]
  end

  subgraph C["结构分叉"]
    C1["CNN 处理局部模式"] --> C2["RNN 处理序列状态"]
    C2 --> C3["注意力与自注意力"]
    C3 --> C4["Transformer 模块"]
    C4 --> C5["生成与采样"]
  end

  A3 --> B1
  B3 --> C1

也就是说,Part 5 是一个逐步把抓手从 基本计算结构 -> 输出与损失 -> 学习循环 -> 计算扩展 -> 结构分叉 -> 生成 移过去的 Part。

换句话说,Part 5 是第一个真正解释 Part 1 到 Part 4 中那些以 后面再解释 留下来的深度学习核心概念的 Part。如果这里的解释偏弱,下一 Part 关于 LLM 和生成式 AI 的内容也会再次滑回表面的术语介绍。

Part 5 不能被读成 深度学习预告片。因此,默认原则是让 CNN、RNN、Attention、Transformer 各自在这个 Part 内先闭合 为什么在这种数据结构问题上会出现这样的设计,而与 Part 6 的连接只保留为一个很短的下一步提示。

如果在读这一 Part 时核心术语的基线又开始变模糊,默认参考点是回到概念词汇表,把各个词条的 Core SectionAppears In 一起看,沿着那个复习路径重新接回去。

如果把这个标准按当前 Part 5 目录再压成一行,可以得到下面这个表。

当前 Part 5 先闭合的内容 交给 Part 6 的内容
感知机、损失、反向传播、优化器(optimizer)、正则化(regularization)、CNN、RNN、Attention、Transformer、生成与采样的基本结构与角色 分词(tokenization)、预训练(pretraining)、指令微调(instruction tuning)、检索增强生成(RAG)、工具使用(tool use)、agent、服务运营

这个 Part 也会预先准备好在 Part 6 以及更后面的 Part 里再次出现的解释对象。

  • 表征学习之后会继续连到 token、上下文窗口、embedding 的解释。
  • 生成与采样之后会继续连到生成结果比较与 decoding 判断。
  • Attention 与 Transformer 之后会继续连到检索结合、依据选择与评估结构解释。
  • 学习过程与稳定化之后会继续连到质量判断、失败分析与运营评估的阅读。

同时,很重要的一点是不要太早只用一句话把这些连接匆匆带过去。Part 5 后半段不是背 RNN 之后是 attention,再之后是 Transformer 的顺序,而是抓住这样一种把手变化:把顺序状态往后传的结构 -> 重新看回所需位置的结构 -> 把这种参照计算打包成可重复并行块的结构 -> 从候选分布里选出实际输出的问题。只有先抓住这种缓慢的转变感觉,后半段才会作为结构变化流程留下来,而不是变成模型名字罗列。

如果只把后半段的转变再压成最短形式,就是下面这样。

后半段先变化的抓手 这一阶段要抓住的问题
顺序状态 先前状态怎样被带到当前判断里?
直接参照 现在能不能重新看回所需的前面位置?
并行块 为什么要把这种参照计算打包成可重复的块结构?
生成候选选择 怎样从算出的分布里选出真实输出?

这一 Part 的目的

这个 Part 是为了从 表征学习结构学习过程模型结构分叉 三个层次重新理解深度学习的区段。

前面的 Part 已经多次预告,表征学习、反向传播与优化器、CNN/RNN/Transformer 结构会在后面重新回来。

Part 5 的责任,就是兑现这个承诺。所以这个 Part 不能停在 神经网络也是重要技术 这样的程度,至少必须真正解释下面这些问题。

  • 单个感知机与多层神经网络有什么不同?
  • 如果没有激活函数,为什么深度会失去意义?
  • 损失与反向传播究竟在计算什么?
  • SGD 与 Adam 有什么不同?
  • 正则化与 dropout 试图阻止什么?
  • CNN、RNN、Attention、Transformer 各自想解决什么样的数据结构问题?
  • 为什么生成模型与采样会连到下一 Part 的生成式 AI?

当前阅读原则

Part 5 依照下面这些原则来读会更稳定。

原则 含义
先闭合结构 每一章都应当在当前章内结束 问题是什么、什么计算结构给出了回答
把学习过程单独分开 loss、gradient、optimizer、regularization 不与结构名称混读,而是放在学习过程这一轴上。
与 Part 6 的连接只留得很短 可以说明 为什么需要下一 Part,但不要把当前章的关键解释往后推。

这里很重要的是不要把下面两条轴混在一起。

当前阅读的轴 代表问题 这一 Part 的代表项目
结构问题 应该怎样表示这种输入结构? 感知机、CNN、RNN、Attention、Transformer、生成结构
学习过程问题 怎样把这个结构稳定地训练起来? 损失、gradient 计算、反向传播、自动微分、优化器、正则化、dropout、batch

在 Part 5 前半段,尤其先固定下面这个连接标准。

先读的结构轴 紧接着要问的问题 下一步转过去的学习过程轴
感知机与多层结构 输入怎样变成中间表征? 损失、反向传播、优化器怎样修正这个结构?
激活函数 为什么深度会从单纯的线性重复变成有意义的表征扩展? 学习稳定化、初始化、正则化
CNN / RNN / Attention / Transformer 是什么数据结构问题让设计分叉开来? 各种结构在实际中怎样被稳定训练

只有抓住这个区分,才能把 是因为 CNN 更好所以性能提升了是因为换了优化器让学习更稳定所以性能提升了 分开来读。

这个区分也可以先固定成下面三行。

阅读深度学习的最小顺序 为什么这个顺序要先来
先看结构 只有先知道它想解决什么输入结构问题,模型名才不会那么混乱。
从损失过渡到 gradient 损失数值必须变成每个参数的修正信号,学习才会真正继续。
最后看优化器和正则化 这样才能把性能差异分开读成结构原因还是学习稳定化原因。

这一 Part 解释什么,不解释什么

Part 5 是真正执行深度学习正文解释的 Part。因此,下面这些内容会在正文范围内解释。

  • 感知机、多层结构、激活函数、输出层、损失、gradient 计算、反向传播、自动微分之间的连接
  • 优化器(optimizer)、正则化(regularization)、dropout、训练/评估模式(training/eval mode)等学习过程与稳定化感
  • 为什么 GPU、batch、tensor 计算要和深度学习扩散一起读
  • 为什么表征学习会成为 CNN、RNN、Attention、Transformer 等结构分叉的入口
  • CNN、RNN、LSTM、GRU、Attention、Transformer、生成与采样的结构位置

Part 5 的责任,是把 为什么需要这些结构和过程 连接起来说明。因此,这个 Part 的开始页会先展示正文要回收的几条轴线:结构损失与 gradient学习稳定化计算扩展表征学习与结构分叉生成与采样。各章则会沿着这条流程,在 Section 单位重新闭合结构说明和学习过程说明。

这一 Part 的目标

读完 Part 5 之后,目标是形成大致如下层级的理解。

  • 能解释感知机、多层神经网络、隐藏层(hidden layer)之间的关系。
  • 能把激活函数(activation function)、输出层(output layer)、损失函数(loss function)的作用连起来解释。
  • 能说明反向传播(backpropagation)与自动微分(automatic differentiation)怎样把损失变成每个参数的 gradient 信号。
  • 能把学习(learning)与模型执行(inference)的差别说成计算阶段与更新阶段的差别。
  • 能解释 SGD、Adam 这类优化器为什么会有不同的更新手感。
  • 能解释正则化(regularization)、dropout、泛化(generalization)之间的关系。
  • 能说明 GPU、batch、tensor 计算为什么和深度学习扩散直接相关。
  • 能解释 CNN、RNN、LSTM、GRU、Attention、Transformer 分别是在什么输入结构与依赖性问题上出现的。
  • 能解释生成模型(generative model)与采样(sampling)的基本直觉。

从为后续 Part 5 做准备的角度,这些目标也可以重新读成下面这些问题。

在 Part 5 需要理解的结构 下一 Part 会再次读到的问题
表征学习 为什么输入会再次被读成 token 与 embedding 表征?
生成与采样 为什么 next-token prediction 与 decoding 会变得重要?
Attention 与 Transformer 为什么它们会成为长上下文与生成服务的基础?
学习稳定化与泛化 为什么评估与运营判断要分开带走?

这一 Part 必须真正回收的前文预告

Part 5 必须真正补上前面各 Part 延后的解释。尤其下面这些项目,不能只是 名字再次出现,而必须在这里有正文解释。

前面 Part 延后的主题 这个 Part 里必须真正解释的内容
表征学习 人工写特征与模型直接学习表征之间的差别
损失函数与优化 为什么需要损失,以及梯度(gradient)与优化器(optimizer)怎样连接
反向传播与自动微分 从损失出发的 gradient 怎样沿着计算记录组织成每个参数的信号
CNN、RNN、Transformer 为什么模型设计会随着数据结构与依赖结构而分叉
GPU 与并行处理 为什么深度学习扩散不能和计算资源分开看
生成与采样 分类式输出与生成式输出的差别,以及通向下一 Part 的起点

如果这个标准缺失,Part 5 就会再次变弱成 深度学习关键词列表

面向入门读者的阅读标准

这个 Part 是第一次让计算结构说明密度明显升高的区段。与其一下子抓住所有公式和实现细节,不如先用下面三个问题来读,会更稳定。

先抓住的问题 为什么需要这个问题 在这一 Part 抓到什么程度就够
现在解释的是 改变表征的结构,还是 调整学习的过程 隐藏层、激活函数、CNN 是结构,损失、梯度、优化器是学习过程。 先把结构与学习过程分开读。
这个模型是为了 连接或记住什么 而设计的? CNN、RNN、Attention、Transformer 都是从不同的输入结构问题里出来的。 区分各结构更擅长图像、顺序还是长上下文。
现在的改进是因为 更深的表征,还是因为 更稳定的学习 深度学习说明里,结构改进与学习稳定化技巧经常混在一起。 把模型结构轴与优化器/正则化轴分开读。

这个流程最短可以整理成下面这样。

深度学习会叠加把输入变成更好表征的结构。损失与反向传播告诉这个结构该怎样修正,优化器与正则化让学习更稳定。CNN、RNN、Attention、Transformer 则是为了回答不同的数据结构问题而出现的。

它解释什么

Part 5 大体可以读成 神经网络基本计算学习过程与稳定化主要深度学习结构 三个捆绑。

首先在前半段,会把感知机、多层结构、激活函数、输出层、损失函数与 gradient 计算放在一起处理。这个区段说明神经网络并不只是 层很多的函数,而是一个把输入逐步变成不同表征,并把损失重新拆成每个参数的 gradient 信号的结构。

中段会处理学习循环、模型执行与学习的差异、优化器、正则化、GPU、batch、tensor 计算。这个区段解释的不只是模型结构,还包括 学习在现实中怎样变得可能,并扩展到更大的计算

接着会把表征学习重新立为结构分叉的入口。只有先区分人直接制作特征和模型学习表征的方式,CNN、RNN、Attention、Transformer 才会被读成回答不同数据结构问题的设计,而不是单纯的模型名称。

后半段会处理 CNN、RNN、LSTM、GRU、Attention、Transformer、生成与采样。这个区段存在的意义,是在进入下一 Part 之前先显示出 为什么在 LLM 之前必须先经历这样的结构转折

特别是 Chapter 11 到 Chapter 15,与其读成 模型名称介绍,不如更准确地读成 究竟是什么数据结构问题让这种设计出现了

Chapter 先抓住的数据结构问题 当前 Part 必须闭合的核心
Chapter 11 CNN 图像里相近位置会一起构成意义的问题 一个反复读取并汇总局部模式的结构
Chapter 12 RNN / LSTM / GRU 顺序数据里前面的状态必须留到后面判断的问题 一个承接状态并更好保留长期记忆的结构
Chapter 13 Attention / self-attention 远处线索必须在当前计算里重新参考的问题 从状态传递转向关系重参照的结构转折
Chapter 14 Transformer 必须同时推进并行计算与长上下文重参照的问题 把 self-attention、feed-forward、稳定化绑在一起的重复块结构
Chapter 15 生成/采样 超越标签选择、需要制造新输出并挑选实际候选的问题 生成分布与采样选择共同决定质量这一点

为什么需要这一 Part

重新学习深度学习时,最常见的混乱是 模型结构学习过程计算环境 会在同一句话里混在一起。

例如,如果分不清一次性能提升到底是因为:

  • 使用了更深的结构
  • activation 或 loss 设计变了
  • optimizer 或 regularization 更稳定
  • 因为 GPU 与并行处理所以能做更大的实验

那么最后理解到的就不是深度学习,而只是术语列表。

Part 5 正是为了减少这种混乱而建立共同结构。只有在这里先把计算结构和学习结构分开看到,下一 Part 再遇到 Transformer 与 LLM 时,才更容易读出 为什么这种结构会连到生成

同时,一旦理解了这个结构,后面的 Part 里你也会更清楚哪些问题是输入表征问题,哪些是生成结果比较问题,哪些是依据解释与评估问题。

完成这一 Part 后会留下的理解

完成这一 Part 之后,你应该把深度学习看成一个由输入变换、误差计算、学习调整、结构分叉、生成连接串起来的结构。

输入通过线性组合与非线性变换被改变的过程、损失把误差变成数字的过程、反向传播与自动微分把这个损失变成每个参数的 gradient 信号的过程、优化器与正则化调整学习的过程、CNN/RNN/Attention/Transformer 回答不同结构问题的过程、生成与采样通向下一 Part 生成式 AI 的过程,都应该在同一条流程里变得可见。

一旦形成这种理解,就能摆脱 深度学习就是把神经网络叠得更深 这种表面说法,也能减少 只要懂 Transformer 就够了 这样的误解。Part 5 是真正执行深度学习正文解释、并把后面各 Part 托起来的那个 Part。

完成标准

  • 能解释感知机、多层神经网络、隐藏层之间的关系。
  • 能解释为什么激活函数、输出层、损失函数必须一起读。
  • 能说出损失怎样变成每个参数的 gradient 信号,以及反向传播和自动微分怎样承担这个计算。
  • 能解释学习与模型执行的差别。
  • 能解释优化器与正则化想解决什么问题。
  • 能说出 CNN、RNN、Attention、Transformer 是在什么结构问题里出现的。
  • 能解释生成模型与采样的基本直觉。

检查清单

  • 你现在读这一 Part,是把它当成 深度学习名称介绍,还是当成闭合 结构问题、学习过程、生成连接 的 Part?
  • 你能不能把 CNN、RNN、Attention、Transformer 都解释成 它们是在什么数据结构问题上出现的答案
  • 你能不能区分,交给 Part 6 的不是 当前 Part 没解释完的缺口,而是 建立在这些结构之上的下一层

来源与参考资料

这个概览页是整理 Part 5 目的与学习路径的内部概览,不直接引用外部资料。