P1-9.1 图像识别与表征学习¶
Section ID:
P1-9.1Version:v2026.07.20
第 8 章已经按学习信号的差异区分了 supervised learning、unsupervised learning 和 reinforcement learning。现在开始转向 deep learning。
这里并不打算解释整个深度学习,而是借 image recognition 这个具体案例,说明为什么深度学习常被理解成:从“由人把特征全部设计好”转向“由模型连同内部表征一起学习”。
这里的核心问题是:
当我们在做图像分类时,
“人自己写出特征”的方法,
和“模型自己学到表征”的方法,究竟有什么不同?深度学习的重要变化之一,是模型不只拟合最终输出,
它还会学习让输入更容易处理的内部表征。
这一节会把 image recognition、hand-crafted features、learned representation、CNN 和 AlexNet 放在一起,说明为什么深度学习常被视为图像问题上的一个转折点。representation 的基础直觉已经在 3.3 和 4.3 出现过,supervised learning 的基本结构则已经在 8.1 里出现过。
这些词一开始都很像“深度学习历史名词”。先做一个快速区分:
| 术语 | 极短含义 | 本节里的作用 |
|---|---|---|
| image recognition | 预测图像里有什么 | Chapter 9 的第一个案例 |
| hand-crafted features | 人预先设计好的线索 | 深度学习之前的基准做法 |
| learned representation | 模型从数据里学到的内部表征 | 深度学习转向的核心 |
| CNN | 分层处理图像局部模式的神经网络结构 | 图像识别里的代表结构 |
| AlexNet | 把大数据、GPU 和深层 CNN 结合起来的转折案例 | 深度学习扩散的标志性事件 |
最少要保留的区分是:hand-crafted features 和 learned representation 不是一回事,CNN 是面向图像的重要结构,AlexNet 是扩散转折点,而不是绝对起点。
这一节不会用公式解释 convolutional neural network。convolution、pooling、activation function、backpropagation 和 optimizer 都会在 Part 5 再展开。
这里也不会把 AlexNet 写成“所有深度学习的起点”。神经网络和 CNN 的研究在它之前已经持续了很久。这里更安全的定位是:AlexNet 是 2010 年代深度学习扩散中的代表性转折点。
这里也不会从头重新定义 representation。本节真正聚焦的是这个对比:
表征应该由人手工设计,
还是由模型从数据中学出来?
还需要再把时间线分清一次。神经网络并不是到 2010 年代才突然出现的;2006 年前后,deep belief network 和 representation learning 的研究让深度学习重新受到关注。因此,2012 年的 AlexNet 更准确的读法不是“从无到有的突然事件”,而是:更早的神经网络研究与 2006 年前后的复兴趋势,在大规模数据和 GPU 计算的支持下,汇成了一个扩散拐点。
本节的工作定义是:在图像识别中,深度学习强烈展示了一条方向,与其只依赖人设计好的特征,不如让模型从数据里学习分层表征。
区分手工特征与学得表征的基准¶
- 把图像识别理解成“从输入图像预测类别”的问题。
- 说明 hand-crafted features 和 learned representations 的区别。
- 在入门层面理解 CNN 为什么会分层处理图像的局部模式。
- 把 AlexNet 读成“大数据、GPU、深层 CNN 和表征学习结合起来”的转折点。
- 避免把图像识别历史夸大成 LLM 的直接谱系。
三个基准¶
| 基准 | 为什么重要 | 本节需要达到的理解程度 |
|---|---|---|
| 图像分类对人看起来容易,但很难写成固定规则 | 这能说明为什么深度学习会变得重要。 | 理解光照、视角和遮挡会让规则很脆弱就够了。 |
| hand-crafted features 和 learned representations 是两种不同思路 | 这能用一句话抓住深度学习的核心转向。 | 理解过去是人选线索,后来是模型连同表征一起学即可。 |
| AlexNet 更适合被读成“扩散的转折点”,而不是“绝对最初起点” | 这能保住历史重要性,又不至于夸大。 | 理解它是 adoption 上的代表拐点即可。 |
图像识别对人容易,对规则却很难¶
人看到一张图片,往往很快就能说出“猫”“汽车”“人脸”之类的判断。但一旦试图把这种判断写成明确规则,问题就会立刻变难。
假设我们试图写出“识别猫”的规则:
有尖耳朵,可能是猫。
看见胡须,可能是猫。
有两只眼睛并且有毛,也可能是猫。
这些规则很快就会碰到例外:
| 变化 | 为什么规则会变难 |
|---|---|
| 光照变化 | 同一个物体的亮度和颜色都可能变化 |
| 姿态变化 | 耳朵、眼睛、腿的位置会变化 |
| 背景变化 | 背景可能比目标本身更显眼 |
| 遮挡 | 物体可能只露出一部分 |
| 同类内部的多样性 | 猫的品种、体型和毛色差异很大 |
3.1 里的人脸识别例子也和这个问题直接相连。相关综述提到,较早的方法包括基于几何特征、整体方法、hand-crafted features 和 hybrid 方法。这些都是重要研究路线,但在光照、姿态、表情、年龄和遮挡都不受控的场景下,人们需要更强的方法。
所以,图像识别的核心困难并不只是“该选哪个分类器”,而是更早的一个问题:
到底该从图像里看什么?
也就是说,feature 和 representation 的问题,先于分类问题本身。
hand-crafted features 由人先决定看什么线索¶
hand-crafted features 指的是:由人先决定模型应该看哪些线索。例如:
| 问题 | 人可能设计的特征 |
|---|---|
| 人脸检测 | 两眼之间距离、鼻子位置、脸部轮廓 |
| 车道检测 | 线条方向、亮度变化、边界边缘 |
| 物体分类 | 边缘、纹理、颜色直方图 |
| 文字识别 | 笔画方向、曲线、交叉点 |
这种方法并不是没有价值。它的优点是比较容易解释,而且在数据量较小、环境较稳定的问题里仍然可能有效。
但当变化变多时,人就很难把所有有用线索都手工设计出来:
哪些边缘真正重要?
哪些纹理还算是同一个物体?
光照变化以后还能不能算同一类?
换了背景后还能否继续归在同一个类别?
这些问题会把讨论重新带回 3.3 和 4.3 里出现过的 representation:好的表征应该突出对分类重要的差异,同时压低那些不重要的变化。
learned representation 是在模型内部形成的¶
representation learning 指的是:不仅学习最后的输出,也从数据中学习把原始输入转换成更适合处理的内部形式。Bengio、Courville 和 Vincent 的综述就指出,机器学习算法的成功在很大程度上依赖于数据表征。
对于图像来说,原始输入是 pixel。但单靠像素值,并不会直接把“猫”“汽车”“人脸”这种类别暴露出来。模型可能会在多层处理里,把低层线索逐渐变成更高层的表征。
像素
-> 线条与边缘
-> 纹理与局部部件
-> 物体部件
-> 类别判断
这并不表示模型内部真的总会自动分成完全可读的人类阶段。对入门阶段来说,更安全的理解是:
模型不是原样对原始图像分类,
而是经过多层计算,
形成有助于分类的内部表征。
LeCun、Bengio 和 Hinton 的 Nature 综述把深度学习解释成:由多个处理层组成、能够学习多层抽象表征的一类计算模型。它也指出,深度学习显著提升了语音识别、视觉物体识别和目标检测等领域的表现。
CNN 会分层处理图像的局部模式¶
CNN 是图像识别里最重要的神经网络结构之一。这里不看公式,只看直觉。
图像是有空间结构的。眼睛、鼻子、嘴巴、轮子、门把手之类线索,通常先出现在局部区域里。CNN 的结构特点就在于:它可以在不同位置反复探测这类局部模式,再在更高层里把它们组合成更大的模式。
flowchart LR
Pixels[像素]
Edges[轮廓与边缘]
Parts[局部形状]
Object[物体表征]
Class[分类结果]
Pixels --> Edges --> Parts --> Object --> Class
把汽车图像极度简化后,可以这样理解:
| 阶段 | 模型可能处理的线索 |
|---|---|
| 低层 | 线条、边角、亮度变化 |
| 中层 | 类似车轮的圆形结构、车窗样式 |
| 高层 | 与整辆车有关的部件组合 |
| 输出 | 汽车、公交车、卡车之类的类别分数 |
重要的是:人不必把“有轮子就可能是车”这样的规则全部显式写出来。模型会在大量带标签图像中,一起调整内部表征和参数。
为什么 AlexNet 会被反复提到¶
AlexNet 常常和 2012 年的 ImageNet 竞赛一起被提到,作为深度学习扩散的代表性案例。Krizhevsky、Sutskever 和 Hinton 的论文说明,他们训练了一个大的深层 CNN,去把大约 120 万张高分辨率图像分成 1000 个类别。论文还报告了约 6000 万参数、65 万个神经元、5 个卷积层和 3 个全连接层。
真正重要的不是这些数字本身,而是它们背后的组合:
| 元素 | 含义 |
|---|---|
| 大规模数据 | 大量带标签图像成为学习材料 |
| 深层 CNN | 图像表征可以被逐层转换 |
| GPU 实现 | 大矩阵计算与重复训练变得现实可行 |
| 正则化与数据增强 | 降低模型只贴住训练集的风险 |
这些并不是彼此独立的优点,而是互相咬合在一起的条件。没有大数据,深模型看不到足够多样的例子;没有深层 CNN,低层线索和高层表征就不容易在多层里被组合起来;没有 GPU,大模型的反复训练与比较会变得不现实;没有正则化和数据增强,大模型更容易过拟合。
所以,更安全的读法不是“出现了一个很强的 CNN”,而是:
大规模带标签数据
+ 深层 CNN 结构
+ GPU 计算
+ 减少过拟合的训练技术
= 一个让深度学习在图像识别里显著显现出来的转折点
AlexNet 论文也提到,模型是在两张 NVIDIA GTX 580 GPU 上训练 5 到 6 天,并指出更快的 GPU 和更大的数据集还能继续改进结果。这说明深度学习的崛起不只是“想法变了”,也是数据规模、模型结构、计算资源和训练方法共同变化的结果。
Nature 综述把 AlexNet 看成计算机视觉社区迅速接受深度学习的突破口之一。但这不该被读成“AlexNet 第一次发明了深度学习”。更安全的一句是:
AlexNet 是一个代表性的转折点,
它清楚地显示出深度学习在大规模图像识别中可以成为强有力选择。
图像识别不是 LLM 的直接谱系¶
这一节的目的不是写 LLM 的直接历史。image recognition、object detection 和 speech generation 都不是 LLM 的直接祖先。
但它们确实提供了一个重要背景:
对复杂输入来说,
人很难只靠规则和手工特征把一切都写清楚。
在大规模数据和计算资源存在时,
神经网络能够学到有用表征。
这种方法随后扩散到了图像、语音和语言等多个领域。
在这个背景上,后面的章节才会继续处理对象检测、语音生成,以及更直接通往语言模型的路线。这里最重要的是不要把“图像识别的成功”直接写成“LLM 的直接起源”。
检查清单¶
- 能把图像识别(
image recognition)说明成“从图像预测类别”的问题。 - 能区分
hand-crafted features和learned representation。 - 能说明 CNN 是一种分层处理图像局部模式的重要结构。
- 能把 AlexNet 解释成“大规模数据、深层 CNN、GPU 与训练技术结合起来”的转折点。
- 不会把图像识别历史夸大成 LLM 的直接谱系。
- 能对比“人手工设计特征”和“模型连同表征一起学习”的两种方式。
- 能把图像识别历史放在深度学习范式扩散的背景里,而不是写成 LLM 的直接谱系。
来源与参考资料¶
- Alex Krizhevsky, Ilya Sutskever, Geoffrey E. Hinton, ImageNet Classification with Deep Convolutional Neural Networks, NeurIPS, 2012, 确认日期:2026-06-23.
- Yann LeCun, Yoshua Bengio, Geoffrey Hinton, Deep learning, Nature 521, 436-444, 2015-05-27, 确认日期:2026-06-23.
- Geoffrey E. Hinton, Simon Osindero, Yee-Whye Teh, A Fast Learning Algorithm for Deep Belief Nets, Neural Computation 18(7), 1527-1554, 2006-07-01, 确认日期:2026-07-19.
- Yoshua Bengio, Aaron Courville, Pascal Vincent, Representation Learning: A Review and New Perspectives, arXiv, 2012-06-24, 确认日期:2026-06-23.
- Daniel Saez Trigueros, Li Meng, Margaret Hartnett, Face Recognition: From Traditional to Deep Learning Methods, arXiv, 2018, 确认日期:2026-06-23.