跳转至

P1-9.1 图像识别与表征学习

Section ID: P1-9.1 Version: v2026.07.20

第 8 章已经按学习信号的差异区分了 supervised learningunsupervised learningreinforcement learning。现在开始转向 deep learning

这里并不打算解释整个深度学习,而是借 image recognition 这个具体案例,说明为什么深度学习常被理解成:从“由人把特征全部设计好”转向“由模型连同内部表征一起学习”。

这里的核心问题是:

当我们在做图像分类时,
“人自己写出特征”的方法,
和“模型自己学到表征”的方法,究竟有什么不同?

深度学习的重要变化之一,是模型不只拟合最终输出,
它还会学习让输入更容易处理的内部表征。

这一节会把 image recognitionhand-crafted featureslearned representationCNNAlexNet 放在一起,说明为什么深度学习常被视为图像问题上的一个转折点。representation 的基础直觉已经在 3.3 和 4.3 出现过,supervised learning 的基本结构则已经在 8.1 里出现过。

这些词一开始都很像“深度学习历史名词”。先做一个快速区分:

术语 极短含义 本节里的作用
image recognition 预测图像里有什么 Chapter 9 的第一个案例
hand-crafted features 人预先设计好的线索 深度学习之前的基准做法
learned representation 模型从数据里学到的内部表征 深度学习转向的核心
CNN 分层处理图像局部模式的神经网络结构 图像识别里的代表结构
AlexNet 把大数据、GPU 和深层 CNN 结合起来的转折案例 深度学习扩散的标志性事件

最少要保留的区分是:hand-crafted featureslearned representation 不是一回事,CNN 是面向图像的重要结构,AlexNet 是扩散转折点,而不是绝对起点。

这一节不会用公式解释 convolutional neural network。convolutionpoolingactivation functionbackpropagationoptimizer 都会在 Part 5 再展开。

这里也不会把 AlexNet 写成“所有深度学习的起点”。神经网络和 CNN 的研究在它之前已经持续了很久。这里更安全的定位是:AlexNet 是 2010 年代深度学习扩散中的代表性转折点。

这里也不会从头重新定义 representation。本节真正聚焦的是这个对比:

表征应该由人手工设计,
还是由模型从数据中学出来?

还需要再把时间线分清一次。神经网络并不是到 2010 年代才突然出现的;2006 年前后,deep belief network 和 representation learning 的研究让深度学习重新受到关注。因此,2012 年的 AlexNet 更准确的读法不是“从无到有的突然事件”,而是:更早的神经网络研究与 2006 年前后的复兴趋势,在大规模数据和 GPU 计算的支持下,汇成了一个扩散拐点。

本节的工作定义是:在图像识别中,深度学习强烈展示了一条方向,与其只依赖人设计好的特征,不如让模型从数据里学习分层表征。

区分手工特征与学得表征的基准

  • 把图像识别理解成“从输入图像预测类别”的问题。
  • 说明 hand-crafted features 和 learned representations 的区别。
  • 在入门层面理解 CNN 为什么会分层处理图像的局部模式。
  • 把 AlexNet 读成“大数据、GPU、深层 CNN 和表征学习结合起来”的转折点。
  • 避免把图像识别历史夸大成 LLM 的直接谱系。

三个基准

基准 为什么重要 本节需要达到的理解程度
图像分类对人看起来容易,但很难写成固定规则 这能说明为什么深度学习会变得重要。 理解光照、视角和遮挡会让规则很脆弱就够了。
hand-crafted features 和 learned representations 是两种不同思路 这能用一句话抓住深度学习的核心转向。 理解过去是人选线索,后来是模型连同表征一起学即可。
AlexNet 更适合被读成“扩散的转折点”,而不是“绝对最初起点” 这能保住历史重要性,又不至于夸大。 理解它是 adoption 上的代表拐点即可。

图像识别对人容易,对规则却很难

人看到一张图片,往往很快就能说出“猫”“汽车”“人脸”之类的判断。但一旦试图把这种判断写成明确规则,问题就会立刻变难。

假设我们试图写出“识别猫”的规则:

有尖耳朵,可能是猫。
看见胡须,可能是猫。
有两只眼睛并且有毛,也可能是猫。

这些规则很快就会碰到例外:

变化 为什么规则会变难
光照变化 同一个物体的亮度和颜色都可能变化
姿态变化 耳朵、眼睛、腿的位置会变化
背景变化 背景可能比目标本身更显眼
遮挡 物体可能只露出一部分
同类内部的多样性 猫的品种、体型和毛色差异很大

3.1 里的人脸识别例子也和这个问题直接相连。相关综述提到,较早的方法包括基于几何特征、整体方法、hand-crafted features 和 hybrid 方法。这些都是重要研究路线,但在光照、姿态、表情、年龄和遮挡都不受控的场景下,人们需要更强的方法。

所以,图像识别的核心困难并不只是“该选哪个分类器”,而是更早的一个问题:

到底该从图像里看什么?

也就是说,featurerepresentation 的问题,先于分类问题本身。

hand-crafted features 由人先决定看什么线索

hand-crafted features 指的是:由人先决定模型应该看哪些线索。例如:

问题 人可能设计的特征
人脸检测 两眼之间距离、鼻子位置、脸部轮廓
车道检测 线条方向、亮度变化、边界边缘
物体分类 边缘、纹理、颜色直方图
文字识别 笔画方向、曲线、交叉点

这种方法并不是没有价值。它的优点是比较容易解释,而且在数据量较小、环境较稳定的问题里仍然可能有效。

但当变化变多时,人就很难把所有有用线索都手工设计出来:

哪些边缘真正重要?
哪些纹理还算是同一个物体?
光照变化以后还能不能算同一类?
换了背景后还能否继续归在同一个类别?

这些问题会把讨论重新带回 3.3 和 4.3 里出现过的 representation:好的表征应该突出对分类重要的差异,同时压低那些不重要的变化。

learned representation 是在模型内部形成的

representation learning 指的是:不仅学习最后的输出,也从数据中学习把原始输入转换成更适合处理的内部形式。Bengio、Courville 和 Vincent 的综述就指出,机器学习算法的成功在很大程度上依赖于数据表征。

对于图像来说,原始输入是 pixel。但单靠像素值,并不会直接把“猫”“汽车”“人脸”这种类别暴露出来。模型可能会在多层处理里,把低层线索逐渐变成更高层的表征。

像素
-> 线条与边缘
-> 纹理与局部部件
-> 物体部件
-> 类别判断

这并不表示模型内部真的总会自动分成完全可读的人类阶段。对入门阶段来说,更安全的理解是:

模型不是原样对原始图像分类,
而是经过多层计算,
形成有助于分类的内部表征。

LeCun、Bengio 和 Hinton 的 Nature 综述把深度学习解释成:由多个处理层组成、能够学习多层抽象表征的一类计算模型。它也指出,深度学习显著提升了语音识别、视觉物体识别和目标检测等领域的表现。

CNN 会分层处理图像的局部模式

CNN 是图像识别里最重要的神经网络结构之一。这里不看公式,只看直觉。

图像是有空间结构的。眼睛、鼻子、嘴巴、轮子、门把手之类线索,通常先出现在局部区域里。CNN 的结构特点就在于:它可以在不同位置反复探测这类局部模式,再在更高层里把它们组合成更大的模式。

flowchart LR
  Pixels[像素]
  Edges[轮廓与边缘]
  Parts[局部形状]
  Object[物体表征]
  Class[分类结果]

  Pixels --> Edges --> Parts --> Object --> Class

把汽车图像极度简化后,可以这样理解:

阶段 模型可能处理的线索
低层 线条、边角、亮度变化
中层 类似车轮的圆形结构、车窗样式
高层 与整辆车有关的部件组合
输出 汽车、公交车、卡车之类的类别分数

重要的是:人不必把“有轮子就可能是车”这样的规则全部显式写出来。模型会在大量带标签图像中,一起调整内部表征和参数。

为什么 AlexNet 会被反复提到

AlexNet 常常和 2012 年的 ImageNet 竞赛一起被提到,作为深度学习扩散的代表性案例。Krizhevsky、Sutskever 和 Hinton 的论文说明,他们训练了一个大的深层 CNN,去把大约 120 万张高分辨率图像分成 1000 个类别。论文还报告了约 6000 万参数、65 万个神经元、5 个卷积层和 3 个全连接层。

真正重要的不是这些数字本身,而是它们背后的组合:

元素 含义
大规模数据 大量带标签图像成为学习材料
深层 CNN 图像表征可以被逐层转换
GPU 实现 大矩阵计算与重复训练变得现实可行
正则化与数据增强 降低模型只贴住训练集的风险

这些并不是彼此独立的优点,而是互相咬合在一起的条件。没有大数据,深模型看不到足够多样的例子;没有深层 CNN,低层线索和高层表征就不容易在多层里被组合起来;没有 GPU,大模型的反复训练与比较会变得不现实;没有正则化和数据增强,大模型更容易过拟合。

所以,更安全的读法不是“出现了一个很强的 CNN”,而是:

大规模带标签数据
+ 深层 CNN 结构
+ GPU 计算
+ 减少过拟合的训练技术
= 一个让深度学习在图像识别里显著显现出来的转折点

AlexNet 论文也提到,模型是在两张 NVIDIA GTX 580 GPU 上训练 5 到 6 天,并指出更快的 GPU 和更大的数据集还能继续改进结果。这说明深度学习的崛起不只是“想法变了”,也是数据规模、模型结构、计算资源和训练方法共同变化的结果。

Nature 综述把 AlexNet 看成计算机视觉社区迅速接受深度学习的突破口之一。但这不该被读成“AlexNet 第一次发明了深度学习”。更安全的一句是:

AlexNet 是一个代表性的转折点,
它清楚地显示出深度学习在大规模图像识别中可以成为强有力选择。

图像识别不是 LLM 的直接谱系

这一节的目的不是写 LLM 的直接历史。image recognitionobject detectionspeech generation 都不是 LLM 的直接祖先。

但它们确实提供了一个重要背景:

对复杂输入来说,
人很难只靠规则和手工特征把一切都写清楚。
在大规模数据和计算资源存在时,
神经网络能够学到有用表征。
这种方法随后扩散到了图像、语音和语言等多个领域。

在这个背景上,后面的章节才会继续处理对象检测、语音生成,以及更直接通往语言模型的路线。这里最重要的是不要把“图像识别的成功”直接写成“LLM 的直接起源”。

检查清单

  • 能把图像识别(image recognition)说明成“从图像预测类别”的问题。
  • 能区分 hand-crafted featureslearned representation
  • 能说明 CNN 是一种分层处理图像局部模式的重要结构。
  • 能把 AlexNet 解释成“大规模数据、深层 CNN、GPU 与训练技术结合起来”的转折点。
  • 不会把图像识别历史夸大成 LLM 的直接谱系。
  • 能对比“人手工设计特征”和“模型连同表征一起学习”的两种方式。
  • 能把图像识别历史放在深度学习范式扩散的背景里,而不是写成 LLM 的直接谱系。

来源与参考资料