P2-2.3 极限(limit)与变化的直觉¶
Section ID:
P2-2.3Version:v2026.07.20
在 P2-2.2,我们把 sigma(Σ)读成了重复加法的压缩记法。现在转到另一个同样容易让人陌生的记法:极限。
极限和“把一个值准确代进去”的感觉稍有不同。它是用来观察:当某个值不断靠近时,函数输出会靠近哪里。在 AI 文档里,比起极限本身,更常需要的是它所连接出来的直觉:变化率(rate of change)、导数(derivative)、梯度(gradient)和优化(optimization)。
这里要做的是:通过问“什么正在靠近什么?”来阅读极限记号,并说明它为什么会成为“函数小变化”和“导数”之前的准备阶段。
这里会重新整理 极限、收敛(convergence)、变化率(rate of change)、代入(substitution) 和 靠近(approach)。如果 2.2 读的是重复和聚合的记法,那么这里整理的就是:当一个值只改变一点点时,用来读取函数如何反应的记法。
从读者视角看,这里还需要再多走一步。如果只是把极限读成“靠近的趋势”,理解可能会停住。Part 2 真正需要的是下一个问题:当它再靠近一点时,函数值到底改变了多少?
先看的一个小桥例子¶
从极限走向导数的最小场景,可以这样看。
让 x = 2 附近的值轻微移动一下。
输入 x | 函数值 f(x) | 与前一个值的差 |
|---|---|---|
| 2.0 | 4.0000 | - |
| 2.1 | 4.4100 | 0.4100 |
| 2.01 | 4.0401 | 0.0401 |
| 2.001 | 4.004001 | 0.004001 |
读者在这张表里首先该看到的是:当 x 越来越接近 2,f(x) 也越来越接近 4。但如果再往前走一步,你会开始不只想问 它正在靠近哪里?,还想问 它变化得有多快? 这个问题就会直接把人带到变化率,再带到下一章的导数。
所以,极限不是终点,而是一座桥。
x在靠近什么?f(x)在靠近什么?- 在这个过程中,函数值变化得有多快?
只有当第三个问题出现时,极限才会真正连到导数的入口。
一旦理解了极限,后面的很多内容都会更容易读。尤其是你会开始获得这样一种感觉:比起只盯着一个精确点,更要看 某个值附近的趋势。
- 学导数时,会更容易理解为什么要思考“非常小变化的比率”。
- 读梯度时,会更容易接受“问损失朝哪个方向变化”的语言。
- 学优化时,会更容易理解“把数值一点点改动,去找更好方向”的流程。
- 在数值计算里,也更容易感觉到为什么非常小的值、接近 0 的值、近似(approximation)都必须小心。
- 在深度学习训练说明中,也更容易看见:
使损失下降的方向不只是比喻,而是和函数变化语言直接相关。
核心判断标准:极限(limit)与变化的直觉¶
- 能把极限读成“观察某个值不断靠近时的记法”。
- 能说明 \(x \to a\) 和 \(f(x) \to L\) 的差别。
- 能把极限和简单代入区分开。
- 能把收敛解释成“数值逐渐靠近一个值”的现象。
- 能把“小变化”的直觉和“变化率”的直觉连接起来。
- 能说明为什么极限是在为后面的导数、梯度和优化做准备。
- 能把极限记号拆成“正在移动的值”“被靠近的值”“被观察的函数值”来读。
- 能通过直接代入、代数整理和观察邻近值来尝试简单极限式。
三个判断标准¶
阅读正文时起标准作用的三个视角如下。
| 标准 | 为什么重要 | 本节需要达到的理解程度 |
|---|---|---|
| 极限看的不是某个点本身,而是那个点附近的趋势 | 它能防止把代入和极限混在一起。 | 理解首先要读“什么正在靠近什么”。 |
| 极限是在观察邻近变化,而不是只做一次代入 | 它会建立阅读“某点附近行为”的感觉,即使那个点本身特别或未定义。 | 理解代入和极限是不同动作。 |
| 极限和 AI 相连,是因为它在为导数做准备,而导数在读取“小变化会怎样影响结果” | 它会提前搭好通向导数和优化的桥。 | 理解极限是变化率直觉的准备阶段。 |
从数学教育视角读取极限¶
在数学教育中,极限通常会被介绍成“当某个值无限靠近时,函数值会如何”。这里与其背诵这句话,不如把记号里的角色拆出来看。
这一行里有四个信息。
- \(\lim\):表示“我们要观察一个靠近的趋势”
- \(x \to a\):输入
x正在靠近a - \(f(x)\):此时被观察的函数值
- \(L\):函数值要靠近的目标值
这样拆开之后,极限就不再像一个困难的计算符号,而更像是一句用来观察“靠近情形”的句子。
x正在靠近a。- 在这个过程中去看
f(x)。 - 确认
f(x)是否正在靠近L。
这里最重要的是分清 正在靠近 和 等于。极限是观察邻域趋势的记法。函数在那个点本身是否有定义,或者能否直接把那个值代进去,都必须另外确认。
收敛就是“越来越靠近”的现象¶
在数学语言里经常会碰到一个词:收敛(convergence)。收敛就是:数值越来越接近某一个值的现象。
如果一串值越来越接近某一个值,就可以说它收敛到那个值。
极限就是用来表达和确认:这种收敛是否发生,以及如果发生,是在靠近哪个值。所以,下面这句话就是自然的。
这就读成:当 x 靠近 a 时,f(x) 收敛到 L。
不过,不要把极限和收敛当成完全相同的词。收敛是“越来越靠近”这个现象,而极限则是用来表达或确认这种现象的概念和记法。如果数值没有朝一个值越来越近,就说它不收敛,那种情况下也就难以谈那个意义下的极限。
这里不会深究收敛的证明。但当你看到极限记号时,只要多问一句 什么正在收敛到什么?,理解就会容易很多。
一个简单的极限例子¶
建立极限直觉的最好方法,是直接做短小的例子。最简单的情况,就是直接代入也不会出问题。
这个式子是在问:当 x 靠近 2 时,x + 1 会靠近哪里?在这个例子里,就算直接代入 x = 2 也没有问题。
所以可以写成下面这样。
这时就可以说:当 x 靠近 2,x + 1 会收敛到 3。
但并不是所有极限都这样结束。看下面这个式子,如果直接代入 \(x=1\),分母会变成 0。
所以要先对式子做整理。
对于那些“\(x\) 不是正好等于 1”的邻近值,你可以约去 \(x-1\),把它看成下面这样。
那么当 x 靠近 1 时,x + 1 就会靠近 2。
这里重要的仍然不是“1 这个点代进去会得到什么”,而是“当 x 靠近 1 时,这个式子会收敛到 2”。
这里的关键就是:不要在“分母变成 0”时直接停下。若直接代入不行,就先整理出这个式子在邻近位置能不能看得更清楚,再去确认它究竟靠近什么值。有了这种程度的直觉,就足以为后面阅读变化率和导数做准备。
极限是在读“靠近”的过程¶
看下面这个记号。
它可以这样读。
- 看
x靠近a的过程。 - 检查
f(x)是否靠近L。
这里重要的不是 x 正好等于 a,而是 x 越来越接近 a 时,函数值 f(x) 是否在接近某个值 L。
读极限时,要把下面三层分开。
- \(x \to a\):输入正在靠近什么?
- \(f(x)\):正在观察哪个函数值?
- \(L\):函数值正在靠近什么?
所以,极限不是只看一个值的记法,而是同时看“靠近方向”和“那个过程中结果如何变化”的记法。
代入和极限可能不同¶
人很容易把极限理解成“先把值代进去看看”。事实上,很多简单函数中,把 \(x=a\) 代进去的值和极限值确实相同。
这里如果代入 \(x=2\),同样得到 \(f(2)=3\)。所以代入和极限看起来是一样的。
但极限的核心并不是代入,而是靠近的过程。有些式子在某个特定点上很难直接算,甚至那个点本身未定义,但你仍然可以观察它在邻近区域会靠近哪里。
如果直接代入 \(x=1\),分母就会变成 0。但如果看它的邻近形式,就可以这样整理。
因此,当 x 靠近 1 时,g(x) 就会靠近 2。
这个例子说明:极限并不是“正好把那个值放进去”,而是“去看它在附近会靠近哪里”。
小变化会揭示函数如何变化¶
在 AI 学习里,重要的是函数值如何变化。如果输入轻微变化,输出会变化多少?如果参数轻微变化,损失会变化多少?这些都很重要。
假设有一个很简单的函数。
当 \(x\) 是 2 时,函数值如下。
现在把 x 稍微加大一点。
输入变化了 0.1,函数值变化了 0.41。
- 输入从 2 变成 2.1。
- 输出从 4 变成 4.41。
这就是变化率(rate of change)的起点。
这个表达看的是:函数值变化了多少,相比于输入变化了多少。 这里还不去正式计算导数。重要的是:你开始用“比率”这个视角去看函数的变化。
如果把同一个场景再缩小一些,通往变化率的桥就会更清楚。
| 比较区间 | 输入变化 | 输出变化 | 变化率 |
|---|---|---|---|
| 2.0 -> 2.1 | 0.1 | 0.41 | 4.1 |
| 2.0 -> 2.01 | 0.01 | 0.0401 | 4.01 |
| 2.0 -> 2.001 | 0.001 | 0.004001 | 4.001 |
区间越缩越小,变化率就越靠近 4。这里你还不必正式用上“导数”这个词。读者真正要抓住的是:原本在问 什么正在靠近什么,现在开始转成在问 变化比率正在靠近什么。
极限会继续连到导数¶
导数(derivative)是在看非常小变化下的变化率。如果把平均变化率放到越来越小的区间里,就会逐渐看见函数在一个点附近是朝哪个方向、以多大幅度变化。
在上面的 f(x) = x^2 例子里,当 x = 2 附近的区间越来越小时,变化率会越来越接近 4。这个小小场景就已经用最短方式展示了极限和导数的连接。
- 先是输入正在靠近某个值。
- 接着去看函数值靠近哪里。
- 再继续看变化比率靠近哪里。
- 这个问题就会继续通向瞬时变化率和导数。
所以,Chapter 2 里的极限是在恢复阅读“靠近”的语言,而 Chapter 4 里的导数是在利用这种“靠近”结构去恢复阅读“变化方向与大小”的语言。
这个表达是在看:从 x 往前移动 h 后,函数值变化了多少。如果让 h 越来越接近 0,就会开始思考某一点附近的变化率。
这个记号就会继续通向导数的核心直觉。不过这里并不处理导数公式或计算法。这里只抓住一点:极限是在看一个小变化越来越小时的趋势,所以它会变成导数的语言。
为什么它在 AI 学习里需要出现¶
在机器学习和深度学习里,学习通常会被解释成:通过调整参数,让损失(loss)下降的过程。这时重要的问题是下面这些。
- 如果把参数轻微改一下,损失会怎样变化?
- 损失朝哪个方向会下降?
- 如果改得太大,会出现什么问题?
这些问题都会继续连到变化率和梯度(gradient)。极限就是让你能够更精细地思考这种变化率的记号。
简单说,就是下面这条流程。
当函数值发生变化时,先比较变化量,再看变化率,再读“非常小变化”的趋势,而这条流向最终会继续到导数和梯度,让你找到减少损失的方向。
所以,极限不是直接运行 AI 模型的记号,而是在为下面这种说明做准备:学习是在“把数值一点点改变,并寻找更好方向”。
极限中的接近与变化结构¶
当极限记号出现时,可以按下面的顺序来读。
- 什么正在移动?
- 它在靠近什么?
- 正在观察哪个函数值?
- 那个函数值在靠近什么?
- 这个记号是在为变化率或导数做准备吗?
例如,看下面这个表达。
它可以这样读。
h正在靠近 0。- 看从
x往前移动h后,函数值的变化。 - 再把这个变化量除以
h,去看变化率。 - 让
h越来越小,从而观察某一点附近的变化趋势。
这个表达会在 P2-4.1 和 P2-4.2 中再次出现,用来重新读取导数和变化率。这里先把它理解成 用来观察小变化的记号。
用案例来看¶
案例 1. 为什么要看损失只改变一点点时,结果会变化多少¶
一个学习者看到极限时,最先可能会问:“这在 AI 里到底用在哪里?” 即使极限本身不会经常被直接计算,这种直觉仍然是必须的,因为模型学习会不断问 如果把值轻微改一下,损失会怎样变化?
例如,假设你想知道:如果把某个参数只稍微调高一点,损失会不会大幅增加,还是几乎不变。此时真正重要的,不是只盯着一个精确点,而是要看那个点附近,函数正在朝哪个方向、以什么方式变化。
极限正是用来读取这种 在靠近时的趋势 的记号。所以,让 h 靠近 0 不是形式上的技巧,而是在为“观察非常小变化时的比率”做准备。这条流向后来就会继续通向导数和梯度。
这个案例把极限连接成“阅读学习方向之前的阶段”,而不是一个孤立的数学概念。现在比起完整证明公式,更重要的是先抓住这种感觉:我们正在看一个小变化的趋势。
为什么极限会让人觉得难¶
极限之所以难,不是因为计算本身难,而是因为表达方式陌生。尤其当“正在靠近的输入”“那个过程中的函数值”“精确代入”和“邻域趋势”的差异混在一起时,它就会让人觉得复杂。
第一次重新恢复极限时,与其先上严格证明,不如先用语言把它拆开。比如,首先要能问:当 x 靠近 a 时,f(x) 会靠近哪里? 以及 当 h 靠近 0 时,变化比率会靠近哪个值?
一旦能够提出这些问题,你就已经为之后阅读导数和梯度做好了准备。
检查清单¶
- 你能把极限解释成“观察逐渐靠近的过程”的记号吗?
- 你能区分 \(x \to a\)、\(h \to 0\)、\(f(x) \to L\) 各自的含义吗?
- 你能说明极限和简单代入并不总是同一件事吗?
- 你能把收敛解释成“数值靠近某个值的现象”,而不直接把它等同于极限吗?
- 你能说明小变化和变化率之间的关系吗?
- 你能说明为什么极限是在为后面的导数、梯度和优化做准备吗?
- 你能说明为什么极限之后还会在导数、梯度、优化和数值计算里再次出现吗?
- 你能通过直接代入或代数整理来算出一个简单极限式所靠近的值吗?
- 你能把极限解释成读取小变化趋势的语言,而不是只看直接代入吗?
来源与参考资料¶
- Marc Peter Deisenroth, A. Aldo Faisal, Cheng Soon Ong, Mathematics for Machine Learning, Cambridge University Press, 2020, 确认日期:2026-07-19.
- Ian Goodfellow, Yoshua Bengio, Aaron Courville, Deep Learning, MIT Press, 2016, 确认日期:2026-07-19.
- Catherine F. Higham, Desmond J. Higham, Deep Learning: An Introduction for Applied Mathematicians, arXiv, 2018, 确认日期:2026-07-19.
- OpenStax, Calculus Volume 1, 2.2 The Limit of a Function, Rice University, 确认日期:2026-07-19. 这个参考资料支持用表格和邻近值估计极限的说明。
- OpenStax, Calculus Volume 1, 3.1 Defining the Derivative, Rice University, 确认日期:2026-07-19. 这个参考资料支持把变化率、差商的极限连接到导数直觉的说明。