P2-5.1 概率(probability)如何把不确定性表示成数字¶
Section ID:
P2-5.1Version:v2026.07.20
在 P2-4 章里,我们通过微分(derivative)与梯度(gradient)看了 怎样改变数值,损失(loss)才会下降。现在,我们需要另一种类型的数学语言。
微分让我们能够读取变化方向。概率(probability)让我们能够用数字处理不确定的情境。换句话说,微分是读取数值如何变化的语言,而概率是把“还不知道的状态”表示成数字的语言。
学习 AI 时,概率不会只停留在骰子或硬币问题上。当数据不足、观测不完整,或者模型用简化方式去看世界时,我们处理的不是确定答案,而是 某件事大概有多可能发生? 这里要先把这个入口抓稳。
本节重新整理 概率(probability)、不确定性(uncertainty)、事件(event)、结果(outcome)、样本空间(sample space)。如果说 Chapter 4 处理的是变化与学习方向,那么这里就是重新整理“如何把不确定的情境表示成数字”的概率入口。
这里并不把重点放在正式计算概率公式,而是放在重新抓住“概率是表示不确定性的数字语言”这件事上。只要在这里先抓住事件(event)、结果(outcome)、样本空间(sample space)、可能性分数的感觉,后面再读分布、估计、模型预测概率时,就能更顺地理解为什么概率语言会不断回来。
核心判断标准:概率(probability)如何把不确定性表示成数字¶
- 你可以把不确定性(uncertainty)解释成“还不知道的状态”。
- 你可以把概率(probability)解释成用来表达和比较不确定性的数字语言。
- 你可以区分结果(outcome)、事件(event)、样本空间(sample space)。
- 你可以说明:概率并不总是保证正确答案的数字,而是用于判断与建模的表达方式。
- 你可以区分长期频率(long-run frequency)与相信程度(degree of belief)。
- 你可以说明 AI 模型的预测(prediction)为什么会接到概率表达。
三个判断标准¶
| 标准 | 为什么重要 | 本节需要达到的理解程度 |
|---|---|---|
| 不确定性是“还不知道的状态” | 因为在看数字之前,必须先理解概率到底在表达什么状态。 | 理解不确定性是信息不足,或者未来还没有固定下来的状态。 |
| 概率是把这种状态写成数字 | 因为想比较可能性、把它当成判断材料,就需要一种表达语言。 | 理解概率是把“还不知道”的状态用数字表达并进行比较的方法。 |
| AI 会反复使用概率语言 | 因为预测和判断往往并不确定,所以必须把可能性数值化。 | 理解模型输出不一定是已确认的答案,而可能只是可能性的表达。 |
不确定性不是数字,而是一种状态¶
不确定性(uncertainty)本身不是数字。不确定性,是我们还不知道的状态。
例如,想想下面这些问题。
- 明天会下雨吗?
- 这封邮件是垃圾邮件吗?
- 这张图片里的物体是猫吗?
- 这个用户下个月还会继续使用服务吗?
这些问题在当前时刻很难完全确定。可能是因为信息不足、未来还没有到来,或者观测本身并不完整。
概率就是把这种不确定状态写成数字的方法。例如,我们可以写成“下雨的可能性 70%”“垃圾邮件的可能性 95%”“是猫的可能性 82%”“流失的可能性 30%”。
这里的数字并不表示 我们已经知道正确答案。它是根据当前拥有的信息和模型,来表达哪一边更像是真的的一种方式。
下面这张图展示了:如何把不确定状态表示成 0 到 1 之间的概率数字。
概率写成 0 到 1 之间的数字¶
概率(probability)通常会写成 0 到 1 之间的数字。0 这一边表示“把它看成不会发生”,1 这一边表示“把它看成一定会发生”,0.5 则表示“把两边可能性看得差不多”。
如果写成百分比(percent),就会像下面这样。
重要的是,概率并不是直接告诉我们“好/坏”的数字。概率表示的是某个事件(event)发生的可能性。例如,下雨概率 80% 的意思,是“下雨这个事件发生的可能性高”;至于这是不是好天气或坏天气,则取决于目的。
这个区分在 AI 服务里也很重要。如果某个模型输出 垃圾邮件概率 0.95,那只是给“这是垃圾邮件”这个事件打出的可能性分数。到底要不要拦截、提醒用户、还是让人工再复查,是叠加在这个分数之上的另一层决策。
要区分结果、事件、样本空间¶
要读懂概率,必须先区分三个词。
| 术语 | 英语 | 工作用定义 |
|---|---|---|
| 结果 | outcome | 一次试验中真实可能出现的单个结果 |
| 事件 | event | 我们关心的一组结果 |
| 样本空间 | sample space | 所有可能结果的集合 |
来看一个掷一枚骰子的情境。可能的结果是 1, 2, 3, 4, 5, 6,样本空间就是 {1, 2, 3, 4, 5, 6}。此时,“出现偶数”这个事件可以写成 {2, 4, 6}。
如果我们假设这枚骰子是公平的,那么出现偶数的概率可以这样计算。
这个计算就是把“关心的结果个数”除以“所有可能结果的个数”。这里关心的结果是 2, 4, 6,全部结果是 1, 2, 3, 4, 5, 6,所以概率就是 3 / 6。
就像下面这张图一样,事件(event)是在样本空间(sample space)里,把我们关心的结果(outcome)收成一组的东西。
不过,这种方法只有在所有结果都可以被看成“同样容易发生”时,才能直接使用。真实数据里,很多结果并不是均匀出现的。
硬币和骰子只是起点¶
概率刚入门时,硬币和骰子总会出现,原因很简单。因为它们的可能结果很容易列出来,而且如果假设硬币或骰子是公平的,也很容易把每个结果看成差不多一样可能。
硬币只有正反两面,骰子则能很简单地列出 1, 2, 3, 4, 5, 6 这些结果。
但真实的 AI 问题会复杂得多。比如,我们可以想象下面这些问题:客户会不会流失,句子是不是积极情感,图像里有没有行人,或者贷款申请的风险有多大。
这些问题很难像骰子那样,把可能结果简单分成相同比例。所以我们会使用数据(data)、特征(feature)、模型(model)来估计可能性。
于是,概率就会从“像骰子那样数一数就能处理的问题”,扩展成“要根据观测数据来估计可能性的问题”。
长期频率和相信程度¶
在理解概率时,常常会出现两个视角。
一个是长期频率(long-run frequency)。这种视角会把同一个实验重复很多很多次,看某个结果出现的比例,再把这个比例解释成概率。
如果我们把一枚公平硬币抛很多次,就可以期待正面比例大致接近 0.5。这个视角在说明可重复实验时很直观。
另一个是相信程度(degree of belief)。这种视角会根据当前拥有的信息,把某件事看起来多像是真的,写成数字。
例如,医生根据症状和检查结果判断某种疾病的可能性,或者模型根据邮件内容计算垃圾邮件的可能性。我们不能把同一个人复制无数次来重复实验,但仍然可以基于当前信息表达可能性。
这里我们这样区分两种视角:对可重复实验,用长期频率视角来读;对必须依靠当前信息来判断的情况,用相信程度视角来读。
在 AI 里,两种视角都会出现。我们会使用数据里观测到的频率,也会使用基于模型当前信息得到的可能性分数。
贝叶斯规则是更新相信程度的语言¶
第一次看到贝叶斯规则(Bayes' rule)时,它可能会非常陌生。尤其是如果你只把概率记成硬币、骰子、比率计算,那么“更新相信程度”这句话本身都可能不像数学。
这里不会去计算贝叶斯规则,但会先抓住:为什么这个名字在概率和 AI 文档里会经常出现。
很粗略地说,贝叶斯规则处理的是这样一条流程:原本已经持有的相信程度,会在看到新的观测信息后,被更新成新的相信程度。
在英文里,经常会用下面这些词来表达。
| 术语 | 英语 | 工作用解释 |
|---|---|---|
| 先验相信 | prior belief | 看到新证据之前持有的可能性判断 |
| 证据 | evidence | 会让这种相信发生变化的观测信息 |
| 后验相信 | posterior belief | 看到证据之后更新过的可能性判断 |
例如,假设一开始我们觉得某封邮件变成垃圾邮件的可能性并不高。可如果又看到“链接很多”“可疑词句反复出现”“发件人很陌生”这些证据(evidence),判断就可能改变。
也就是说,一开始看起来不像垃圾邮件,但在看到“链接很多、发件人陌生”等新证据之后,我们会把它是垃圾邮件的可能性判断得更高。
下面这张图并不是把贝叶斯规则画成公式,而是把它画成“用新证据更新相信程度”的流程。
flowchart TD
A["先验判断<br/>新证据出现前的判断"]
B["证据<br/>会改变判断的观测信息"]
C["后验判断<br/>结合证据后的更新判断"]
A --> B --> C
这里最重要的词是 evidence。evidence 不只是“证据材料”的意思,它也会被用来指代“让概率判断发生变化的观测信息”。在 AI 文档里看到 evidence 时,问一句“是什么改变了判断?”通常很有帮助。
贝叶斯规则不是 P2-5.1 的核心计算对象。这里先只留下一个视角:概率可以因为新的观测而被更新。 条件概率(conditional probability)与贝叶斯规则的计算,会暂时放在本书当前正文范围之外。
概率不是答案,而是一种表达¶
如果把概率直接读成“答案”,就会产生误解。比如,下雨概率 70% 并不表示一定下雨,垃圾邮件概率 95% 也不表示它绝对就是垃圾邮件,猫的概率 82% 更不表示模型已经真正理解了“猫”这个词。
概率是用来处理不确定性的表达方式。这个表达是否值得信任,又是另一层问题。我们还要继续问:数据够不够、数据有没有偏、模型是按什么标准在计算可能性、概率分数和真实频率是否匹配、决策阈值又是什么。
这些问题会在后面再次回来:在 Part 3 的 P3-6 评估指标和 P3-6.4 补充学习里,它们会变成分数解释与校准(calibration)的问题;在 Part 5 的 P5-10.2 里,它们会变成安全性与对齐(alignment)的问题。
为什么 AI 里需要概率¶
很多时候,AI 并不是只靠确定规则来工作。它会在数据里寻找模式,再根据这些模式去计算新输入的可能性。
例如,一个图像分类模型可能会给出这样的分数:cat: 0.82、dog: 0.12、rabbit: 0.04、other: 0.02。
这些数字表示的是:模型觉得每个候选有多可能。如果选最大的那个值,预测就会变成 cat。但在模型内部,比起一个单独的正确答案,候选之间的可能性分布往往更重要。
语言模型也有类似的结构。
用案例来看¶
案例 1. 为什么垃圾邮件判断需要概率语言¶
假设一个邮件服务要看一封新邮件,然后判断 它是不是垃圾邮件。人也可以看标题、发件人、链接数量、语气风格来怀疑它,但很多时候并不容易一开始就断定 它一定是垃圾邮件。
这时,概率并不是把 不知道 这个状态扔掉,而是把它写成数字。比如,我们可以把某封邮件看成:垃圾邮件概率 0.95,正常邮件概率 0.05。这些数字并不表示“答案已经知道了”,而是表示:在当前信息下,哪一边看起来更像是真的。
这个案例也说明了概率和决策不是同一回事。即使垃圾邮件概率很高,到底是立刻删除、只提醒用户,还是交给人工再看一次,都是单独的政策问题。概率是判断材料,而最后的动作是叠加在上面的另一层。
所以,概率入门里真正重要的,并不是骰子怎么算,而是怎样把不确定的现实问题翻译成一种数字语言来读。AI 里概率会反复出现,也正是因为这里。
我们也可以把语言模型读成这样一种结构:面对下一个词候选 A、候选 B、候选 C,比较它们各自接下来出现的可能性。
这里不会处理语言模型的细节计算。但值得先记住的是:AI 与其说是直接吐出正确答案的机器,不如说更像是在很多不确定候选之间不断比较可能性的计算系统。
概率、不确定性、stochastic 不是同一个词¶
继续读 AI 文档时,你会经常遇到 probability、uncertainty、stochastic。它们彼此相关,但并不是同一个词。
| 术语 | 英语 | 区分 |
|---|---|---|
| 不确定性 | uncertainty | 还不知道的状态 |
| 概率 | probability | 把不确定性写成数字的语言 |
| 随机性/概率性 | stochastic | 过程或行为本身带有概率波动的性质 |
例如,掷骰子可以看作一个 stochastic process。因为在事先很难说清到底会出现哪一面,而重复多次时,结果也会变化。
相比之下,我没有完全观察到这个客户的内在状态,所以无法确信他会不会流失,这是 uncertainty 的问题。如果模型把这种 uncertainty 写成 0.3 这样的数字,那就变成了 probability。
所以,不确定性是“还不知道”的状态,概率是把这种状态写成数字,而 stochastic 则是在说:过程本身就包含概率性的波动。
这个区分在以后阅读机器学习与生成式 AI 时会很重要。尤其是如果把 random、stochastic、nondeterministic、probabilistic 全都当成同一个词来用,说明就会变得模糊。
一个简单例子:垃圾邮件判断¶
再来看一次垃圾邮件分类。
输入是邮件标题和正文,输出是它成为垃圾邮件的可能性。
模型可能会去看:某些词是否反复出现、链接是否很多、发件人是否陌生、模式是否和过去垃圾邮件相似。
于是模型可以给出一个类似 垃圾邮件概率: 0.92 的数字。
这个数字并不是一句“它无条件就是垃圾邮件”的宣告。它表达的是:在当前模型和数据下,成为垃圾邮件的可能性很高。在真实服务里,我们可以另外设置运营标准,例如:0.99 以上自动拦截、0.80 以上移入垃圾箱、0.50 附近则提示用户自己判断。
这里,概率是帮助判断的数字,而运营标准必须另外制定。这个区分对于理解 AI 服务非常重要。
下面这张图展示的是:模型的概率分数与服务的运营决策必须分开看。同样一个概率分数,因服务目的、风险、成本、政策不同,最后可能接出完全不同的动作。
检查清单¶
- 你可以把不确定性(uncertainty)解释成不是数字本身,而是“还不知道”的状态。
- 你可以把概率(probability)解释成一种用 0 到 1 之间的数字表达不确定性的语言。
- 你可以区分结果(outcome)、事件(event)、样本空间(sample space)。
- 你可以把公平骰子掷出偶数的概率算成 \(3/6\)。
- 你可以说明:概率并不总是保证答案正确,它只是当前信息与模型下的一种表达。
- 你可以区分长期频率(long-run frequency)与相信程度(degree of belief)。
- 即使不计算贝叶斯规则(Bayes' rule),你也可以把它说明成“用新证据更新相信程度”的流程。
- 你可以说明:probability、uncertainty、stochastic 不应该被当成同一个词来用。
- 你可以说明:AI 模型输出的概率,必须和真实运营决策分开。
- 你可以把概率不仅和硬币、骰子的计算联系起来,也和 AI 的预测分数联系起来。
来源与参考资料¶
- Barbara Illowsky, Susan Dean, Introductory Statistics, 3.1 Terminology, OpenStax, 确认日期: 2026-07-20。用于确认概率、结果(outcome)、样本空间(sample space)、事件(event)、0 到 1 之间的概率值、长期相对频率、条件概率等术语。
- Ian Goodfellow, Yoshua Bengio, Aaron Courville, Deep Learning, Chapter 3: Probability and Information Theory, MIT Press, 2016, 确认日期: 2026-07-20。用于支撑“概率论是 AI 与机器学习中表达不确定性的框架”这一说明。