跳转至

P2-5.1 概率(probability)如何把不确定性表示成数字

Section ID: P2-5.1 Version: v2026.07.20

在 P2-4 章里,我们通过微分(derivative)与梯度(gradient)看了 怎样改变数值,损失(loss)才会下降。现在,我们需要另一种类型的数学语言。

微分让我们能够读取变化方向。概率(probability)让我们能够用数字处理不确定的情境。换句话说,微分是读取数值如何变化的语言,而概率是把“还不知道的状态”表示成数字的语言。

学习 AI 时,概率不会只停留在骰子或硬币问题上。当数据不足、观测不完整,或者模型用简化方式去看世界时,我们处理的不是确定答案,而是 某件事大概有多可能发生? 这里要先把这个入口抓稳。

本节重新整理 概率(probability)不确定性(uncertainty)事件(event)结果(outcome)样本空间(sample space)。如果说 Chapter 4 处理的是变化与学习方向,那么这里就是重新整理“如何把不确定的情境表示成数字”的概率入口。

这里并不把重点放在正式计算概率公式,而是放在重新抓住“概率是表示不确定性的数字语言”这件事上。只要在这里先抓住事件(event)、结果(outcome)、样本空间(sample space)、可能性分数的感觉,后面再读分布、估计、模型预测概率时,就能更顺地理解为什么概率语言会不断回来。

核心判断标准:概率(probability)如何把不确定性表示成数字

  • 你可以把不确定性(uncertainty)解释成“还不知道的状态”。
  • 你可以把概率(probability)解释成用来表达和比较不确定性的数字语言。
  • 你可以区分结果(outcome)、事件(event)、样本空间(sample space)。
  • 你可以说明:概率并不总是保证正确答案的数字,而是用于判断与建模的表达方式。
  • 你可以区分长期频率(long-run frequency)与相信程度(degree of belief)。
  • 你可以说明 AI 模型的预测(prediction)为什么会接到概率表达。

三个判断标准

标准 为什么重要 本节需要达到的理解程度
不确定性是“还不知道的状态” 因为在看数字之前,必须先理解概率到底在表达什么状态。 理解不确定性是信息不足,或者未来还没有固定下来的状态。
概率是把这种状态写成数字 因为想比较可能性、把它当成判断材料,就需要一种表达语言。 理解概率是把“还不知道”的状态用数字表达并进行比较的方法。
AI 会反复使用概率语言 因为预测和判断往往并不确定,所以必须把可能性数值化。 理解模型输出不一定是已确认的答案,而可能只是可能性的表达。

不确定性不是数字,而是一种状态

不确定性(uncertainty)本身不是数字。不确定性,是我们还不知道的状态。

例如,想想下面这些问题。

  • 明天会下雨吗?
  • 这封邮件是垃圾邮件吗?
  • 这张图片里的物体是猫吗?
  • 这个用户下个月还会继续使用服务吗?

这些问题在当前时刻很难完全确定。可能是因为信息不足、未来还没有到来,或者观测本身并不完整。

概率就是把这种不确定状态写成数字的方法。例如,我们可以写成“下雨的可能性 70%”“垃圾邮件的可能性 95%”“是猫的可能性 82%”“流失的可能性 30%”。

这里的数字并不表示 我们已经知道正确答案。它是根据当前拥有的信息和模型,来表达哪一边更像是真的的一种方式。

下面这张图展示了:如何把不确定状态表示成 0 到 1 之间的概率数字。

用 0 到 1 之间的概率数字表达不确定性的刻度

概率写成 0 到 1 之间的数字

概率(probability)通常会写成 0 到 1 之间的数字。0 这一边表示“把它看成不会发生”,1 这一边表示“把它看成一定会发生”,0.5 则表示“把两边可能性看得差不多”。

如果写成百分比(percent),就会像下面这样。

1
2
3
0.7 = 70%
0.2 = 20%
1.0 = 100%

重要的是,概率并不是直接告诉我们“好/坏”的数字。概率表示的是某个事件(event)发生的可能性。例如,下雨概率 80% 的意思,是“下雨这个事件发生的可能性高”;至于这是不是好天气或坏天气,则取决于目的。

这个区分在 AI 服务里也很重要。如果某个模型输出 垃圾邮件概率 0.95,那只是给“这是垃圾邮件”这个事件打出的可能性分数。到底要不要拦截、提醒用户、还是让人工再复查,是叠加在这个分数之上的另一层决策。

要区分结果、事件、样本空间

要读懂概率,必须先区分三个词。

术语 英语 工作用定义
结果 outcome 一次试验中真实可能出现的单个结果
事件 event 我们关心的一组结果
样本空间 sample space 所有可能结果的集合

来看一个掷一枚骰子的情境。可能的结果是 1, 2, 3, 4, 5, 6,样本空间就是 {1, 2, 3, 4, 5, 6}。此时,“出现偶数”这个事件可以写成 {2, 4, 6}

如果我们假设这枚骰子是公平的,那么出现偶数的概率可以这样计算。

\[ P(\text{偶数}) = \frac{3}{6} = 0.5 \]

这个计算就是把“关心的结果个数”除以“所有可能结果的个数”。这里关心的结果是 2, 4, 6,全部结果是 1, 2, 3, 4, 5, 6,所以概率就是 3 / 6

就像下面这张图一样,事件(event)是在样本空间(sample space)里,把我们关心的结果(outcome)收成一组的东西。

用骰子例子展示样本空间、事件和结果关系的图

不过,这种方法只有在所有结果都可以被看成“同样容易发生”时,才能直接使用。真实数据里,很多结果并不是均匀出现的。

硬币和骰子只是起点

概率刚入门时,硬币和骰子总会出现,原因很简单。因为它们的可能结果很容易列出来,而且如果假设硬币或骰子是公平的,也很容易把每个结果看成差不多一样可能。

硬币只有正反两面,骰子则能很简单地列出 1, 2, 3, 4, 5, 6 这些结果。

但真实的 AI 问题会复杂得多。比如,我们可以想象下面这些问题:客户会不会流失,句子是不是积极情感,图像里有没有行人,或者贷款申请的风险有多大。

这些问题很难像骰子那样,把可能结果简单分成相同比例。所以我们会使用数据(data)、特征(feature)、模型(model)来估计可能性。

于是,概率就会从“像骰子那样数一数就能处理的问题”,扩展成“要根据观测数据来估计可能性的问题”。

长期频率和相信程度

在理解概率时,常常会出现两个视角。

一个是长期频率(long-run frequency)。这种视角会把同一个实验重复很多很多次,看某个结果出现的比例,再把这个比例解释成概率。

如果我们把一枚公平硬币抛很多次,就可以期待正面比例大致接近 0.5。这个视角在说明可重复实验时很直观。

另一个是相信程度(degree of belief)。这种视角会根据当前拥有的信息,把某件事看起来多像是真的,写成数字。

例如,医生根据症状和检查结果判断某种疾病的可能性,或者模型根据邮件内容计算垃圾邮件的可能性。我们不能把同一个人复制无数次来重复实验,但仍然可以基于当前信息表达可能性。

这里我们这样区分两种视角:对可重复实验,用长期频率视角来读;对必须依靠当前信息来判断的情况,用相信程度视角来读。

在 AI 里,两种视角都会出现。我们会使用数据里观测到的频率,也会使用基于模型当前信息得到的可能性分数。

贝叶斯规则是更新相信程度的语言

第一次看到贝叶斯规则(Bayes' rule)时,它可能会非常陌生。尤其是如果你只把概率记成硬币、骰子、比率计算,那么“更新相信程度”这句话本身都可能不像数学。

这里不会去计算贝叶斯规则,但会先抓住:为什么这个名字在概率和 AI 文档里会经常出现。

很粗略地说,贝叶斯规则处理的是这样一条流程:原本已经持有的相信程度,会在看到新的观测信息后,被更新成新的相信程度。

在英文里,经常会用下面这些词来表达。

术语 英语 工作用解释
先验相信 prior belief 看到新证据之前持有的可能性判断
证据 evidence 会让这种相信发生变化的观测信息
后验相信 posterior belief 看到证据之后更新过的可能性判断

例如,假设一开始我们觉得某封邮件变成垃圾邮件的可能性并不高。可如果又看到“链接很多”“可疑词句反复出现”“发件人很陌生”这些证据(evidence),判断就可能改变。

也就是说,一开始看起来不像垃圾邮件,但在看到“链接很多、发件人陌生”等新证据之后,我们会把它是垃圾邮件的可能性判断得更高。

下面这张图并不是把贝叶斯规则画成公式,而是把它画成“用新证据更新相信程度”的流程。

flowchart TD
  A["先验判断<br/>新证据出现前的判断"]
  B["证据<br/>会改变判断的观测信息"]
  C["后验判断<br/>结合证据后的更新判断"]

  A --> B --> C

这里最重要的词是 evidence。evidence 不只是“证据材料”的意思,它也会被用来指代“让概率判断发生变化的观测信息”。在 AI 文档里看到 evidence 时,问一句“是什么改变了判断?”通常很有帮助。

贝叶斯规则不是 P2-5.1 的核心计算对象。这里先只留下一个视角:概率可以因为新的观测而被更新。 条件概率(conditional probability)与贝叶斯规则的计算,会暂时放在本书当前正文范围之外。

概率不是答案,而是一种表达

如果把概率直接读成“答案”,就会产生误解。比如,下雨概率 70% 并不表示一定下雨,垃圾邮件概率 95% 也不表示它绝对就是垃圾邮件,猫的概率 82% 更不表示模型已经真正理解了“猫”这个词。

概率是用来处理不确定性的表达方式。这个表达是否值得信任,又是另一层问题。我们还要继续问:数据够不够、数据有没有偏、模型是按什么标准在计算可能性、概率分数和真实频率是否匹配、决策阈值又是什么。

这些问题会在后面再次回来:在 Part 3 的 P3-6 评估指标和 P3-6.4 补充学习里,它们会变成分数解释与校准(calibration)的问题;在 Part 5 的 P5-10.2 里,它们会变成安全性与对齐(alignment)的问题。

为什么 AI 里需要概率

很多时候,AI 并不是只靠确定规则来工作。它会在数据里寻找模式,再根据这些模式去计算新输入的可能性。

例如,一个图像分类模型可能会给出这样的分数:cat: 0.82dog: 0.12rabbit: 0.04other: 0.02

这些数字表示的是:模型觉得每个候选有多可能。如果选最大的那个值,预测就会变成 cat。但在模型内部,比起一个单独的正确答案,候选之间的可能性分布往往更重要。

语言模型也有类似的结构。

用案例来看

案例 1. 为什么垃圾邮件判断需要概率语言

假设一个邮件服务要看一封新邮件,然后判断 它是不是垃圾邮件。人也可以看标题、发件人、链接数量、语气风格来怀疑它,但很多时候并不容易一开始就断定 它一定是垃圾邮件

这时,概率并不是把 不知道 这个状态扔掉,而是把它写成数字。比如,我们可以把某封邮件看成:垃圾邮件概率 0.95,正常邮件概率 0.05。这些数字并不表示“答案已经知道了”,而是表示:在当前信息下,哪一边看起来更像是真的。

这个案例也说明了概率和决策不是同一回事。即使垃圾邮件概率很高,到底是立刻删除、只提醒用户,还是交给人工再看一次,都是单独的政策问题。概率是判断材料,而最后的动作是叠加在上面的另一层。

所以,概率入门里真正重要的,并不是骰子怎么算,而是怎样把不确定的现实问题翻译成一种数字语言来读。AI 里概率会反复出现,也正是因为这里。

我们也可以把语言模型读成这样一种结构:面对下一个词候选 A、候选 B、候选 C,比较它们各自接下来出现的可能性。

这里不会处理语言模型的细节计算。但值得先记住的是:AI 与其说是直接吐出正确答案的机器,不如说更像是在很多不确定候选之间不断比较可能性的计算系统

概率、不确定性、stochastic 不是同一个词

继续读 AI 文档时,你会经常遇到 probability、uncertainty、stochastic。它们彼此相关,但并不是同一个词。

术语 英语 区分
不确定性 uncertainty 还不知道的状态
概率 probability 把不确定性写成数字的语言
随机性/概率性 stochastic 过程或行为本身带有概率波动的性质

例如,掷骰子可以看作一个 stochastic process。因为在事先很难说清到底会出现哪一面,而重复多次时,结果也会变化。

相比之下,我没有完全观察到这个客户的内在状态,所以无法确信他会不会流失,这是 uncertainty 的问题。如果模型把这种 uncertainty 写成 0.3 这样的数字,那就变成了 probability。

所以,不确定性是“还不知道”的状态,概率是把这种状态写成数字,而 stochastic 则是在说:过程本身就包含概率性的波动。

这个区分在以后阅读机器学习与生成式 AI 时会很重要。尤其是如果把 randomstochasticnondeterministicprobabilistic 全都当成同一个词来用,说明就会变得模糊。

一个简单例子:垃圾邮件判断

再来看一次垃圾邮件分类。

输入是邮件标题和正文,输出是它成为垃圾邮件的可能性。

模型可能会去看:某些词是否反复出现、链接是否很多、发件人是否陌生、模式是否和过去垃圾邮件相似。

于是模型可以给出一个类似 垃圾邮件概率: 0.92 的数字。

这个数字并不是一句“它无条件就是垃圾邮件”的宣告。它表达的是:在当前模型和数据下,成为垃圾邮件的可能性很高。在真实服务里,我们可以另外设置运营标准,例如:0.99 以上自动拦截0.80 以上移入垃圾箱0.50 附近则提示用户自己判断

这里,概率是帮助判断的数字,而运营标准必须另外制定。这个区分对于理解 AI 服务非常重要。

下面这张图展示的是:模型的概率分数与服务的运营决策必须分开看。同样一个概率分数,因服务目的、风险、成本、政策不同,最后可能接出完全不同的动作。

把 AI 模型的概率分数与服务运营决策标准分开显示的流程

检查清单

  • 你可以把不确定性(uncertainty)解释成不是数字本身,而是“还不知道”的状态。
  • 你可以把概率(probability)解释成一种用 0 到 1 之间的数字表达不确定性的语言。
  • 你可以区分结果(outcome)、事件(event)、样本空间(sample space)。
  • 你可以把公平骰子掷出偶数的概率算成 \(3/6\)
  • 你可以说明:概率并不总是保证答案正确,它只是当前信息与模型下的一种表达。
  • 你可以区分长期频率(long-run frequency)与相信程度(degree of belief)。
  • 即使不计算贝叶斯规则(Bayes' rule),你也可以把它说明成“用新证据更新相信程度”的流程。
  • 你可以说明:probability、uncertainty、stochastic 不应该被当成同一个词来用。
  • 你可以说明:AI 模型输出的概率,必须和真实运营决策分开。
  • 你可以把概率不仅和硬币、骰子的计算联系起来,也和 AI 的预测分数联系起来。

来源与参考资料

  • Barbara Illowsky, Susan Dean, Introductory Statistics, 3.1 Terminology, OpenStax, 确认日期: 2026-07-20。用于确认概率、结果(outcome)、样本空间(sample space)、事件(event)、0 到 1 之间的概率值、长期相对频率、条件概率等术语。
  • Ian Goodfellow, Yoshua Bengio, Aaron Courville, Deep Learning, Chapter 3: Probability and Information Theory, MIT Press, 2016, 确认日期: 2026-07-20。用于支撑“概率论是 AI 与机器学习中表达不确定性的框架”这一说明。