跳转至

P1-7.3 启发式与概率模型的区别

Section ID: P1-7.3 Version: v2026.07.23

7.2 把 heuristic 看成:当不可能检查所有候选时,用来决定先看哪些候选、减少哪些候选的经验性标准。现在要把另一个看起来相近的概念分开:

启发式也常在不确定情境中出现,
概率模型也常在不确定情境中出现,
那么它们是不是同一个东西?

这一节的答案是否定的。

启发式是在减少搜索与判断负担的标准;
概率模型则是把不确定性写成数字并进行更新的结构。

在 Part 1 里,heuristic scoreprobabilistic modelprobability estimatethresholdcalibration 的基本区分先在这里固定。7.2 先看了启发式怎样减少搜索负担,6.2 和 6.3 则先说明了不确定性和概率数字该怎样读。这里的重点是:不要把 scoreprobabilityoperation rule 压成同一个词。

这一节不会计算 Bayes' rule、条件概率或完整概率分布。这些内容会在 Part 2 和 Part 4 回来。

这里也不会重新从头定义启发式。启发式和 heuristic function 的基本性格已经在 7.2 处理,不确定性、概率与 stochastic 的区分则在 6.2 和 6.3 处理。

这里也不是要把概率模型一概说成更科学,或把启发式说成次一等的东西。二者承担的是不同角色。

这里先固定三句话:

启发式是在减少候选。
概率模型是在表达不确定性。
它们可以一起使用,但不是同一个概念。

区分启发式与概率模型的基准

  • 不把 heuristicprobabilistic model 当成同义词。
  • 区分 heuristic scoreprobability
  • 理解分类阈值可能是运营标准,而不是概率模型本身的一部分。
  • 把“启发式是在软件里反映不确定性”这一直觉改写成更安全的表达。
  • 说明启发式和概率模型怎样在同一个系统中并存。

三个基准

基准 为什么重要 本节需要达到的理解程度
启发式是在决定“先看哪里” 这能把搜索问题和不确定性表达问题分开。 把启发式值理解成优先级分数。
概率模型是在表达“某个结果有多可信” 这能减少把所有数字都读成概率的错误。 理解“有数字”不自动等于“有概率”。
阈值可能是运营标准,而不是模型本身 这能把模型输出与服务政策分开。 理解“0.8 以上自动处理”可能只是运营规则。

先做一个角色分拆:

术语 极短含义 本节里的作用
heuristic 决定先看什么、减少什么的经验性标准 缩减搜索与判断负担
heuristic score 表示候选看起来多有希望的分数 用于排序与优先级
probabilistic model 用数字或分布表达不确定性的结构 表达可信度与更新信念
probability estimate 某个结果有多可能的数值估计 需要进一步确认能否被当成真实概率来读
threshold 把输出变成行动的分界线 自动化、暂缓或复核的运营标准
calibration 检查数字输出是否与真实频率相符的过程 防止把分数误当成可靠概率

一眼看全局

启发式和概率模型都可能出现在复杂或不确定的问题里,但它们回答的问题不同。

区分 启发式 概率模型
核心问题 该先看什么、该减少什么? 每个候选到底有多可信?
核心作用 减少搜索、比较和判断负担 用数字或分布表达不确定性
常见形式 经验规则、优先级分数、评估函数、停止条件 概率、条件概率、概率分布、预测概率
数字含义 可能只是“看起来有希望”的排序值 想把它读成概率,需要定义和校准
主要风险 过早丢掉更好的候选 过度相信未经校准的数字输出
验证重点 检查被漏掉的候选、偏差与适用条件 检查校准、数据分布与真实频率

最短的安全总结是:

启发式决定去哪里看;
概率模型表达它有多可信。

数字看起来相似,但含义可能完全不同

两者最容易混淆的原因,是它们都可能产生数字。但“出现数字”并不自动表示“这就是概率”。

假设我们在做客服消息自动处理:

候选 系统内部数值
配送咨询 0.82
支付咨询 0.44
退款咨询 0.31

这里的 0.82 到底是什么,要看系统设计。

可能含义 说明 注意点
heuristic score 由规则、关键词或优先级标准组合出来的分数 0.82 并不表示 82%
model score 模型内部计算出的相对分数 还要另外确认它是不是经过校准的概率
probability estimate 想表达某类别有多可能的概率式输出 仍需用 calibration 检查它是否可信
运营触发规则 例如“高于 0.80 就自动处理” 这是运营规则,不是概率本身

所以,只要看到一个数字,先问四件事:

这是概率吗?
是分数吗?
是优先级值吗?
还是自动处理的阈值?

启发式并不是在“计算不确定性”,而是在不确定条件下让判断成为可能

很多初学者最先冒出来的直觉是:

启发式是不是一种把不确定性反映到软件里的方式?

这个直觉有一部分是有帮助的。启发式确实常出现在“答案并不完全明确”或者“候选太多看不完”的情境里,所以它可以被看成是在不确定和受限条件下,让判断能够继续进行的实用装置。

但更安全的说法是:

启发式是在不确定性和计算极限存在时,
让搜索和判断得以继续的经验性标准。

如果直接说“启发式在计算不确定性”,就会和概率模型混在一起。把不确定性写成数字,并在新证据进入后更新信念,更接近概率模型的角色。

Poole 和 Mackworth 把概率说明成一种可随着 evidence 更新的信念计算法;而 7.2 里的 heuristic knowledge 则是搜索空间之外、用来指引搜索方向的额外知识。

所以,两者的出发点并不一样:

情况 更接近的概念
路径太多,必须决定先看哪条 启发式
新证据进入后,配送咨询的可能性发生变化 概率模型
必须很快决定自动处理还是转人工 启发式或运营规则
想检查 0.80 是否真的可以读成 80% 校准

例子:客服自动化

看这句消息:

我昨天刚下单,但现在还查不到物流。

在一个系统里,启发式和概率模型可以同时出现:

阶段 可能处理 对应概念
关键词检查 如果出现 订单物流 等词,就优先检查配送候选 启发式
模型预测 输出配送 0.68、支付 0.21、其他 0.11 概率模型或概率估计
追加证据 查看支付日志或快递接口状态 证据收集
更新判断 如果发现重复扣款,就提高支付候选 概率性判断
运营决策 如果最高分低于 0.90,则转人工复核 启发式或运营规则

这里最重要的是:

在同一个 AI 系统内部,
启发式、概率模型、证据检查和运营规则可以同时存在。

因此,与其问“这个系统到底是启发式还是概率模型”,不如问:每个阶段分别承担了什么角色。

threshold 可能是运营标准,而不是模型概念

假设一个分类器输出 配送咨询 0.82。服务运营者可能会再设定这样的规则:

条件 处理方式
最高分 0.90 以上 自动回复
最高分 0.60 到 0.90 之间 给客服显示候选建议
最高分低于 0.60 追问更多信息

如下图所示,同一个输出数值要和运营者设定的处理区间分开读。配送 0.82 是最高候选分数,但它没有达到 0.90 的自动回复阈值,所以在这个例子里会落在“显示候选”的区间。

显示配送、支付、退款候选分数,并用 0.60 和 0.90 阈值划分追问、显示候选、自动回复区间的图

这个 threshold 不一定是概率模型本身的一部分,它也可能只是把模型输出转成业务行动的运营标准。Google 的 Machine Learning Glossary 也说明,classification threshold 是由人选定的,它会影响 false positive 和 false negative 的数量。

所以,更安全的读法是:

容易混淆的读法 更安全的读法
高于 0.90 就一定是真的 0.90 以上自动处理 只是运营上设定的规则
threshold 是模型自己学到的参数 threshold 可能是人设定的独立标准
既然有 threshold,这就是概率模型 threshold 也可能只是启发式或政策规则

很多系统里,threshold 更像是压在模型输出之上的一层启发式或运营规则。

启发式和概率模型可以一起工作

它们不是竞争关系,而是可以组合使用。

比如垃圾邮件过滤器:

组成部分 例子
启发式 如果标题符合某种高风险模式,就优先标记
概率模型 根据正文和发件人信息估计垃圾邮件概率
校准 检查像 0.80 这样的输出是否与实际频率相符
运营规则 高于 0.95 直接进垃圾箱,0.70 到 0.95 之间显示警告
人工复核 关键业务邮件不直接自动删除

在这个结构里:

启发式在减少候选或决定先看什么;
概率模型在用数字表达可信程度;
校准在检查这个数字是否值得被当成概率相信;
运营规则则把这些输出接成真正行动。

现代 AI 中的一个额外注意点

在现代 AI 系统里,边界看起来更容易模糊,因为很多数字标准会叠在同一条流程里:

现代场景 容易混淆的地方 更安全的区分方法
LLM 输出生成 把 next-token 概率和提示词技巧混在一起理解 区分模型内部概率与人写的 prompt 启发式
RAG 检索 把检索分数误当成回答事实性 检索分数只表示文档相关度,不等于最终真实性
Agent 执行 把工具调用顺序和模型推理混成一件事 工具顺序可能只是工作流启发式
自动评估 把高分直接当成正确答案 先检查评估函数是否真的反映目标

尤其在生成式 AI 里,“看起来很可信”的输出很容易伪装成“已经验证的事实”。所以,分数、概率、证据、验证和政策层最好始终分开读。

如果把这个直觉再一般化

第一次接触这个主题时,人很容易想把启发式理解成“把不确定性反映到软件里的方式”。放到这本书的表述框架里,更安全的一般化是:

启发式是在不确定性和计算限制下,
让软件能够挑选下一个候选的经验性标准。

概率模型则是用数字或分布表达不确定性,
并让信念能随着证据变化而更新的模型。

这样既保留了初学者直觉里有帮助的部分,也不会把两个标准概念压成同一个词。

检查清单

  • 能说明 heuristicprobabilistic model 不应被当成同义词。
  • 能区分 heuristic scoreprobability
  • 能说明分类 threshold 可能是运营标准,而不是模型本身。
  • 能说明启发式不是在“计算不确定性”,而是在不确定条件下让判断继续成为可能。
  • 能说明同一个系统里可以同时存在启发式、概率模型、校准与运营规则。

来源与参考资料