P1-4.1 先熟悉 model 这个词¶
Section ID:
P1-4.1Version:v2026.07.20
Chapter 3 说明了从规则式方法转向学习式方法的脉络。Chapter 4 则把这个脉络改写成一个更实际的问题:要把现实问题变成 AI 可以计算的形式,到底需要做什么?
理解这个问题之前,得先熟悉 model 这个词。它在 AI 文档里会反复出现,但一开始常常显得很抽象。这里要做的,不是先建立一个数学上的严格定义,而是先让这个词不再陌生。
在 Part 1 里,model 和 system 的基本区分,以及“model 是一种可计算表示”的视角,会先在这一节固定下来。pattern learning、representation、parameter 的基础脉络已经在 Chapter 3 出现过;这里则把这些内容重新连回一个问题:面对现实问题时,我们要把它变成哪一种可计算表示?
这一节整理以下问题:
- 为什么应该把模型理解成为了某个目的而缩减出来的表示,而不是现实整体本身?
- 在 AI 语境里看一个
model时,应该一起检查什么? - 如果把训练后的模型当成“已经解决了整个现实问题”,为什么会开始混乱?
input、output 和 data 的关系,会在 4.2 里继续说明;feature、representation 和 parameter 会在 4.3 讲得更具体;问题定义怎样改变模型选择,会在 4.4 再整理一次。这里先只把注意力放在一条区分上:model 是一种可计算表示。
把模型读成可计算表示的基准¶
- 把
model和“表示形式”联系起来理解。 - 理解模型不是现实整体,而是为某个目的压缩出来的形式。
- 学会把
target、purpose、simplification和limits放在一起看。 - 区分 AI 模型与“像人一样理解整个现实”不是一回事;模型只是接收规定好的输入并计算规定好的输出。
- 在入门层面理解“训练之后会得到一个模型”这句话。
先连起来的概念¶
这一节是 Part 1 里第一次正式固定 model 和 system 基本区分的代表位置。下面这些概念,先只固定它们在这里的角色;如果之后需要更详细的定义,可以直接回到对应词条再确认。
| 概念 | 这里先固定的意思 | 为什么现在需要 |
|---|---|---|
| model | 接收输入并计算输出的核心计算部件 | 为了把 AI 里的 model 和现实整体区分开 |
| system | 把模型、规则和人工复核包在一起的整体结构 | 为了避免把整个服务误当成一个模型 |
| input | 系统接收到的信息 | 为了看模型到底拿什么做计算材料 |
| output | 系统产生的结果 | 为了看模型到底算出什么 |
三个基准¶
这里真正需要的不是模型的数学定义,而是角色区分。下面三点先构成结构上的基准线。
| 基准 | 为什么重要 | 这一节需要达到的理解程度 |
|---|---|---|
model 是一种为了目的而缩减出来的表示,而不是现实整体 | 这样能避免把 AI 模型读成“像人一样的存在”。 | 可以用地图或建筑模型来理解:它只保留必要部分。 |
看模型时,要把 target、purpose、simplification 和 limits 一起看 | 这样既能看见模型能做什么,也能看见它做不到什么。 | 建立“它保留了什么、舍弃了什么”的阅读习惯。 |
| 模型承担的是狭窄的计算任务,而不是整个现实问题 | 这样会自然连到后面的输入、输出和数据说明。 | 理解模型做的是“给客服消息分类”,而不是“解决客户不满”整体。 |
model、representation、input、output、training、system 是贯穿本节的关键术语。这里首先要留下的大区分是:model 是计算部件,system 是围绕模型展开的更大流程,而 representation 是帮助我们直观理解模型的表达方式。下面正文会再把这些词连起来整理一次。
在一开始,model、system、service 很容易听起来像差不多的词。正式进入 Chapter 14 的服务结构之前,只要先把这三者的层级固定一次,后面的阅读会稳定很多。
| 区分 | 这里先固定的意思 | 在客服消息处理里的样子 |
|---|---|---|
| model | 接收输入并计算输出的核心计算部件 | 读入消息文本并计算 退款、配送、换货 候选的分类模型 |
| system | 把模型、规则、人工复核和执行步骤合在一起的工作结构 | 消息接收、模型分类、人工复核、真实处理流程合起来的结构 |
| service | 用户实际接触到的提供形式和运行结构 | 客服网页应用、坐席界面、订单查询、记录存储和整体响应体验 |
这里最关键的区分是:model 负责计算,system 负责处理结构,service 是用户实际遇到的提供形式。Chapter 14 会在这层区分上,再把应用、数据、工具和流程协调加进去,扩展成完整服务结构。
先把 model 理解成一种表示¶
对很多读者来说,model 像一个很抽象的外来词。把它和“表示形式”一起读,会更容易看清:它不是现实本身,而是为了某个目的压缩出来的形式。
想想建筑模型。它不是真正的建筑,人不能住进去,水电也不会真的流动,但它能帮助我们理解建筑的大小、布局和结构。
地图也类似。地图不是城市本身,但它通过压缩和整理道路、河流、建筑和车站,帮助我们找到方向。
AI 模型也可以这样理解。
model = 不是现实的完整复制品,而是为了某个目的缩减出来的可计算表示
Stanford Encyclopedia of Philosophy 的 Models in Science 条目指出,很多科学模型只是代表世界中被挑选出来的部分或侧面。它也说明,即使是比例模型,也不可能在所有方面都完全忠实,而只会在特定方面保持对应。这种视角对理解 AI 模型同样重要。模型不是装下全部现实的容器,而是为了某个目标而选取、组织现实一部分的表示。
这个比喻当然不是完整定义,但它很适合拿来作为 Chapter 4 的起点。这里重要的不是把模型想成一个“聪明的存在”,而是把它看成一种为了目的而缩减出来的表示。
在这个比喻里最需要读出来的是:模型不是把现实原样复制下来,而是 只留下必要部分,让它变得可计算。只有先固定这个区分,后面才能把输入、输出、数据和特征分开读。
看 model 时要一起确认的四件事¶
看到 model 这个词时,如果把下面四个问题一起问出来,混乱会明显减少。
| 问题 | 含义 | 客服消息分类里的例子 |
|---|---|---|
| 它的 target 是什么? | 它在处理哪一部分现实? | 客服消息处理工作 |
| 它的 purpose 是什么? | 为什么要做这个模型? | 为了更快地给消息分类 |
| 它做了什么 simplification? | 现实里哪些部分被保留下来? | 只保留消息文本和消息类型 |
| 它的 limits 是什么? | 它看不到或解决不了什么? | 客户情绪、政策变化、真实退款处理 |
把这四件事一起看,才会同时看见模型为什么有用,以及它做不到什么。好的模型说明不只讲 它能做什么,也会讲 它排除了什么。
为什么叫 model¶
英文里的 model,和“缩小形式”“样板”“设计图”这些含义有关。Online Etymology Dictionary 也会把它早期的意义连到比例模型和建筑设计图上。
到了科学和工程语境里,这个词逐渐扩展成一种意思:当现实太复杂、无法直接处理时,人们会用一个简化表示来替代现实。到了机器学习里,它又进一步用来指通过学习得到的计算结构。Google 的 Machine Learning Glossary 把模型说明成:接收输入数据并返回输出的数学构造,也把它说明成进行预测所需的结构与参数组合。
所以在 AI 里,可以把 model 理解成下面这样:
现实太难直接处理,所以我们只选出对当前目的有用的部分,把它压缩成可计算的形式。这个结果就可以叫作 model。
这一节前面会先把 model 和 “representation” 一起读,之后再按 AI 文献里更常见的用法继续称作 model。
model、input、output、training、system 很容易听成一整团。这里先把它们作为代表性的基准整理一次,后面再在这个区分上理解 model 和 system 的差别。
| 术语 | 很短的意思 | 在客服消息分类里的样子 |
|---|---|---|
| model | 为了目的缩减出来的可计算表示 | 读入消息文本并计算分类候选的结构 |
| input | 模型接收的值 | 客户写下的客服消息 |
| output | 模型算出来的结果 | 退款、配送、换货、其他 这样的类别或分数 |
| training | 调整模型内部标准的过程 | 用过去消息和标签去校准标准的阶段 |
| system | 包含模型在内的整体处理结构 | 消息接收、模型分类、人工复核和真实处理流程的整体 |
这里最先要保留的区分是:model 是负责计算的核心部件,system 是把这个模型包进去的整体流程。
模型不会解决整个现实问题¶
一旦把模型想成“解决了整个现实问题”,混乱就会开始。模型只负责一项被人划定出来的较窄任务。
例如,我们想减少客户不满 是一个现实问题。这里面会缠在一起的,包含配送政策、客服质量、商品质量、退款规则,以及客户情绪。
但一个客服消息分类模型不会解决这一切。它承担的是更窄的任务。
它接收一条客服消息作为输入。
它输出退款、配送、换货、其他之一。
这表示模型并不是在解决“减少客户不满”这个整体,而是在帮助这个更大目标的一项小计算任务。
| 更宽的现实问题 | 模型可能承担的更窄任务 |
|---|---|
| 我们想减少客户不满 | 给客服消息分类 |
| 我们想减少配送问题 | 预测延迟风险 |
| 我们想减少文档工作 | 生成文档草稿 |
| 我们想更快响应故障 | 检测异常 |
人的判断和模型的计算不是一回事¶
人看问题时,会把经验、记忆、语境、情绪、责任和例外情况一起考虑。
模型不会那样宽地看。模型只会看到 system 交给它的输入,然后产生规定格式的输出。
| 区分 | 人 | 模型 |
|---|---|---|
| input | 句子、情境、经验、记忆、语境 | system 提供给它的数据 |
| processing | 理解、判断、提问、负责任地做选择 | 学到的或被设计好的计算 |
| output | 语言、行动、决定、暂缓、追加确认 | 分类、分数、概率、推荐、生成文本 |
例如,模型输出了 退款,并不代表退款流程已经自动完成。政策检查、人工复核、安全程序和客户沟通可能仍然要继续。这些属于 system,不是 model 本身。
同样的区分也适用于聊天机器人服务。读者很容易把整个聊天机器人都叫作“模型”,但真实服务通常并不只是一个模型。
| 服务里的元素 | 更接近 model 还是 system? | 为什么 |
|---|---|---|
| 根据用户问题计算下一句回复的 LLM | 更接近 model | 因为它是根据输入计算输出的核心部件 |
| 禁词检查、隐私遮罩、转人工规则 | 更接近 system | 因为它们决定模型输出怎样被控制和使用 |
| 会话记录存储、支付查询 API、客户界面展示 | 更接近 system | 因为它们负责真实服务行为和外部连接 |
这样去看,模型表现很好 和 服务运转很好 就不是同一句话。即使模型本身不错,如果政策规则、外部数据连接或人工复核流程很弱,整个 system 依然会不稳定。
再往前一步,真实服务里还可能不止一个模型。比如客服系统可能先用一个 意图分类模型 算出退款、配送、换货等候选,再用一个 紧急度预测模型 判断哪些消息要更快转给人工。其上还可能叠加规则过滤和人工复核。对初学者最重要的不是 一个服务 = 一个模型,而是 一个服务可以是把多个模型、规则和流程绑在一起的 system。
“训练后得到模型”是什么意思¶
在学习式 AI 里,人不会把每一条规则都直接写出来,而是利用过去的案例去调整模型内部的标准。更准确地说,是模型生成输出时依赖的结构和数值,会在训练过程中被调整。
Google 的机器学习入门资料把监督学习说明成:向模型提供带标签的例子,让它学习特征和标签之间的关系。在这一节里,可以先把它更简单地理解成下面这样:
data = 过去的案例
training = 让模型的标准和数值去贴合这些案例的过程
trained model = 已经被调整到可以处理新输入的一种表示
例如,一个客服消息分类模型可能会看到这些案例:
| 输入 | 希望输出 |
|---|---|
我想退款。 | 退款 |
可以取消付款吗? | 退款 |
配送什么时候到? | 配送 |
如果明天还不到我就取消。 | 配送 |
模型会通过这类案例不断调整输入和输出之间反复出现的关系。训练结束后,它就能面对还没分过类的新消息,计算哪个输出更接近。所以“训练之后得到模型”这句话,可以理解成:一种可计算表示已经通过数据被调整到能处理新输入。
这仍然是简化过的解释。feature、representation 和 parameter 在模型内部是怎样工作的,会在 4.3 再讲。
简短练习:先分清角色¶
看下面这些场景,先把它们分到 模型做的事、系统做的事、两者一起做的事 里。
| 场景 | 先问什么 | 按这一节标准得到的第一判断 |
|---|---|---|
根据消息文本算出 退款 或 配送 | 它是不是在根据输入直接计算类别或分数? | 更接近 model 做的事 |
| 按政策和订单状态检查是否真的能退款 | 它是不是要在计算之后继续做业务和状态检查? | 更接近 system 做的事 |
| 把低置信度案例送去人工复核 | 它是不是在规定输出会怎样被使用? | 更接近 system 做的事 |
| 用过去消息和标签调整分类标准 | 它是不是在通过数据改变内部标准? | 更接近模型训练 |
| 对敏感案例不自动处理,而是把规则和模型结果一起看 | 它是不是同时需要计算和流程控制? | 更接近 model 和 system 一起做的事 |
这个练习的关键,是降低“模型解决了一切”的误解。模型通常只承担更窄的计算任务,而真实服务行为是由规则、人工复核、政策、存储和执行流程组成的 system 来支撑的。
Checklist¶
- 我可以把
model和“表示形式”连起来解释。 - 我可以解释:模型不是现实整体,而是为了目的缩减出来的可计算表示。
- 我可以把模型和它的 target、purpose、simplification、limits 一起看。
- 我可以说明:模型输出并不会自动等于真实行动或最终解决。
- 我可以解释:所谓“训练后得到模型”,指的是内部标准已经被过去案例调整过。
- 我可以说明:model 是为了某个目的而缩减出来的可计算表示,而 system 是围绕这个 model 展开的更大流程。
- 我可以把模型负责的计算,与 policy、复核、存储和执行流程在 system 里的作用分开说明。
出处与参考资料¶
- Google for Developers, Supervised Learning, 确认日期: 2026-06-22.
- Google for Developers, Machine Learning Glossary, 确认日期: 2026-06-22.
- Stanford Encyclopedia of Philosophy, Roman Frigg and Stephan Hartmann, Models in Science, 首次公开: 2006-02-27, 主要修订: 2025-04-02, 确认日期: 2026-06-22.
- Online Etymology Dictionary, Douglas Harper, model, 确认日期: 2026-06-22.