P1-2.3 走向机器学习、深度学习与生成式 AI 的脉络¶
Section ID:
P1-2.3Version:v2026.07.20
2.1 看过符号主义 AI 与规则式方法,2.2 看过搜索、知识表示与概率推理。这一节继续看下一个脉络。为什么 AI 的说明中心会越来越多地转向“从数据中学习的模型”?
这里需要做的,不是完整解释机器学习、深度学习与生成式 AI,而是先从历史角度建立一个解释:为什么说明中心会从 人把规则都直接写出来,移动到 模型从数据和经验中学习。Part 3 会先整理数据建模,Part 4、Part 5、Part 6 会分别深入展开这些结构。
在 Part 1 中,从规则式方法转向学习式方法的历史脉络,以及 data、feature、representation 与 parameter 的基本连接,固定在这里。AI / machine learning / deep learning / generative AI / LLM 的基本关系已在 1.3 先建立;这里再把它们接回到一条历史脉络中。如果这些术语边界之后再次摇晃,就回到这一节和共享的 Concept Glossary (English)。
从写规则转向从数据中学习的理由¶
这一节整理以下问题:
- 为什么有些问题很难只靠规则式方法解决,从而走向数据式学习?
- 机器学习、深度学习与生成式 AI 是通过怎样的历史脉络连接起来的?
- 为什么数据、特征、表征、模型与参数会越来越重要?
这一节先固定 说明中心为什么会转向数据与学习。更细的学习结构会在 Part 3、Part 4、Part 5 与 Part 6 继续展开;这里集中把这种移动整理成一条大的历史脉络。
连接数据、特征、表征与参数的基准¶
- 理解为什么有些问题很难只靠规则式方法解决,而转向数据式学习。
- 把机器学习、深度学习与生成式 AI 放到同一条历史脉络中区分。
- 看清为什么数据、特征、表征、模型与参数会变得重要。
- 把生成式 AI 与 LLM 理解成累积脉络的结果,而不是突然断裂的例外。
先连起来的概念¶
这一节是把说明中心转向学习式方法的脉络,与核心学习术语一起固定下来的代表位置。下面这些概念先只固定角色;如果之后需要更完整定义,再回到对应术语条目。
| 概念 | 这里先固定的意思 | 为什么现在需要 |
|---|---|---|
| data | 学习与判断的材料 | 为了看见模型不是从手写规则,而是从什么材料里学习标准 |
| feature | 先由人整理或选出的线索 | 为了理解早期机器学习依赖怎样的输入表示 |
| representation | 模型内部处理数据的形式 | 为了看出深度学习为何常被解释为表征学习 |
| parameter | 在学习中被调整的内部值 | 为了固定“学习到底改变了什么” |
| machine learning | 从数据中提高性能的学习式方法 | 为了理解为什么中心会从写规则转向训练模型 |
| deep learning | 以神经网络为基础、强烈依赖表征学习的方法 | 为了理解从特征设计转向学习表征 |
| generative AI | 生成新内容的模型与服务类别 | 为了看清最近这条技术流延伸到了哪里 |
主要学习内容¶
这里是在整理现代 AI 的大脉络。下面三个基准构成整体地图。
| 基准 | 为什么重要 | 这一节需要达到的理解程度 |
|---|---|---|
很多问题很难靠把规则全部写清,因此中心转向了 数据式学习 | 这样才容易理解为什么机器学习走到中心位置。 | 先区分:很多问题对手写标准来说过于复杂。 |
机器学习、深度学习与生成式 AI 是 连接起来的脉络,而不是互不相干的流行词 | 这样众多术语才能放在同一张图上阅读。 | 把它整理成 数据学习 -> 表征学习 -> 生成 的脉络。 |
LLM 是 最近很强的一条流,不是整个 AI | 这样不会把今天的产品体验误读成全部历史。 | 把 LLM 视为生成式 AI 的代表案例。 |
data、feature、representation、model 与 parameter 是这一节里反复出现的核心术语。首先要留下的基准是:data 是材料,feature 是人先整理好的线索,representation 是模型内部使用的形式,model 是从输入映射到输出的计算结构,而 parameter 是学习过程中被调整的内部值。下面正文会再把这些术语组织一次。
细化学习内容¶
很难把所有规则都写出来的问题¶
规则式方法在“人能够明确写下判断标准”的场景里仍然很强。在业务审批、权限检查、政策应用、简单分类等标准较清楚的问题里,它仍然有用。
但现实中有很多问题,很难完整写成规则。
| 问题 | 为什么难以完整写成规则 |
|---|---|
| 从照片识别物体 | 人无法把所有有用的像素组合都现实地写成规则 |
| 理解自然语言句子 | 语境、省略、歧义与表达变化太多 |
| 判断邮件是否是垃圾邮件 | 只看几个词不够,而且攻击者会持续回避 |
| 预测客户流失 | 行为模式复杂,而且会随时间变化 |
| 语音识别 | 发音、语调、噪声与录音环境不断变化 |
在这些问题里,更重要的问题就不再是 人该写什么规则?,而是 模型能从数据中学到什么关系? 机器学习正是把这个问题放在中心。
即便在同一个业务流程里,有些部分仍然可以靠规则撑住,有些部分则必须交给学习。把这道分界线放在一起看,会更清楚说明中心为什么会移动。
| 同一个客服流程中的场景 | 为什么规则式方法适合 | 为什么学习式方法变得必要 |
|---|---|---|
| 检查退款可用期限 | 政策条文可以由人明确写出 | 即使有例外,标准本身仍相对清楚 |
| 分类客户咨询意图 | 可以先写一些关键词规则 | 表达方式很多,而且含义会随语境变化 |
| 决定紧急咨询优先级 | 有些标准可以写出来 | 需要同时看过去处理历史与多种信号组合 |
这张表的关键,不是说规则失去价值,而是说:即使在一个真实问题里,能够写显式标准的部分 与 必须从数据中学习关系的部分 也会分开。Chapter 3 会把这条分界再收窄一些,进一步看规则式系统的优势与限制,以及从数据里学习模式的结构。
Stanford Encyclopedia of Philosophy 的 AI 条目把机器学习系统描述为:在给出示例后,可以改进某项任务性能的系统。从这个角度看,学习不是人把所有规则都写出来,而是通过数据与经验来调整模型的判断标准。
机器学习:从写规则走向训练模型¶
机器学习,是一种使用数据或经验来提高模型(model)性能的方法。这里的模型,是接收输入并输出预测、分类、推荐、分数或行动的计算结构。
data or experience -> learning -> model -> prediction or classification or recommendation or action
规则式方法与机器学习可以这样对照。
| 区分 | 规则式方法 | 机器学习方法 |
|---|---|---|
| 判断标准 | 人显式写下的规则 | 从数据训练出来的模型 |
| 开发者的中心工作 | 写规则、处理例外、管理规则冲突 | 准备数据、设计特征、训练与评估 |
| 优势 | 解释与控制相对更容易 | 可以从数据中学到复杂模式 |
| 弱点 | 面对例外与变化时会变脆弱 | 会出现数据质量、偏差、过拟合与可解释性问题 |
| 错误复核 | 检查规则是否正确 | 检查训练数据与评估结果 |
机器学习并不是单一一种方式。监督学习(supervised learning) 从带答案的例子里学习输入与输出之间的关系。无监督学习(unsupervised learning) 在没有答案的情况下寻找数据内部结构。强化学习(reinforcement learning) 则通过行动之后返回的奖励来学习更好的行为方式。
这一节只固定这三种学习类型的名称。更详细的内容会在 Part 1 Chapter 8 回来处理。
| 学习类型 | 英文术语 | 最基本的问题 |
|---|---|---|
| 监督学习 | supervised learning | 给定输入时,应预测什么答案或数值? |
| 无监督学习 | unsupervised learning | 没有答案时,应如何发现数据里的结构? |
| 强化学习 | reinforcement learning | 当行动的结果以后续奖励返回时,应学到什么策略? |
数据挖掘与数据式判断的背景¶
走向机器学习,并不只靠 AI 内部变化来解释。它还与数据的大量累积,以及人们希望从数据中发现模式的实际需求一起增长。
Fayyad、Piatetsky-Shapiro 与 Smyth 的 KDD 综述论文把 KDD 描述为从数据中发现有用知识的整个过程,并把 data mining 区分为该过程里利用特定算法抽取模式的阶段。论文还把 KDD 解释成数据库、统计、AI 与机器学习交汇的跨学科活动。
这条流也与数据仓库、BI、DSS 之类的数据式决策工具文化有松散连接。它们本身并不是 AI 模型,但它们扩大了“把数据存下来、分析它、再把分析连接到判断”这一实践环境。
因此,说 AI 从规则走向了数据式判断 是有用的。但 AI 从一开始并不只等于数据式判断。更安全的表达是下面这句。
在原有的规则、搜索、知识表示与概率推理这些层之上,又增加了一层更强的结构,让机器学习能够从数据中学习判断标准。
把核心学习术语再集中整理一次¶
这一节反复出现 data、feature、representation、model 与 parameter。这里把它们先作为代表基准再整理一次,后面历史脉络和案例都默认这个区分。
| 术语 | 英文术语 | 本节先固定的含义 |
|---|---|---|
| data | data | 被观测或存储下来的例子与数值。客户点击日志、产品照片、句子集合都属于 data。 |
| feature | feature | 为了让模型更容易读取而整理出的输入线索。例如邮件中的词数、链接数、发件域名都可以是 feature。 |
| representation | representation | 把数据转换成模型内部可处理形式之后得到的结果。这个词比 feature 更宽,在深度学习里模型往往会和任务一起学习这种 representation。 |
| model | model | 接收输入并输出预测、分类、推荐或生成结果的计算结构。 |
| parameter | parameter | 在学习过程中被调整的模型内部值。它们变化后,同样输入的输出也可能随之改变。 |
在这一阶段,只要先记住 data 是材料、feature 与 representation 是让材料变得可用的方式、model 负责执行判断或生成、parameter 是学习中被调整的内部值 就足够了。
如果 parameter 仍然显得抽象,一个更直观的办法是去想:为什么模型在面对同类输入时,它的回答会不同。比如一个客户流失预测模型同时看 最近 30 天登录次数、最近是否付费 与 客服咨询历史。在学习前,模型并不知道哪项更重要;学习过程中,模型内部的参数被调整,于是它可能会更强烈地看待 最近没有付费,或者更敏感地看待 登录次数下降。换句话说,parameter 不是人写下的规则句子,而是把数据中反复出现的关系反映到模型内部的调节值。
深度学习:从特征设计走向表征学习¶
在机器学习中,数据并不会原样直接进入模型。通常要先把它变成模型能处理的特征(feature)或表征(representation)。
例如,要判断一封邮件是不是垃圾邮件,可以构造词频、发件人信息、链接数量与标题模式等特征。对于图像,也可以想到颜色、边缘、纹理与形状等特征。在传统机器学习里,决定构造什么特征是一项重要工作。
深度学习(deep learning) 大幅改变了这一点。深度学习是一种使用多层神经网络(neural network),并尝试从数据中一并学习有用表征的方法。Stanford Encyclopedia of Philosophy 的 AI 条目也把深度学习与表征学习(representation learning) 连接起来解释。
| 区分 | 传统机器学习的典型流程 | 深度学习的典型流程 |
|---|---|---|
| 特征 | 很多时候由人先设计 | 模型从数据中学习表征 |
| 模型 | 常使用相对较浅的模型 | 使用多层神经网络 |
| 强项 | 对数据较少或结构较清楚的问题有用 | 对图像、语音、语言等复杂输入很强 |
| 负担 | 特征设计与领域知识很重要 | 大量数据、计算资源与评估很重要 |
如果把深度学习理解成与生物大脑完全一样,就会产生误解。神经元与突触的比喻有助于直觉,但人工神经网络并不是生物大脑的复制品。这里更有用的学习表述是:
深度学习是一种优化过程:具有可学习权重(weight) 的多层神经网络,从数据中找到有用的表征和预测规则。
在分类、语言建模、生成模型等输出可被解释为概率的情形里,也可以把深度学习看成“寻找更好的概率预测模型”的尝试。但并非所有深度学习模型都适合直接叫作显式概率模型。因此,这里会把概率模型、表征学习与优化区分开来。
看一个极小的例子,feature 与 representation 的差别会更清楚。
| 问题 | 人可以先构造的特征示例 | 深度学习更直接想学习的表征示例 |
|---|---|---|
| 垃圾邮件分类 | 标题中特定单词数、链接数、发件域名 | 单词组合、句子模式、上下文中异常措辞的内部表征 |
| 产品照片分类 | 平均亮度、边缘数量、某种颜色比例 | 表面纹理、裂纹形状、零件布局等视觉模式的内部表征 |
| 语音识别 | 特定频带强度、片段长度 | 发音模式、语调变化、上下文连贯声音结构的内部表征 |
这张表的关键是:传统机器学习往往更依赖人先设计大量线索,而 深度学习则更倾向于从数据里学习这些线索本身。
生成式 AI:从判断走向生成这一点变得更明显¶
生成式 AI(generative AI) 指的是可以生成文本、图像、音频、视频与代码等新内容的 AI 模型与服务。NIST 的生成式 AI profile 把生成式 AI 描述为:模仿输入数据结构与特征,进而生成派生合成内容的 AI 模型类别,并以图像、视频、音频、文本等数字内容作为例子。
这个定义里最重要的一点是:生成式 AI 不是 会讲事实的机器。它根据训练数据中的结构与模式来生成看起来合理的输出。因此,即使生成结果读起来很自然,也不会自动成为事实。
| 区分 | 中心输出 | 示例 |
|---|---|---|
| classification | 类别 | 正常 / 异常、垃圾 / 正常 |
| prediction | 数值或分数 | 销售预测、流失概率 |
| recommendation | 候选列表 | 商品推荐、文档推荐 |
| generation | 新内容 | 句子、图像、代码、语音 |
这里还要特别小心一个术语:在 AI 语境里,inference 有时是指训练好的模型在使用阶段生成输出的计算过程;而 reasoning 通常指按根据和步骤去解决问题的逻辑性思考。生成式 AI 在 inference 阶段产生输出,并不等于它的输出总是逻辑推导出来的事实。
LLM 在这条脉络中的位置¶
LLM(large language model) 是生成式 AI 中最有代表性的模型家族之一,但它不等于整个生成式 AI。LLM 是主要在语言数据上训练的大规模语言模型。Zhao 等人的 LLM survey 说明,语言模型是从统计语言模型、神经网络语言模型、预训练语言模型逐步发展到大规模语言模型的。
这一节最重要的不是把 LLM 看成突然出现的例外。它可以建立在下面这条脉络之上来理解。
flowchart TD
Rule[显式规则]
Search[搜索与知识表示]
Prob[概率推理]
Data[数据挖掘与机器学习]
Rep[表征学习与深度学习]
Gen[生成式 AI]
LLM[LLM]
Rule --> Search
Search --> Prob
Prob --> Data
Data --> Rep
Rep --> Gen
Gen --> LLM
这张图不该被读成“后一阶段把前一阶段彻底消灭了”。更准确的读法是:随着时间推进,AI 说明中心一层一层地累积出更多结构。这里要读出的关键,是 规则 -> 处理不确定性 -> 数据学习 -> 表征学习 -> 生成 的累积脉络。
这是累积关系,而不是替代关系。现代 AI 服务并不只由 LLM 组成。搜索、数据库、知识图谱、规则式过滤器、权限控制、评估、UI 与运维系统都可能一起存在于同一个产品里。
因此,这一节的 흐름最好读成下面这样。
AI 的说明中心从显式规则和搜索,扩展到了处理不确定性的概率推理,再扩展到从数据中学习模式的机器学习。深度学习极大增强了从数据中学习表征的能力,而生成式 AI 与 LLM 则是这种表征学习、大规模数据、计算资源与语言建模结合后的近期强势案例。
再用系统视角读一遍¶
如果传统软件函数是用人直接写下的逻辑处理输入,那么机器学习模型可以被看成是:利用从数据中学到的参数来处理输入。这个比喻对于学习有帮助,但模型并不等于整个服务。
在真实服务里,下面这样的流程会一起运行。
user request -> input shaping -> model or tool execution -> result review -> response or business handling
有些阶段可以固定成规则,有些可以由搜索增强,有些可以交给模型去预测或生成。关键不是把一切都交给 AI,而是找出那些可以重复、可以验证的部分,再把它们组合成系统。
在这一节,这种视角可以归纳成下面一句话。
现代 AI 服务可以被理解成一种工作流:它把人直接写下的逻辑、从数据中学到的模型、搜索与工具、以及验证步骤组合起来处理请求。
这句话的作用,是防止出现 一个模型就等于整个服务 的误解。这里首先要留下的视角,是 现代 AI 服务是把规则、搜索、模型与验证绑定在一起的系统。
一个简短的脉络区分练习¶
看下面这些案例,先分辨说明中心更接近 写规则、机器学习、深度学习 还是 生成式 AI。
| 案例 | 第一时间要想到的问题 | 最接近的说明中心 |
|---|---|---|
| 在内部费用处理里,根据金额上限和职级规定来决定审批步骤 | 人能否把标准直接写进文档? | 写规则 |
| 根据订阅时长、支付历史和最近登录频率预测客户流失 | 过去案例中反复出现了什么模式? | 机器学习 |
| 自动找出产品照片中很细微的瑕疵痕迹 | 是否应该让模型学习视觉表征,而不是由人把特征全设计出来? | 深度学习 |
| 用户输入一句描述后,系统生成多条广告文案草稿 | 这个任务是否需要生成新的文本内容? | 生成式 AI |
这个练习的重点,不是选择一个时髦词,而是先把问题分成:人直接写标准的问题、必须从数据中学习模式的问题、需要深度学习表征的问题,还是 需要生成新内容的问题。
案例与示例¶
案例 1. 为什么照片分类很难一直靠规则清单撑住¶
想象一条工厂传送带,系统要根据产品照片把产品分成 正常 和 瑕疵。如果由人来写规则,可能会从 裂纹长度超过某个阈值就判为瑕疵、污点数量超过某个阈值就判为瑕疵、颜色比标准更暗就判为瑕疵 这样的条件开始。
这些规则在一开始也许有效,但真实环境很快会引入光照变化、相机角度变化、反光、产品位置差异,以及细微模式差异,这些都会让同一种瑕疵不断呈现不同外观。人看图时也许还能抓住相似感觉,但要把这一切都写成像素层面的规则,很快就会变得困难。
因此,说明中心就会从 还要再写哪些规则? 转向 模型应该从大量正常与瑕疵照片里学到什么模式?。机器学习会设计特征,深度学习会学习更复杂的表征,而生成式 AI 则进一步把这个方向扩展到生成新内容。
这个案例用一句话把 2.3 的历史脉络绑在一起。并不是规则式方法没有用了,而是随着越来越多难以直接写出的复杂输入出现,从数据中学习关系的方法就走到了中心。
检查清单¶
- 我可以解释为什么难以只靠规则式方法解决的问题会走向数据式学习。
- 我可以把机器学习解释成一种利用数据或经验提升模型性能的方法。
- 我可以解释数据挖掘与 KDD 与数据式判断文化相连,但并不完全等同于机器学习。
- 我可以把深度学习解释成一种减少手工特征设计、转而学习表征的神经网络方法。
- 我可以解释生成式 AI 是生成新内容的模型与服务类别,而且生成结果并不会自动等于事实。
- 我可以把 LLM 当成生成式 AI 的代表案例,而不把它等同于整个生成式 AI。
- 我可以把现代 AI 服务看成结合规则、搜索、数据、模型与验证的工作流,而不是单独一个模型。
- 我可以说明机器学习、深度学习、生成式 AI 虽然是不同名称,但可以按
规则 -> 数据学习 -> 表征学习 -> 生成的脉络连接起来阅读。 - 我可以说明后来的方法并没有完全替代前面的做法,规则、搜索、知识表示、概率推理、数据挖掘、机器学习、深度学习与生成式 AI 可能在真实系统中混合出现。
出处与参考资料¶
- Stanford Encyclopedia of Philosophy, Selmer Bringsjord and Naveen Sundar Govindarajulu, Artificial Intelligence, 2018-07-12, 确认日期:2026-06-22.
- Stuart Russell, Peter Norvig, Artificial Intelligence: A Modern Approach, 4th US ed., Full Table of Contents, 确认日期:2026-06-22.
- David L. Poole, Alan K. Mackworth, Artificial Intelligence: Foundations of Computational Agents, 3rd ed., 确认日期:2026-06-22.
- Usama Fayyad, Gregory Piatetsky-Shapiro, Padhraic Smyth, From Data Mining to Knowledge Discovery in Databases, AI Magazine, 1996, 确认日期:2026-06-22.
- NIST, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, NIST AI 600-1, 2024-07, 确认日期:2026-06-22.
- Wayne Xin Zhao et al., A Survey of Large Language Models, arXiv:2303.18223, 确认日期:2026-06-22.