P1-15.1 偏见(bias)、安全性(safety)、责任(accountability)¶
Section ID:
P1-15.1Version:v2026.07.20
在 P1-14 中,我们已经沿着模型、数据、工具、agent、harness、服务约束(service constraints)的脉络看过 AI 服务结构。现在问题会从技术结构转向社会影响。
AI 可以生成回答。
AI 可以做推荐。
AI 可以做分类与预测。
AI 甚至可以调用工具。如果结果对某些人产生了不公平影响,
那么由谁来解释,又由谁来承担责任?
AI 伦理(AI ethics)并不只是抽象地谈“善意使用技术”。它真正关注的是:当 AI 系统影响人的机会、声誉、安全、权利、成本与工作判断时,会出现什么风险,以及应当如何降低这些风险。
这里先把这个宽泛问题收缩到三个词:偏见(bias)、安全性(safety)、责任(accountability)。
这里讨论 AI 结果为什么会引发社会层面的问题。关于版权(copyright)与训练数据(training data)的争论放到 P1-15.2;安全(security)与隐私(privacy)则放到 P1-15.3。
| 主题 | 本节要看的问题 |
|---|---|
| 偏见(bias) | AI 结果会不会对某些群体或情境不利? |
| 安全性(safety) | AI 结果会不会引发真实伤害或危险行动? |
| 责任(accountability) | 出现问题时,谁能够解释并修正? |
| 透明性(transparency) | 用户是否能理解 AI 的角色与局限? |
| 人类监督(human oversight) | 人应当在什么时候介入并作最终判断? |
这里说的责任,并不是直接下法律定论,而是先从实务角度理解:人们如何审查并使用 AI 生成的结果?
区分偏见、安全性与责任的基准¶
- 把 AI 伦理理解为关于真实可能伤害的问题,而不是抽象宣言。
- 把偏见理解为不仅来自恶意,也可能来自数据、指标与使用情境的问题。
- 把安全性理解为不仅包括物理伤害,也包括错误判断、过度自信与危险自动化。
- 理解责任不能用一句“是 AI 做的”就推出去。
- 在阅读关于 AI 伦理的新闻、专栏与调查报道时,区分事实主张、解释分析与政策建议。
三个基准¶
| 基准 | 为什么重要 | 本节所需的理解水平 |
|---|---|---|
| 偏见不只来自坏意图,也可能来自数据与标准 | 这能防止把 AI 伦理缩成单一道德问题。 | 只要理解成训练数据与评估方式也会扭曲结果即可。 |
| 安全性不只指物理事故,也包括错误自动化 | 这能让读者看到 AI 结果接入现实行动时的风险。 | 只要理解成错误推荐与过度相信也属于安全问题即可。 |
| 责任最终仍然落在人与组织身上 | 这能防止把责任丢给“AI 本身”。 | 只要理解成设计者、运营者、使用组织都有责任即可。 |
为什么伦理问题并不脱离技术问题¶
AI 系统在做计算,但这些计算发生在现实制度与真实人群之中。
数据来自现实世界。
模型从数据中学习模式。
服务为了特定目的被部署。
结果会影响人的判断与行动。
因此,AI 伦理不是一句“善用技术”就能结束的话题。它同时涉及:用了什么数据、怎样评估、谁受到影响、出错之后谁能纠正。
NIST AI Risk Management Framework 把 AI 风险描述为会影响个人、群体、组织、社会与环境的风险,并把 AI 系统视为受到社会环境与人类行为共同塑造的社会技术系统(socio-technical system)。这个视角提醒我们:伦理问题不是技术外部的附属品,而是技术使用条件的一部分。
偏见会从哪里出现¶
偏见(bias) 可能表现为:AI 对某些人、某些群体或某些情境持续地产生不利结果。关键在于,偏见并不一定只来自开发者的恶意。
| 偏见可能出现的位置 | 例子 |
|---|---|
| 数据收集(data collection) | 某些群体的数据过少或被扭曲 |
| 标签(label) | 过去的判断标准直接被写进标签里 |
| 特征(feature) | 即便没有直接的敏感属性,其他变量也可能作为代理(proxy)运作 |
| 评估指标(metric) | 总体准确率高,但某个群体的错误率特别高 |
| 使用情境(context) | 把原本低风险用途的模型拿去做高风险判断 |
ProPublica 关于 COMPAS 的报道之所以成为典型案例,不是因为一篇报道就解决了全部问题,而是因为它逼出了更好的问题:
准确率是对谁测出来的?
哪个群体更容易承受错误?
人类法官是怎样使用 AI 分数的?
受影响的人能否理解并质疑结果?
偏见问题如果只盯着模型内部,很容易看不见。数据、指标、使用情境与申诉机制都必须一起看。
安全性在高风险领域会更明显¶
安全性(safety) 并不只是模型有没有输出“无害句子”。当 AI 结果会连接到真实行动或制度性判断时,安全性问题会变得更广。
| 情境 | 安全性问题 |
|---|---|
| 人脸识别(face recognition) | 识别错误时,谁会承受伤害? |
| 医疗辅助 | 人会不会把输出误当成诊断结果? |
| 法律文书起草 | 系统会不会把不存在的案例或条文写得像真的一样? |
| 招聘或筛选 | 不公平判断是否会重复发生在特定群体身上? |
| agent 工具执行 | AI 会不会错误调用有权限的工具? |
像 Detroit 脸部识别误捕这类报道之所以重要,不是因为它给出了“一律禁止”或“一律允许”的一句话答案,而是因为它留下了更关键的问题:
AI 结果是证据,还是只是线索?
人类是怎样核对 AI 结果的?
一旦误识别造成伤害,受害者如何恢复?
在高风险领域,需要多强的人类复核?
安全性不能只看输出句子的质量,更要看结果如何嵌入现实流程与权力结构。
责任不能交给 AI¶
即便结果是 AI 生成的,责任也不会转移给 AI。AI 是工具,而工具的使用条件由人和组织决定,结果也是由人和组织采纳。
| 角色 | 责任问题 |
|---|---|
| 开发者(developer) | 是否清楚记录了模型与系统的局限? |
| 部署者(deployer) | 是否评估了该用途的风险? |
| 运营者(operator) | 是否准备了日志、评估与故障应对标准? |
| 使用者(user) | 是否未经审查就把结果当成事实使用? |
| 组织(organization) | 如果出现伤害,是否有纠正、暂停与解释程序? |
OECD AI Principles 与 NIST AI RMF 都很有帮助,因为它们把责任、透明性、安全性、鲁棒性、隐私与有害偏见管理整理成可信 AI(trustworthy AI)的条件。
透明性不只是公开内部细节¶
透明性(transparency) 如果只被理解成“公开所有内部模型计算”,就太窄了。对于真实服务,更重要的是用户是否至少能知道下面这些事:
| 透明性问题 | 说明 |
|---|---|
| 是否用了 AI | 用户是否知道 AI 参与了这个结果? |
| 用来做什么 | 这个 AI 的目的是什么? |
| 有什么局限 | 在哪些情况下它可能出错? |
| 依据是什么 | 结果基于哪些输入或资料? |
| 能否申诉 | 如果结果不公,能否要求人类再次审查? |
可解释性(explainability)与可解释/可理解性(interpretability)是其中的一部分,但在这个阶段,更重要的是先抓住:用户能否理解 AI 的角色与边界。
人类监督必须是真实介入,而不是形式审批¶
在 AI 服务中,人们常说“最后会有人类审核”。但如果这种审核只是形式上的,它就不够。
弱的人类监督:
人看了一眼 AI 结果,但几乎总是原样批准。更好的监督:
人会检查依据、错误可能性、受影响对象以及替代判断。
特别是在高风险场景里,人类监督(human oversight)不能变成“盖章动作”。人必须拥有足够的信息、时间与权限,才能真正介入。
| 需要的条件 | 为什么需要 |
|---|---|
| 足够的信息 | 审核者至少要看到结果的基本依据 |
| 中止权限 | 高风险自动化必须可被停止 |
| 申诉渠道 | 受影响的人必须能要求再次审查 |
| 记录机制 | 事后必须能重建当时发生了什么 |
P1-14.5 中讲过的 harness、trace、log、evaluation 会在这里重新变得重要,因为技术记录本身可以成为伦理责任的一部分。
阅读新闻与评论时要小心什么¶
AI 伦理问题常常最先通过报道、评论、调查性新闻被看见,因为它们揭示了真实伤害与真实争议。但把单篇文章当成一条普遍规律,是危险的。
| 阅读时要分开的层次 | 问题 |
|---|---|
| 事实主张 | 什么事件发生了,何时何地发生? |
| 分析解释 | 记者或专家如何解释原因? |
| 反驳 | 公司或机构提出了什么异议? |
| 政策建议 | 有哪些制度变化或规则建议? |
| 可泛化性 | 这个案例能否直接推广到别的 AI 系统? |
因此,本书会把新闻与评论作为重要依据使用,但采用下面的方式处理:
案例展示现实问题。 官方文件与研究整理概念和标准。 正文连接两者,但不从单一案例过度推广。
检查清单¶
- 能把 AI 伦理解释成关于真实可能伤害的问题,而不是抽象宣言。
- 能说明偏见可能来自数据、标签、特征、指标与使用情境。
- 能说明总体准确率与群体特定错误率可能不一致。
- 能把安全性解释为与真实行动、权力与高风险判断相连的问题。
- 能把责任分配到开发者、部署者、运营者、使用者与组织。
- 能把透明性解释为 AI 使用告知、用途、局限、依据与可申诉性。
- 能说明如果人类监督只停留在形式批准,就会很危险。
- 能说明在阅读新闻与评论时,应区分事实、解释、反驳与政策建议。
- 能把
偏见、安全性、责任、透明性、人类监督分开,从而把伦理讨论解释成服务设计条件。
来源与参考资料¶
- NIST, AI Risk Management Framework, National Institute of Standards and Technology, 确认日期: 2026-07-19.
- NIST, Artificial Intelligence Risk Management Framework (AI RMF 1.0), NIST AI 100-1, 2023, 确认日期: 2026-07-19.
- OECD.AI, OECD AI Principles overview, OECD AI Policy Observatory, 确认日期: 2026-07-19.
- UNESCO, Recommendation on the Ethics of Artificial Intelligence, UNESCO, 确认日期: 2026-07-19.
- Julia Angwin, Jeff Larson, Surya Mattu, Lauren Kirchner, Machine Bias, ProPublica, 2016-05-23, 确认日期: 2026-07-19.
- Ed White, Judge dismisses lawsuit against Detroit police in wrongful arrest case, Associated Press, 2025-09-17, 确认日期: 2026-07-19.