P1-15.2 版权(copyright)与训练数据(training data)¶
Section ID:
P1-15.2Version:v2026.07.20
在 P1-15.1 中,我们看过当 AI 结果影响人和社会时,应如何理解偏见(bias)、安全性(safety)、责任(accountability)。接下来问题会更具体:
AI 看起来像是读了很多资料并“学会了”某些模式。
这些资料可能包括书籍、文章、图像、代码、博客。
那么,在 AI 训练或生成过程中,别人的受版权保护作品究竟处于什么位置?
版权(copyright) 并不是 AI 时代才新出现的问题。但生成式 AI(generative AI)让版权问题变得更复杂。人类在书里引用一句短话,和大规模收集数据来做模型训练(training),并不是同一类问题。
这里不会强行给出最终法律结论,而是从“制作并公开发布一本中文/韩文学习书”的视角,整理哪些概念必须分开看,哪些材料使用应先暂停,哪些依据必须留下。
这里讨论版权与训练数据争议的主要检查点。安全(security)、隐私(privacy)与机密信息泄露,则放到 P1-15.3。
| 主题 | 本节要看的问题 |
|---|---|
| 版权(copyright) | 哪些表达与材料可能受到保护? |
| 引用(quotation) | 在书稿正文中,可以使用多少外部文字? |
| 训练数据(training data) | 为什么 AI 模型训练使用的材料会引起争议? |
| 生成输出(output) | 如果 AI 输出与现有作品太相似,会出现什么问题? |
| 写作规则(authoring rule) | 这本书应避免哪些材料使用方式? |
这里先以韩国著作权法为主要参照,同时承认:围绕生成式 AI 训练的法律制度与判例,在不同国家仍处于持续发展之中。
分开阅读版权与训练数据的基准¶
- 区分版权(copyright)、许可证(license)、出处标示(attribution)、引用(quotation)。
- 区分想法(idea)、事实(fact)、表达(expression)。
- 说明为什么书稿正文中的引用,与 AI 的训练数据使用,不是同一个问题。
- 理解权利人(rightsholder)与 AI 开发者在生成式 AI 训练数据争议中各自主张什么。
- 说明为什么这本书不应把付费出版物、封闭课程资料、未授权 PDF 作为 AI 输入。
三个基准¶
| 基准 | 为什么重要 | 本节所需的理解水平 |
|---|---|---|
| 版权主要保护的是表达,而不是想法本身 | 这能把“参考主题”与“复制句子”区分开。 | 只要理解成概念本身与具体句子、图表要分开判断即可。 |
| 书中的引用与 AI 训练数据使用不是同一问题 | 这能减少“只要写出处就都没问题”的误解。 | 只要理解成人在可见正文里引用,和模型大规模学习数据,是不同争点即可。 |
| 这本书对资料使用必须采取保守标准 | 这会直接连到实际写作规则。 | 只要理解成付费出版物、封闭课程资料、未授权 PDF 不应作为输入即可。 |
版权保护的是表达¶
版权并不让人独占一切想法。通常受到保护的,是想法、感受、信息或编排的具体 表达(expression)。
通常较难单独成为保护对象的:
AI 伦理这个主题
“写书时要注意版权”的想法
“设计一个机器学习课程”的点子可能成为保护对象的:
某本书中的具体句子
某套讲义中的解释结构与图示
某篇文章或专栏使用的表达
某张图片、某个表格、某段代码示例
这对写书很重要。得出“AI 导论里应该谈版权”这种结论,和直接搬运某本书的句子、章节顺序、示例或图表,是完全不同的事。
出处标示(attribution) 很重要,但仅仅写出来源,并不会自动授权一切使用。出处标示可能是合法使用的一个条件,但它不能取代许可(permission)、license,或法律上对引用的要求。
引用与训练数据不是同一类问题¶
在书稿中短句引用外部资料,与把大规模资料作为 AI 训练数据(training data),涉及的是不同争点。
| 区分 | 书稿中的引用 | AI 训练数据使用 |
|---|---|---|
| 出现位置 | 出现在读者可见的正文中 | 进入模型训练过程内部 |
| 规模 | 应限制在必要范围内 | 可能涉及大规模收集与复制 |
| 来源可见性 | 读者可以核对来源 | 训练数据来源常常不透明 |
| 目的 | 解释、批评、研究、教育辅助 | 提升模型性能、提供服务、可能商业化使用 |
| 主要风险 | 过度引用、替代原文、缺少出处 | 未授权复制、市场替代、输出相似、透明性不足 |
韩国著作权法第 28 条的意思是:为了报道、批评、教育、研究等目的,可以在正当范围内、依照公正惯例引用已经公表的作品。这并不等于一句简单规则:
只要写了出处就都可以
自己的正文仍然必须是主体,被引用部分必须保持从属位置,而且分量不能超过必要范围。
同一部法律的第 35 条之 5 还处理更一般意义上的公正利用。它要求同时考虑:使用目的与性质、作品种类与用途、使用部分的比重与重要性,以及对现有市场或潜在市场的影响。
第 37 条则另外要求,在依这些规定利用作品时应注明出处。所以出处标示当然重要,但“写了出处”并不是万能许可。版权审查不是一个勾选框,而是几个条件一起判断的问题。
因此,审查问题不能被简化成:
只要写了出处就行吗?
还必须同时问:
用了什么材料?
为了什么目的?
用了多少?
以什么方式用了它?
训练数据争议的核心¶
在生成式 AI 中,训练数据(training data) 是模型用来学习模式的材料。当这些材料包含公开网页、书籍、文章、图像或代码等受版权保护内容时,争议就会出现。
权利人(rightsholder)通常会提出下面这些问题:
| 权利人视角下的争点 | 说明 |
|---|---|
| 未授权复制(reproduction) | 为训练而收集、保存、处理作品,可能构成复制 |
| 市场替代(market substitution) | AI 输出或服务可能替代原作品需求 |
| 透明性(transparency) | 很难确认究竟哪些材料被用于训练 |
| 输出相似性(output similarity) | 生成结果可能与现有作品表达过于接近 |
AI 开发者或服务提供者则常提出这些主张:
| AI 开发者侧主张 | 说明 |
|---|---|
| 变形性使用(transformative use) | 主张其目的在于统计模式学习,而不是重发原作品 |
| 合理使用(fair use) | 在美国法语境下尤为重要的抗辩点 |
| 文本与数据挖掘(text and data mining, TDM) | 某些司法辖区会讨论研究与分析例外 |
| 输出控制(output control) | 通过过滤、政策与评估减少过度相似输出 |
关键在于:这场争议并没有被一个简单答案彻底解决。不同国家、不同材料类型、不同使用目的、不同市场影响、不同输出行为、不同合同和许可证,都会让结论不同。
诉讼与报道告诉了我们什么¶
《纽约时报》起诉 OpenAI 与 Microsoft 之所以重要,不是因为它已经给出最终法律结论,而是因为它具体提出了:新闻内容未经许可被用于训练,以及生成输出可能替代原始报道的争议。
美国版权局(U.S. Copyright Office)的材料同样有用,因为它们系统整理了围绕 AI 与版权的法律和政策讨论,尤其包括生成式 AI 训练问题。但这些材料并不能直接替代韩国著作权法下的判断。
把生成式 AI 看成一条 供应链(supply chain) 的研究也很有帮助,因为它会把问题拆成:数据收集、模型训练、提示词输入、输出生成、部署、使用。这样就能避免过度简化,例如:
“AI 做的,所以当然没问题”
或
“只要用于训练,就一定构成侵权”
对韩国出版物的写作规则¶
这本书会作为公开发布的网页书稿,因此必须比私人笔记采取更严格的材料使用标准。
| 材料类型 | 本书中的规则 |
|---|---|
| 付费教材或电子书 | 不把原文贴进 AI 工具,也不要求 AI 直接总结原书 |
| 未授权扫描件或复制 PDF | 不使用 |
| 书店目录 | 不长篇复制,只在主题层面参考 |
| 论文与官方文档 | 核对原文,只引用与主张真正相关的部分 |
| 新闻与专栏 | 用来介绍事件与观点,同时区分事实与解释 |
| 图表与图像 | 未确认许可前不直接复制,必要时自行重绘 |
| 代码示例 | 不直接粘贴外部代码,尽量自写示例 |
尤其要避免:
按书的章节目次长篇照搬目录
把课堂讲义说明改写得像自己原创
把付费电子书喂给 AI 再变成总结
重用习题集中的题目与答案
只加一个出处,就长段复制新闻正文
本书真正需要的,不是替代原作的摘要,而是参考多个公开资料后,把主题与概念重新组织成适合初学者再学习的结构。
生成结果也必须被审查¶
一句话即便是 AI 生成的,也不会自动消除版权风险。如果输出和现有作品太相似,或者过度追随某篇文章、某本书、某套讲义的结构,仍可能成为问题。
| 审查问题 | 为什么重要 |
|---|---|
| 措辞是否与特定原文过于接近? | 这是复制表达的风险 |
| 是否过度跟随某本书的目录结构? | 这是选择与编排相似性的风险 |
| 是否在没有来源时断言事实? | 这是无依据主张与虚假归因风险 |
| 引用部分是否比本书正文更重要? | 这是破坏主从关系的风险 |
| 是否足以替代读者查看原作? | 这是市场替代风险 |
AI 草稿始终需要人工审查。“是 AI 写的”并不会减少责任。
检查清单¶
- 能说明版权主要保护的是具体
表达(expression),而不是想法本身。 - 能区分出处标示、许可、license 与引用审查。
- 能说明韩国著作权法第 28 条中的引用要求正当范围与公正惯例。
- 能说明第 35 条之 5 的公正利用需要把目的、性质、分量与市场影响一起判断。
- 能说明第 37 条要求注明出处,但出处标示本身并不自动授权一切使用。
- 能说明书稿中的引用与 AI 训练数据使用是不同问题。
- 能区分权利人与 AI 开发者在训练数据争议中的主要主张。
- 能说明诉讼与报道展示的是争议案例,而不是最终法律结论。
- 能说明为什么付费电子书、未授权 PDF、封闭课程资料不应作为本项目的 AI 输入。
- 能说明为什么 AI 输出也要审查其是否与既有作品实质性相似。
- 能把
表达保护、引用审查、训练数据争议、材料使用暂停标准分开来说明版权审查。
来源与参考资料¶
- 国家法令信息中心, 著作权法, 生效日期 2026-05-11, 确认日期: 2026-07-19.
- U.S. Copyright Office, Copyright and Artificial Intelligence, 确认日期: 2026-07-19.
- U.S. Copyright Office, Copyright and Artificial Intelligence, Part 3: Generative AI Training, pre-publication version, 2025-05-09, 确认日期: 2026-07-19.
- Haleluya Hadero, David Bauder, The New York Times sues OpenAI and Microsoft for using its stories to train chatbots, Associated Press, 2023-12-27, 确认日期: 2026-07-19.
- Katherine Lee, A. Feder Cooper, James Grimmelmann, Talkin' 'Bout AI Generation: Copyright and the Generative-AI Supply Chain, arXiv, 2023, 确认日期: 2026-07-19.
- Daniel M. German, Copyright related risks in the creation and use of ML/AI systems, arXiv, 2024, 确认日期: 2026-07-19.