跳转至

P1-15.2 版权(copyright)与训练数据(training data)

Section ID: P1-15.2 Version: v2026.07.20

在 P1-15.1 中,我们看过当 AI 结果影响人和社会时,应如何理解偏见(bias)、安全性(safety)、责任(accountability)。接下来问题会更具体:

AI 看起来像是读了很多资料并“学会了”某些模式。
这些资料可能包括书籍、文章、图像、代码、博客。
那么,在 AI 训练或生成过程中,别人的受版权保护作品究竟处于什么位置?

版权(copyright) 并不是 AI 时代才新出现的问题。但生成式 AI(generative AI)让版权问题变得更复杂。人类在书里引用一句短话,和大规模收集数据来做模型训练(training),并不是同一类问题。

这里不会强行给出最终法律结论,而是从“制作并公开发布一本中文/韩文学习书”的视角,整理哪些概念必须分开看,哪些材料使用应先暂停,哪些依据必须留下。

这里讨论版权与训练数据争议的主要检查点。安全(security)、隐私(privacy)与机密信息泄露,则放到 P1-15.3。

主题 本节要看的问题
版权(copyright) 哪些表达与材料可能受到保护?
引用(quotation) 在书稿正文中,可以使用多少外部文字?
训练数据(training data) 为什么 AI 模型训练使用的材料会引起争议?
生成输出(output) 如果 AI 输出与现有作品太相似,会出现什么问题?
写作规则(authoring rule) 这本书应避免哪些材料使用方式?

这里先以韩国著作权法为主要参照,同时承认:围绕生成式 AI 训练的法律制度与判例,在不同国家仍处于持续发展之中。

分开阅读版权与训练数据的基准

  • 区分版权(copyright)、许可证(license)、出处标示(attribution)、引用(quotation)。
  • 区分想法(idea)、事实(fact)、表达(expression)。
  • 说明为什么书稿正文中的引用,与 AI 的训练数据使用,不是同一个问题。
  • 理解权利人(rightsholder)与 AI 开发者在生成式 AI 训练数据争议中各自主张什么。
  • 说明为什么这本书不应把付费出版物、封闭课程资料、未授权 PDF 作为 AI 输入。

三个基准

基准 为什么重要 本节所需的理解水平
版权主要保护的是表达,而不是想法本身 这能把“参考主题”与“复制句子”区分开。 只要理解成概念本身与具体句子、图表要分开判断即可。
书中的引用与 AI 训练数据使用不是同一问题 这能减少“只要写出处就都没问题”的误解。 只要理解成人在可见正文里引用,和模型大规模学习数据,是不同争点即可。
这本书对资料使用必须采取保守标准 这会直接连到实际写作规则。 只要理解成付费出版物、封闭课程资料、未授权 PDF 不应作为输入即可。

版权保护的是表达

版权并不让人独占一切想法。通常受到保护的,是想法、感受、信息或编排的具体 表达(expression)

通常较难单独成为保护对象的:
AI 伦理这个主题
“写书时要注意版权”的想法
“设计一个机器学习课程”的点子

可能成为保护对象的:
某本书中的具体句子
某套讲义中的解释结构与图示
某篇文章或专栏使用的表达
某张图片、某个表格、某段代码示例

这对写书很重要。得出“AI 导论里应该谈版权”这种结论,和直接搬运某本书的句子、章节顺序、示例或图表,是完全不同的事。

出处标示(attribution) 很重要,但仅仅写出来源,并不会自动授权一切使用。出处标示可能是合法使用的一个条件,但它不能取代许可(permission)、license,或法律上对引用的要求。

引用与训练数据不是同一类问题

在书稿中短句引用外部资料,与把大规模资料作为 AI 训练数据(training data),涉及的是不同争点。

区分 书稿中的引用 AI 训练数据使用
出现位置 出现在读者可见的正文中 进入模型训练过程内部
规模 应限制在必要范围内 可能涉及大规模收集与复制
来源可见性 读者可以核对来源 训练数据来源常常不透明
目的 解释、批评、研究、教育辅助 提升模型性能、提供服务、可能商业化使用
主要风险 过度引用、替代原文、缺少出处 未授权复制、市场替代、输出相似、透明性不足

韩国著作权法第 28 条的意思是:为了报道、批评、教育、研究等目的,可以在正当范围内、依照公正惯例引用已经公表的作品。这并不等于一句简单规则:

只要写了出处就都可以

自己的正文仍然必须是主体,被引用部分必须保持从属位置,而且分量不能超过必要范围。

同一部法律的第 35 条之 5 还处理更一般意义上的公正利用。它要求同时考虑:使用目的与性质、作品种类与用途、使用部分的比重与重要性,以及对现有市场或潜在市场的影响。

第 37 条则另外要求,在依这些规定利用作品时应注明出处。所以出处标示当然重要,但“写了出处”并不是万能许可。版权审查不是一个勾选框,而是几个条件一起判断的问题。

因此,审查问题不能被简化成:

只要写了出处就行吗?

还必须同时问:

用了什么材料?
为了什么目的?
用了多少?
以什么方式用了它?

训练数据争议的核心

在生成式 AI 中,训练数据(training data) 是模型用来学习模式的材料。当这些材料包含公开网页、书籍、文章、图像或代码等受版权保护内容时,争议就会出现。

权利人(rightsholder)通常会提出下面这些问题:

权利人视角下的争点 说明
未授权复制(reproduction) 为训练而收集、保存、处理作品,可能构成复制
市场替代(market substitution) AI 输出或服务可能替代原作品需求
透明性(transparency) 很难确认究竟哪些材料被用于训练
输出相似性(output similarity) 生成结果可能与现有作品表达过于接近

AI 开发者或服务提供者则常提出这些主张:

AI 开发者侧主张 说明
变形性使用(transformative use) 主张其目的在于统计模式学习,而不是重发原作品
合理使用(fair use) 在美国法语境下尤为重要的抗辩点
文本与数据挖掘(text and data mining, TDM) 某些司法辖区会讨论研究与分析例外
输出控制(output control) 通过过滤、政策与评估减少过度相似输出

关键在于:这场争议并没有被一个简单答案彻底解决。不同国家、不同材料类型、不同使用目的、不同市场影响、不同输出行为、不同合同和许可证,都会让结论不同。

诉讼与报道告诉了我们什么

《纽约时报》起诉 OpenAI 与 Microsoft 之所以重要,不是因为它已经给出最终法律结论,而是因为它具体提出了:新闻内容未经许可被用于训练,以及生成输出可能替代原始报道的争议。

美国版权局(U.S. Copyright Office)的材料同样有用,因为它们系统整理了围绕 AI 与版权的法律和政策讨论,尤其包括生成式 AI 训练问题。但这些材料并不能直接替代韩国著作权法下的判断。

把生成式 AI 看成一条 供应链(supply chain) 的研究也很有帮助,因为它会把问题拆成:数据收集、模型训练、提示词输入、输出生成、部署、使用。这样就能避免过度简化,例如:

“AI 做的,所以当然没问题”

“只要用于训练,就一定构成侵权”

对韩国出版物的写作规则

这本书会作为公开发布的网页书稿,因此必须比私人笔记采取更严格的材料使用标准。

材料类型 本书中的规则
付费教材或电子书 不把原文贴进 AI 工具,也不要求 AI 直接总结原书
未授权扫描件或复制 PDF 不使用
书店目录 不长篇复制,只在主题层面参考
论文与官方文档 核对原文,只引用与主张真正相关的部分
新闻与专栏 用来介绍事件与观点,同时区分事实与解释
图表与图像 未确认许可前不直接复制,必要时自行重绘
代码示例 不直接粘贴外部代码,尽量自写示例

尤其要避免:

按书的章节目次长篇照搬目录
把课堂讲义说明改写得像自己原创
把付费电子书喂给 AI 再变成总结
重用习题集中的题目与答案
只加一个出处,就长段复制新闻正文

本书真正需要的,不是替代原作的摘要,而是参考多个公开资料后,把主题与概念重新组织成适合初学者再学习的结构。

生成结果也必须被审查

一句话即便是 AI 生成的,也不会自动消除版权风险。如果输出和现有作品太相似,或者过度追随某篇文章、某本书、某套讲义的结构,仍可能成为问题。

审查问题 为什么重要
措辞是否与特定原文过于接近? 这是复制表达的风险
是否过度跟随某本书的目录结构? 这是选择与编排相似性的风险
是否在没有来源时断言事实? 这是无依据主张与虚假归因风险
引用部分是否比本书正文更重要? 这是破坏主从关系的风险
是否足以替代读者查看原作? 这是市场替代风险

AI 草稿始终需要人工审查。“是 AI 写的”并不会减少责任。

检查清单

  • 能说明版权主要保护的是具体 表达(expression),而不是想法本身。
  • 能区分出处标示、许可、license 与引用审查。
  • 能说明韩国著作权法第 28 条中的引用要求正当范围与公正惯例。
  • 能说明第 35 条之 5 的公正利用需要把目的、性质、分量与市场影响一起判断。
  • 能说明第 37 条要求注明出处,但出处标示本身并不自动授权一切使用。
  • 能说明书稿中的引用与 AI 训练数据使用是不同问题。
  • 能区分权利人与 AI 开发者在训练数据争议中的主要主张。
  • 能说明诉讼与报道展示的是争议案例,而不是最终法律结论。
  • 能说明为什么付费电子书、未授权 PDF、封闭课程资料不应作为本项目的 AI 输入。
  • 能说明为什么 AI 输出也要审查其是否与既有作品实质性相似。
  • 能把 表达保护引用审查训练数据争议材料使用暂停标准 分开来说明版权审查。

来源与参考资料