Featured image of post 微软称 Copilot 极少复现文章内容,版权诉讼聚焦数据争议

微软称 Copilot 极少复现文章内容,版权诉讼聚焦数据争议

微软称 Copilot 极少复现新闻和书籍内容。

核心事件:微软提交法律文件反驳 NYT 版权诉讼

微软在针对《纽约时报》及书籍作者的版权诉讼中提交法律文件,称其 Copilot 聊天机器人极少完整复现新闻文章和书籍内容。这份文件是诉讼中的关键攻防之一:微软请求法官作出简易判决(summary judgment),若获批准,案件可能提前结束。

关键事实要点:

  • 微软向新闻出版方聘请的专家提供了 820 万条 Copilot 聊天日志,并称这些日志是因命中与新闻原告网站相关的关键词而被筛选出来,最可能包含争议作品内容
  • 微软称,其中 59,545 条包含至少 16 个与用于支撑 AI 模型的新闻内容相同的单词,占比不足 1%
  • 书籍作者诉讼中的专家发现,820 万次 Copilot 对话中仅有 24 条回复包含至少 30 个匹配单词;被评估的 212 本书中,只有 10 本出现匹配
  • 微软称,中央调查报道中心(CIR)的专家在数据集中发现 51 处“实质性重叠”

数据反差:筛选日志 vs 实际复现频次

微软强调,这 820 万条日志并非随机抽样,而是因命中特定关键词而被筛选出的日志,按其说法,这些记录最可能包含新闻原告作品。因此,微软试图借此证明:即便在更容易出现争议内容的样本中,Copilot 实际复现原文的频率仍然很低。

根据微软在文件中的说法:

  • 59,545 条日志包含至少 16 个与新闻内容相同的单词,约占 820 万条日志的 0.7%
  • 书籍相关样本中,只有 24 条回复达到至少 30 个匹配单词
  • CIR 相关内容中被指出有 51 处“实质性重叠”

这一数据与原告叙事形成明显对照:出版方和作者认为微软与 OpenAI 使用其作品构建商业产品,并可能替代原始新闻和图书内容;微软则认为,偶发的文本重合不足以否定大语言模型训练的转换性用途。

诉讼双方立场与法律逻辑

微软主张,将受版权保护的内容用于 AI 训练数据集应被视为美国版权法下的**“合理使用”(fair use)**。其核心论点是:Copilot 等系统虽然依赖受版权保护的材料训练,但最终用途与原始作品显著不同;偶尔复现部分文字,并不破坏大语言模型训练的转换性目的。

《纽约时报》不同意微软的结论。其首席律师 Ian Crosby 在声明中称,取证阶段披露的文件和证词“只指向一个结论”:微软和 OpenAI 从《纽约时报》窃取内容,用来制造替代其新闻报道、威胁其业务并削弱行业的商业产品。他还表示,期待微软和 OpenAI 为其行为承担责任。

本案中,新闻出版方和书籍作者的相关诉求已被合并到同一名法官名下审理,以简化流程,尽管出版方和作者曾提出反对。微软是在请求简易判决的阶段提交这份文件;若法官支持出版方和作者,案件将继续在法院推进。原文还提到,特朗普政府本周在《纽约时报》相关案件中提交了利益声明,支持 OpenAI。

读者建议与行业影响

适合谁关注、谁该更谨慎

  • 普通 Copilot 用户:微软披露的数据称,直接遇到长段受版权保护内容复现的概率很低,但仍应对 AI 输出保持基本核验
  • 内容创作者与媒体从业者:应持续关注案件进展,最终结果可能影响 AI 训练数据的使用边界
  • 企业用户:在使用 Copilot 生成对外内容时,仍应保留人工审核流程,尤其是长文本、引用密集或可能涉及版权材料的输出

建议策略:在诉讼尚未尘埃落定前,依赖 Copilot 生成内容的组织应避免直接发布未经核验的长段文本;个人用户可以正常使用,但不应将 AI 输出默认视为无版权风险或事实完全可靠。

写在最后

这起诉讼的核心并不只是 AI 是否“学会”了新闻报道或图书写作风格,而是训练数据使用与最终输出之间的法律关系如何界定。微软提供的筛选日志数据,把争议进一步推向一个关键问题:当大规模系统中只出现零星文本匹配时,是否足以支持系统性侵权指控?这将成为 AI 时代“合理使用”原则的重要检验。

原文配图1
原文配图1|新闻截图

原文配图2
原文配图2|新闻截图

原文配图3
原文配图3|新闻截图