核心事件:微软提交法律文件反驳 NYT 版权诉讼
微软在针对《纽约时报》及书籍作者的版权诉讼中提交法律文件,称其 Copilot 聊天机器人极少完整复现新闻文章和书籍内容。这份文件是诉讼中的关键攻防之一:微软请求法官作出简易判决(summary judgment),若获批准,案件可能提前结束。
关键事实要点:
- 微软向新闻出版方聘请的专家提供了 820 万条 Copilot 聊天日志,并称这些日志是因命中与新闻原告网站相关的关键词而被筛选出来,最可能包含争议作品内容
- 微软称,其中 59,545 条包含至少 16 个与用于支撑 AI 模型的新闻内容相同的单词,占比不足 1%
- 书籍作者诉讼中的专家发现,820 万次 Copilot 对话中仅有 24 条回复包含至少 30 个匹配单词;被评估的 212 本书中,只有 10 本出现匹配
- 微软称,中央调查报道中心(CIR)的专家在数据集中发现 51 处“实质性重叠”
数据反差:筛选日志 vs 实际复现频次
微软强调,这 820 万条日志并非随机抽样,而是因命中特定关键词而被筛选出的日志,按其说法,这些记录最可能包含新闻原告作品。因此,微软试图借此证明:即便在更容易出现争议内容的样本中,Copilot 实际复现原文的频率仍然很低。
根据微软在文件中的说法:
- 59,545 条日志包含至少 16 个与新闻内容相同的单词,约占 820 万条日志的 0.7%
- 书籍相关样本中,只有 24 条回复达到至少 30 个匹配单词
- CIR 相关内容中被指出有 51 处“实质性重叠”
这一数据与原告叙事形成明显对照:出版方和作者认为微软与 OpenAI 使用其作品构建商业产品,并可能替代原始新闻和图书内容;微软则认为,偶发的文本重合不足以否定大语言模型训练的转换性用途。
诉讼双方立场与法律逻辑
微软主张,将受版权保护的内容用于 AI 训练数据集应被视为美国版权法下的**“合理使用”(fair use)**。其核心论点是:Copilot 等系统虽然依赖受版权保护的材料训练,但最终用途与原始作品显著不同;偶尔复现部分文字,并不破坏大语言模型训练的转换性目的。
《纽约时报》不同意微软的结论。其首席律师 Ian Crosby 在声明中称,取证阶段披露的文件和证词“只指向一个结论”:微软和 OpenAI 从《纽约时报》窃取内容,用来制造替代其新闻报道、威胁其业务并削弱行业的商业产品。他还表示,期待微软和 OpenAI 为其行为承担责任。
本案中,新闻出版方和书籍作者的相关诉求已被合并到同一名法官名下审理,以简化流程,尽管出版方和作者曾提出反对。微软是在请求简易判决的阶段提交这份文件;若法官支持出版方和作者,案件将继续在法院推进。原文还提到,特朗普政府本周在《纽约时报》相关案件中提交了利益声明,支持 OpenAI。
读者建议与行业影响
适合谁关注、谁该更谨慎:
- 普通 Copilot 用户:微软披露的数据称,直接遇到长段受版权保护内容复现的概率很低,但仍应对 AI 输出保持基本核验
- 内容创作者与媒体从业者:应持续关注案件进展,最终结果可能影响 AI 训练数据的使用边界
- 企业用户:在使用 Copilot 生成对外内容时,仍应保留人工审核流程,尤其是长文本、引用密集或可能涉及版权材料的输出
建议策略:在诉讼尚未尘埃落定前,依赖 Copilot 生成内容的组织应避免直接发布未经核验的长段文本;个人用户可以正常使用,但不应将 AI 输出默认视为无版权风险或事实完全可靠。
写在最后
这起诉讼的核心并不只是 AI 是否“学会”了新闻报道或图书写作风格,而是训练数据使用与最终输出之间的法律关系如何界定。微软提供的筛选日志数据,把争议进一步推向一个关键问题:当大规模系统中只出现零星文本匹配时,是否足以支持系统性侵权指控?这将成为 AI 时代“合理使用”原则的重要检验。



