在围绕人工智能生成内容版权归属的激烈博弈中,微软(Microsoft)近日再次向外界展示了其防御姿态。面对纽约时报(The New York Times)及其它出版商发起的集体诉讼,微软在最新的法律文件中辩称,其旗舰 AI 助手 Copilot 在实际使用中,极少会完整复制新闻文章的句子,更不用说能够替代原作实质内容的文本块。为了证明这一点,微软向法庭提交了超过 820 万个 Copilot 交互样本作为证据。
此次法律交锋的核心在于“生成”与“复制”的界限。微软方面强调,Copilot 的运作机制并非简单的搜索引擎抓取,而是基于海量数据的模型训练。根据微软提供的分析数据,绝大多数情况下,Copilot 生成的内容是对信息的综合与转述,而非对原文的直接照搬。即便在被问及特定新闻事件时,Copilot 往往只能提供简短的摘要或零散的信息片段,难以拼凑出完整的、具有替代性的文章内容。
这一论点直接回应了原告方关于“大规模版权侵权”的指控。出版商和作者认为,AI 公司在训练模型时未经许可使用了受版权保护的材料,导致其作品被“盗用”。然而,微软的法律团队认为,目前的证据表明,用户通过 Copilot 获取的信息量非常有限,且不具备直接替代阅读原版文章的商业价值。这不仅是微软与纽约时报之间的官司,更可能成为整个生成式 AI 行业在版权法框架下如何界定“合理使用”的关键判例。
此外,微软披露的 820 万个样本数据,也揭示了当前 AI 助手在实际应用中的局限性。这表明,尽管 AI 技术发展迅速,但在处理特定领域的深度文本内容时,它依然倾向于提供高层次的概览,而非精准的原文复现。这对于评估 AI 技术对传统媒体行业的冲击程度至关重要。如果法院采纳微软的观点,即 AI 生成内容本质上是对信息的再加工而非直接复制,那么未来 AI 公司在训练数据的使用上可能会获得更大的法律空间。
随着诉讼进入发现程序,双方将继续争夺关于数据使用和模型训练的更多细节。对于科技界而言,这场官司的结果将具有风向标意义,它将决定未来的 AI 创作者是否需要为训练数据的版权付费,以及生成式 AI 技术的边界究竟在哪里。
信息来源:The Verge,原文链接:https://www.theverge.com/policy/990267/microsoft-openai-new-york-times-authors-lawsuit
封面图片来源:Unsplash / 摄影师 BoliviaInteligente
