近日,美国西雅图时报和新闻日报正式提起诉讼,将人工智能巨头 OpenAI 及其合作伙伴微软告上法庭。这并非孤立事件,而是传统媒体与 AI 公司之间日益激烈的版权博弈的最新一环。原告指控 OpenAI 在未获得许可的情况下,使用了其大量受版权保护的新闻报道作为 AI 模型的训练数据,并且更为严重的是,AI 生成的回答经常直接复制其文章的原话,这显然侵犯了其知识产权。
这起诉讼的核心在于对“训练数据”合法性的质疑。在生成式 AI 快速发展的背景下,数据成为了最核心的资产。然而,这些数据往往来自互联网上的海量文本,其中包含了大量新闻、文章和书籍。传统出版商认为,这种“抓取”行为本质上是对其劳动成果的掠夺。西雅图时报和新闻日报指出,AI 公司在利用他们的专业写作来构建模型,却未支付任何费用,这种商业模式正在侵蚀媒体行业的生存空间。
除了数据抓取,诉讼还聚焦于 AI 的“输出”环节。原告声称,当用户向 ChatGPT 提问时,AI 经常会生成与西雅图时报或新闻日报文章几乎一模一样的段落。这种现象被称为“数据幻觉”或“复制粘贴”,它不仅损害了媒体的声誉,更直接构成了抄袭。如果这一指控属实,OpenAI 的模型可能存在严重的数据污染问题,即在训练过程中未能有效区分“学习”与“抄袭”。
这一诉讼对整个科技行业具有深远的影响。如果法院判决媒体胜诉,OpenAI 和微软将面临巨额赔偿,并可能被迫改变其数据获取策略。这可能迫使科技巨头与各大媒体机构签署付费授权协议,类似于新闻聚合器(如 Apple News)的模式。这将显著增加 AI 公司的运营成本,但也可能为媒体行业开辟一条新的收入渠道——即向 AI 公司出售数据使用权。
此外,这起案件也可能加速美国国会对于 AI 监管的立法进程。目前,关于 AI 版权的法律界定尚处于模糊地带,“合理使用”原则如何适用于 AI 训练数据,是立法者和法院需要解决的关键问题。西雅图时报和新闻日报的强硬态度,或许能推动行业建立更加透明、合法的数据使用规范。
总的来说,这起诉讼标志着 AI 发展从“野蛮生长”转向“合规博弈”的新阶段。对于科技公司和媒体来说,如何在利用 AI 技术创造价值的同时,尊重知识产权,将是未来很长一段时间内必须面对的挑战。
信息来源:The Verge,原文链接:https://www.theverge.com/ai-artificial-intelligence/990932/seattle-times-newsday-lawsuit-openai-microsoft