共计 1146 个字符,预计需要花费 3 分钟才能阅读完成。
IT 之家 10 月 7 日消息, 据科技媒体 neowin 今天报道, 微软和 OpenAI 被埃默里奇报业(Emmerich Newspapers…
围绕 AI 训练数据的版权争议,又多了一起新诉讼。据科技媒体报道, 微软与 OpenAI 被美国多家地方媒体告上法庭, 原告称两家公司未经许可抓取了他们数以万计的版权文章, 用来训练人工智能模型。
📌 事件概览: 谁起诉了微软和 OpenAI
此次诉讼的发起方以埃默里奇报业 (Emmerich Newspapers) 为代表。这家报业集团总部位于密西西比州, 是一家规模较大的私营媒体机构, 读者覆盖路易斯安那州和阿肯色州。与它一同提起诉讼的, 还包括 Ojai Media、Coopwood Publishing、Coopwood Magazine、Coopwood Media Group 以及 Coopwood Newspapers 等多家出版机构。
原告的立场很明确: 这不是“无意收录”, 而是 蓄意窃取。他们认为微软和 OpenAI 在未取得授权的情况下, 把大量受版权保护的新闻内容纳入了模型训练流程。
🔍 指控核心: 绕过付费墙, 却未支付分文
在起诉内容中, 原告抛出了几组关键说法。
- 内容规模: 被指未经授权使用的版权文章达到数万篇;
- 技术手段: 原告称两家公司绕过了付费墙等访问限制系统, 在未获授权的情况下抓取内容;
- 收益分配: 原告认为相关模型已为两家科技巨头带来数十亿美元收益, 而内容生产者没有拿到任何回报。
内容被用于训练商用模型, 却没能换来一分钱——这是原告不满的核心。
💡 法律依据与诉求
原告主张微软与 OpenAI 的行为同时违反了《版权法》和《数字千年版权法》。基于这两项法律基础, 他们提出了两类诉求: 一是要求支付损害赔偿, 二是请求法院颁布禁令, 要求将模型中涉及侵权的训练数据删除。
值得注意的是,删除训练数据这一诉求在同类案件中颇具代表性。对大模型而言, 数据一旦进入训练流程, 如何“取出”本身就是技术与法律的双重难题, 这也让此类请求的落地方式成为后续观察重点。
📊 行业观察: 地方媒体为何接连出手
近年来, 围绕 AI 训练数据的诉讼多由大型媒体或内容平台发起,而这次的主角换成了地方报业集团。它们的共同点是内容体量不小、议价能力有限, 却直接感受到流量与订阅收入被分流。对它们来说, 诉讼既是维权, 也是一种争取谈判筹码的方式。
另一方面,微软与 OpenAI 此前已与部分媒体机构达成内容授权合作, 但显然并未覆盖所有出版方。授权体系的边界在哪里、哪些内容算“公开可得”、付费墙后的内容能否被收录, 仍是尚未厘清的争议地带。
🚀 总结
目前案件仍在初期阶段,原告的指控尚未经过法院认定 。但这起诉讼再次把大模型训练数据的合法性问题推到台前: 数据来源的授权链条是否完整, 可能比模型能力本身更容易成为法律风险。