学术圈炸了!Elsevier联手巨头起诉Meta,盗版论文训练Llama再掀版权风暴
导语:爱思唯尔联手阿歇特、麦克米伦等出版巨头,正式起诉Meta用Sci-Hub等盗版论文训练Llama,AI版权战火首次烧进学术核心圈。
事件引爆:三大出版巨头首次联合起诉Meta
5月5日,纽约南区法院收到了份重量级诉状——全球顶级学术出版商爱思唯尔(Elsevier),联合法国阿歇特出版集团、英国百年出版巨头麦克米伦,以及知名作家兼律师Scott Turow,正式对Meta及CEO扎克伯格提起诉讼。这是主流学术出版集团首次针对AI公司发起版权大战,矛头直指Meta的Llama大语言模型。

原告方核心指控简单直接:Meta在未获任何授权的情况下,大量获取、复制并盗用了受版权保护的学术论文和出版物,用于训练Llama模型。美国出版商协会在声明中强调,这起诉讼将揭露Meta“明目张胆”的侵权事实。
两大“不清白”的数据来源:Common Crawl与盗版双雄
诉状详细列出了Meta训练Llama所依赖的数据管道,其中两个来源格外引人注目。第一是通用爬虫数据集Common Crawl,该数据集通过全网抓取生成,囊括数十亿网页内容。原告指出,付费期刊的摘要甚至全文极可能混迹其中,Meta却未做版权过滤。第二则是全球知名的两大盗版学术平台——LibGen(Library Genesis)和Sci-Hub。

LibGen与Sci-Hub多年来无偿传播数百万篇付费论文、教材和学术专著,在学术界争议巨大,深陷多国版权诉讼。出版商指控Meta通过磁力链接下载、文件共享等手段,从这两个平台系统性盗用了海量学术资源,并将其喂给Llama。部分证据甚至来自去年“作家诉Meta”(Kadrey v. Meta)案中流出的Meta内部员工邮件,显示公司明知数据来源存在版权风险仍继续使用。
Meta的王牌抗辩:合理使用原则
面对来势汹汹的指控,Meta发言人表示将“全力积极应诉”,其法律核心是一张在美国版权法中屡试不爽的王牌——合理使用(Fair Use)。

根据美国版权法第107条,合理使用允许在特定条件下(如批评、评论、教学、研究)无需授权使用版权内容。Meta强调,AI训练属于“转化性使用”,即对新作品的使用不会取代原作市场,反而能推动技术创新和生产力提升。公司发言人援引已有判例称,部分法院已认可使用版权内容训练AI可构成合理使用。
但本案特殊之处在于,训练素材并非合法购买的书籍,而是未经授权的盗版资源。这给“转化性使用”的认定蒙上阴影。目前美国司法体系对利用版权作品训练大模型的合法性尚未形成统一判例,《纽约时报》等媒体诉AI公司案仍在拉锯,和解与判决并存,出庭前景极不明朗。
先例的微妙信号:Anthropic“购书毁书”风波
就在诉讼发酵之际,去年的一起判决被反复提及——美国法院首次裁定AI公司Anthropic可在未经作者许可的情况下,使用合法购买的已出版书籍训练Claude模型。法院同样依据合理使用原则,认为AI训练属于转化性使用,无损原著市场,且利于技术进步。这一判例为Meta的辩护提供了些许支撑。

然而,近期Anthropic的另一操作却引发更大争议:网友爆料该公司在批量购入古籍后,扫描收录内容便直接销毁原书。这一行为被质疑是“合法购买”掩护下的变相盗版,一旦坐实,合理使用的逻辑将遭受根本性冲击。有趣的是,Meta案中若证实被告主动从盗版站点获取内容,其“善意”将大打折扣,法官在权衡转化目的时可能作出截然不同的判断。

这场诉讼意味着什么?
对爱思唯尔们而言,此举绝非临时起意。它们掌控着全球学术传播的命脉,旗下《柳叶刀》《细胞》等期刊每年产生数十亿美元的付费内容,而LibGen、Sci-Hub十余年的蚕食从未停歇。如今大模型的爆发让文本盗用从“人读”变为“机学”,规模与危害呈指数级上升。出版商选择起诉现金流充沛的Meta,而非继续死磕难以追责的境外盗版平台,无疑是一种务实的策略——树大钱多,法律威慑与和解赔偿都更可期待。
对于AI行业,这场官司可能成为里程碑。若法院最终裁定用盗版数据训练不构成合理使用,将直接重塑大模型的数据获取方式,迫使科技公司支付高昂的版权费用,或彻底转向合成数据、公共领域资料。而若Meta胜诉,则将释放危险信号:盗版内容只要能“转化”出新产品,就可能被合法化,这恰恰是出版商最恐惧的滑坡。眼下,双方的交锋才刚刚开始,而全球学术圈、AI界和版权法律界都已搬好小板凳,静待这场世纪博弈的走向。