
Anthropic 下载盗版书训练 Claude 的版权官司有了最新进展,计划用 15 亿美元和解,平均每本书 3000 美元。

我这几天太忙,没顾上去了解细节。今天突然有朋友在群里说:
Claude 侵权的 50 万本盗版电子书里肯定也有很多中国作品啊,中国作者们能拿到赔偿吗? 检索了一下,盗版网站上光刘慈欣就有大约 70 多本书,算一算大刘能拿 150 多万人民币呢。
这我一听就来兴趣了,因为这种集体诉讼的官司,打赢了以后权利人确实可以自己申请到赔偿。
那大刘真能拿到钱吗?
先说我的结论吧:
也许可以,但估计没那么多,而且过程会很曲折。
领钱的前提是:
我一直在关注 Anthropic 这个案子,因为还挺有代表性的。今天就再为大家回顾并更新一下事件的进展。
先给不熟悉的朋友大概说一下发生了什么。
大家都知道,AI 训练离不开数据,而现在大模型领域的版权问题就是一笔糊涂账。
去年 8 月,作家 Andrea Bartz, Charles Graeber 和 Kirk Wallace Johnson 三个人发起了一场集体诉讼,指控 Anthropic 在未经许可、未支付报酬的情况下,使用了作品的盗版版本来训练 Claude 模型。

今年 6 月,法官 William Alsup 给出了一个简易判决,并没有一刀切地偏向于某一方,而是给出了两方面的裁决:
一方面,法官裁定,使用合法获取的受版权保护内容来训练大语言模型的行为,属于美国版权法下的「合理使用」(Fair Use)。他认为,AI 模型学习写作风格、模式和结构,就像人类读者学习一样,其目的是创造出完全不同的新东西,具有「极高的变革性」。
这看上去对 AI 公司是有利。
但另一方,法官也指出,Anthropic 为了图省事,避免「法律、实践和商业上的麻烦」,从 LibGen 和 PiLiMi 等知名盗版网站下载了大量盗版书籍,并计划将其「永久存储」在一个中央数据库中。

为了建立一个通用研究图书馆而盗版书籍,其本身就是侵权,不是变革性使用,它直接取代了本应付费购买的市场。
Alsup 法官指出:「《版权法》中没有为 AI 公司开辟的例外条款。」
一句话,虽然 Anthropic 的「训练」行为被认可为合理使用,但「盗版并存储」的行为被判定为侵权。
接下来,他们将面临一场天价赔偿的审判,潜在的法定损害赔偿可能高达数百甚至数千亿美元。
所以 Anthropic 别无选择,只能寻求和解,这才引出了我们今天看到的这份价值 15 亿美元的和解协议。
Anthropic 提出的和解协议长达 39 页,于 9 月 5 日提交给法院。我大概看了看,提取出了四部分重点。
简单来说,Anthropic 同意设立一个最低 15 亿美元的「和解基金」(Settlement Fund),同时,这个基金是不可返还 的,意味着即使有钱没发完,也不会退还给 Anthropic。
和解金额是基于一个估算——大约 50 万部符合条件的作品,平均下来每部作品约 3000 美元。

如果最终确认的「作品清单」(Works List) 上的作品数量超过 50 万部,Anthropic 每增加一部,就必须向基金额外支付 3000 美元。这确保了赔偿总额能与侵权规模挂钩。
15 亿美元并非一次性付清,而是分四期支付,横跨两年时间,以缓解 Anthropic 的现金流压力。
对于无人认领、没有花完的钱,协议规定,未被认领的资金将首先尝试按比例重新分配给已经成功申领的成员,如果二次分配不现实(比如金额太小),才会将余款捐给法院批准的公益组织。
协议强调,目标是尽可能将所有钱都分给版权所有者。
这次诉讼针对的是 Anthropic 从盗版网站上下载的盗版书。但问题在于,并不是所有出现在 LibGen 上的书都能获得赔偿。
目前初步估算,Anthropic 下载了大约 50 万本书,而盗版网站上的文件体量至少在 500 万以上。
所以,Anthropic 会赔偿哪些书就很关键。
根据协议,Anthropic 会给出一个「作品清单」(Works List),这份清单由原被告双方共同确认,并最终提交法院,包含了 Anthropic 承认从 LibGen 和 PiLiMi 下载过的所有书籍。清单本身不会公开,但会建立一个可供检索的数据库。

同时,这些作品必须完成了美国版权局的登记。
这一条很有可能会排除掉很多国际作品,因为在美国版权法体系下,虽然版权是自动产生的,但只有进行了正式登记,才能在法庭上主张法定损害赔偿。
如果作家认为自己符合上述资格,可以按照以下流程操作:
除了真金白银地赔钱,还有一些其他值得关注的点:
这场和解的意义,早已超越了 Anthropic 和几位作家本身。许多业内人士将其称为 AI 行业的 Napster 时刻——本世纪初,音乐文件共享服务 Napster 因大规模侵权被判关闭,从而彻底改变了数字音乐产业的格局,催生了 iTunes 和 Spotify 等正版商业模式。

我觉得,这次和解同样将深远地重塑 AI 产业的未来:
法官的判决和这次天价和解,向所有 AI 公司发出了一个极其清晰的信号:训练数据的来源至关重要。
也许用于训练是「合理使用」,但并不能以「技术创新」或「最终用途的变革性」为借口,来掩盖上游数据获取的非法性。
使用盗版、破解或来源不明的数据集,将面临巨大的法律和财务风险。
既然「先偷后用,被抓再赔」的路径被证明代价高昂,那么「先买后用」就成了最安全、最合规的选择。
可以预见,AI 公司将不得不投入更多资源用于数据采购和授权。未来,与出版商、新闻机构、图片库和音乐公司等内容所有者的合作将成为常态,一个全新的 AI 数据授权市场正在形成。
从《纽约时报》到《权游》作者乔治·马丁,再到 Getty Images 图库,全球的内容创作者都在起诉各大 AI 公司。
尽管这次和解不构成有约束力的法律先例,但它为赔偿金额的量级提供了一个参照。它告诉其他 AI 公司,如果被证明存在大规模、故意的盗版行为,它们可能面临的将是十亿、甚至百亿美元级别的索赔。
当然,还有一个不容忽视的副作用,这场和解可能会进一步加剧 AI 领域的「贫富差距」。
像 Google、微软、Anthropic 这样的巨头,有足够的资金去支付高昂的和解金或授权费,从而建立起合规的数据壁垒。
而对于中小型创业公司和开源社区来说,获取高质量、大规模、合规的训练数据将变得更加困难和昂贵,这在无形中也提高了创新门槛。
虽然现在还没有上线 Anthropic 的最终「作品清单」,不过《大西洋月刊》在今年 1 月,为了 Meta 的侵权事件,做过一个 LibGen 的数据库检索工具,我们可以在这个工具上查询被盗版的书籍信息。
以刘慈欣为例,输入 Cixin Liu,能查询到 79 条结果:

如果这 79 本书全部都在「作品清单」里且都有美国的版权登记,大刘也许真的可以获得 23 万美元的赔偿。
当然了,获得全部赔偿的可能性很小。
不过比较合理的预期是,那些已经被翻译并出版的书应该可以请求赔偿。
所以现在的关键,还是要等原被告双方达成一致后,给出清单数据库,才能知道赔偿的范围。
也许会有更多的中国作家在其中找到自己的作品,也许也会因为种种原因卡在申请的环节。
对很多作家来说,也许他们并没有期待这样一笔「意外之财」,而是希望 AI 不要剽窃自己的知识成果。
但不论如何,这都是给全球所有 AI 公司上的一堂价值 15 亿美元的版权课,训练数据的灰色地带逐渐收窄,大力出奇迹的时代正在远去。
对于牌桌上的每一个玩家——无论是 AI 巨头、初创公司,还是内容创作者——游戏规则,都在悄然改变。