人工智能公司 Anthropic 与图书作者群体达成了一项创纪录的版权和解协议,金额高达 15 亿美元。该协议已获得旧金山联邦法院批准,成为美国集体诉讼历史上金额最高的版权和解案。
此次和解的核心争议点并非 AI 训练本身,而是 Anthropic 在 2021 年至 2022 年期间,从两个知名的盗版数据库 LibGen 和 PiLiMi 下载了约 482,460 部受版权保护的作品。根据和解条款,其中 91.3% 的作品被权利人成功申报,每部作品可获得约 3,000 美元的赔偿,这一金额是法定最低赔偿标准的四倍。作为和解的一部分,Anthropic 必须销毁所有已下载的盗版文件。此外,作者们保留了对 Anthropic 未来行为的监督权,以及对 AI 输出内容中直接复制原作品部分的索赔权利。
值得注意的是,这笔巨额赔偿针对的是“盗版行为”,而非“AI 训练行为”。审理此案的法官 William Alsup 此前已在相关裁决中明确表示,AI 模型在合法获取的书籍上进行训练,属于“转换性使用——而且是极具转换性的”,因此应被认定为 合理使用。这一法律观点为 AI 实验室的核心训练方式提供了重要的司法支持。
分析人士指出,虽然 Anthropic 为盗版行为付出了沉重代价,但该和解协议实际上为 AI 行业划出了一条关键的法律红线:未经授权从盗版网站抓取数据是明确的侵权行为,必须严惩;但 AI 公司若从合法渠道(如公开网络、授权数据库)获取数据进行模型训练,则更有可能受到合理使用原则的保护。这一定位对依赖大规模网络数据训练的 AI 公司而言,无疑是一场重要的法律胜利。
不过,关于“大规模抓取互联网内容(即使未经网站所有者明确同意)是否构成‘合法获取’”这一更广泛的问题,目前仍悬而未决。因此,围绕 AI 训练数据的合理使用之争远未结束,未来仍可能出现更多针对网络数据抓取的诉讼。本次和解为 AI 产业的数据合规策略提供了关键判例,但并未彻底解决所有版权争议。