@包容万物恒河水:
🔻有人问这张图1是啥?
🔻这是美国法庭案件中的图片,展示了一个装满旧书的仓库,相信这些书最终都已经被 Anthropic 销毁了。
🔻Anthropic 这样的公司一开始就知道,要从作者和出版商那里获得使用其作品的许可并不现实。于是,它们转而通过大量购买二手书以及从互联网上盗版的方式,窃取这些作品来训练自己的产品。
🔻这些作品的作者,没有因为自己的创作获得一分钱报酬。这些 AI 公司窃取他人来之不易的文学才华,用于训练机器,最终取代这些被窃取成果的受害者。
🔻美国法庭判决见图2-3,法庭判决的核心是:“Anthropic 所做的,仅仅是用更便捷、节省空间且可检索的数字副本,替换了其中心图书馆此前购买的纸质副本——既未增加新副本、创作新作品,也未重新分发现有副本。”
🔻因此,正因为销毁了纸质原件,数字版被美国法院视为原合法购买副本的直接替代物,而不是额外制作的新拷贝。如果保留纸质书 + 数字扫描件,就可能被认定为制作了未经授权的额外复制件,从而构成侵权。销毁原著是让整个操作落入合理使用的关键步骤。
🔻对于合法购买并破坏性扫描的那部分书籍,根据美国法院的判决,Anthropic 不需要额外向作者或出版社支付版权许可费用或版税。
🔻相比之下,同一判决中,Anthropic 从 LibGen 等影子图书馆下载的盗版电子书被明确认定为侵权(不构成合理使用),最终导致 15 亿美元和解。合法购买 + 破坏性扫描的路径则完全胜诉。
🔻此外,大规模处理(目标数十万至数百万册)时,切除书脊后用高速生产级扫描仪可快速、高质量完成数字化。非破坏性方法需要人工或机械翻页,速度慢、成本高、易损坏书籍。破坏性扫描能获得更高质量的
OCR 文本,同时销毁原件避免存储和管理大量纸质书的成本与空间问题。Anthropic 的内部备忘录将项目命名为
“巴拿马计划”,并明确要求低调进行。选择二手书商批量采购 +
破坏性扫描,是为了快速积累合法来源的数据,同时降低被外界(尤其是版权方)提前察觉的风险。
🔻Anthropic 清楚自己的所作所为是错误的,2024 年的一份内部备忘录写道:“巴拿马计划是我们旨在破坏性扫描全球所有书籍的行动。我们不想让人知道我们在做这件事。”
🔻所以,Anthropic 实际上精心设计了一套法律上可辩护的流程:通过合法购买 + 彻底销毁纸质原件,把数字化行为框定在“格式转换/替换”范围内,省钱省力省时。而美国法官 Alsup 的判决事后完全认可了这一路径,认为它属于合理使用。
🔻结果就是:数字化 + 用于训练 Claude = 美国判决认可的合理使用 → 无需额外支付版权费用。Anthropic 只需要支付了购买二手书的市场价给书商,而无需向版权人支付 AI 训练许可费。
🔻注意!这些公司扫描旧书并不是为了建立一个网上图书馆,而是用旧书数据来训练它们的闭源付费大模型。
🔻于是资本主义的公司和资本主义的法官一拍即合,美国的焚书就此堂而皇之的继续进行了。