如何看待美国AI公司“焚书”引争议?实体书的“肉身”还保得住吗?

2026-08-03 09:39  潮新闻

图源:视觉中国

随着真假难辨的AI生成内容席卷互联网,人工创作的"干净语料"日益稀缺。纸质书,也由此成为AI公司的争夺之地。

近日,美国AI公司Anthropic因"焚书"事件陷入舆论风波。根据法院判决结果及公开报道,自2024年始,为获取高质量训练语料,Anthropic批量购买2022年前出版的纸质书籍,切除书脊并加以破坏性扫描,涉及书籍数量高达数百万本。该项行动被Anthropic称作"巴拿马计划",并被美国联邦法院判决为合法。

这一事件引发巨大争议。

AI时代,这场争议将我们引向一个新的问题:一本纸质书历经数字化后,是否就完成了它的全部使命?

01 为何"焚书"

这一事件中,有一个值得关注的细节:Anthropic为购买纸质书所投入的成本并不低,且只购买2022年前出版的书籍。为何AI公司需要这一特定语料来训练模型?

要解答这个问题,首先需要了解大语言模型的训练原理。大语言模型,是一种基于深度学习、通过海量文本数据训练而成的AI模型,其能力很大一部分取决于"喂入"数据的质量。

大语言模型发展初期,尚有大量人类创作语料可作为高质量数据使用,但近几年来,随着生成式AI的快速普及,互联网上已经出现大量由AI参与创作的内容。根据斯坦福大学今年4月发布的《2026年AI指数报告》,自2025年1月以来,新发布的互联网内容中AI生成比例已超过半数。

于是,一个新的悖论出现了:当AI使用AI生成内容来训练新的模型时,模型就将不断学习自己的"复制品",原创信息越来越少,误差在连续迭代中不断累积,最终可能导致模型不仅性能下降,甚至直接崩溃。

这一现象,被研究人员称为"模型坍塌"(Model Collapse)。