一家爱尔兰老书店最近接到了一笔怪单:5,000种冷门书,没有还价,没有挑剔,直接下单。这不是大学的采购,书店老板托马斯·肯尼一眼认出——这是AI公司在扫货。
2025年夏天,一桩诉讼撕开了行业潜规则:Anthropic通过一个叫"巴拿马计划"的项目,销毁了数百万本印刷书籍来训练AI模型。消息爆出后,书商们才开始回过味来——为什么最近大单频出、买家从不在乎品相?答案是:买回去的书根本没打算留着,扫描完就进碎纸机。
最快的扫描方式是什么?拆书脊,整本扔进碎纸机,页面一张张过扫描仪。便宜,快,AI公司等不起你慢慢翻页。一本研究人类千年思考的书,在他们眼里就是一堆token。
讽刺的是,谷歌2009年就注册了一种不破坏书脊的扫描专利。互联网档案馆用人工一页页翻、一页页扫,14年来处理了300万页零错误。但档案馆的方法太慢、成本太高,不符合AI公司"几周内扫完整个图书馆"的需求。
书商们开始互相提醒:大订单、不还价、什么书都要——这是AI来了的信号。肯尼书店明确表态拒绝,理由很简单:"我们不想参与把作者的心血变成模型燃料的事。"
也不是所有公司都选择破坏。OpenAI和微软正与哈佛图书馆合作,用100万本公共领域古书训练模型,不销毁任何一本。埃隆·马斯克也在社交媒体上说,xAI会"用人工仔细扫描珍本,而不是直接拆书脊"。但批评者很快指出:他没说哪些算"珍本",也没说会不会偷偷拆。
这场争议背后是个老问题:谁有权力决定一本书的价值?AI公司买的是物理实体,付了钱,似乎有权处置。但当这些书是仅存的孤本、作者的手稿、第一版印刷品时,"买下来"不等于"可以毁掉"。
互联网档案馆那位叫Zhang的扫描员,在2021年的一条视频里说过:"我们从不拆书脊来数字化一本书。人工一页页来,一张都不能漏。"那条视频后来被浏览了150万次。如今看,这条视频的意义已经远超技术讨论——它说的是一个文明该不该为了跑赢AI就烧掉自己的图书馆。