一枚藏在旧书里的 AirTag,把一批书从卖家手里一路带到了拉斯维加斯的亚马逊 AI 训练设施。这个细节比“AI 公司买书”更刺眼:书不是被收藏、转卖或进入图书馆,而是被切掉书脊,拆开扫描,然后消失。
我的判断很简单:大模型的数据荒已经从网页爬取,走到了实体世界。以前争的是谁能抓到更多公开文本,现在争的是谁能把还没数字化、还没被 AI 污染的文字变成私有训练料。
问题不只是版权,而是稀缺文本被一次性吃掉
404 Media 的调查把一个长期传闻钉到了具体地点:他们把追踪器放进一批罕见书籍,最终定位到亚马逊在拉斯维加斯的一处设施。报道说,那里的 VGT3 团队接收大量纸质书,切开装订后扫描。Ars Technica 和 TechCrunch 随后跟进,亚马逊给出的说法是,公司通过商业渠道购买书籍,用来改进客户使用的产品和服务,但没有把“训练 AI”这几个字讲清楚。
这件事容易被写成“亚马逊又惹争议”。我觉得更关键的是,纸书在这里不再是文化物品,而是低噪声数据。2022 年以前出版的书不会夹杂大模型生成文本,很多小语种、冷门学科、绝版资料也没有完整在线版本。对模型公司来说,这类文字有价值;对书商和读者来说,它们也可能是市场上还能流通的少数实体副本。
训练数据开始有库存压力
The Decoder 提到,书商怀疑 AI 公司按 ISBN 系统性扫书,因为这样能尽量覆盖“独一份”的作品。Ars 的报道也写到,相关设施的工人讨论过书源不足,甚至担心仓库因为没书可扫而停摆。
这个信号很重。互联网文本不是无限矿山,尤其是模型公司都在避开低质量合成内容之后,干净、旧、未数字化的文本会变成一种库存。谁能拿到库存,谁就多一块训练优势。问题是,这块优势如果靠破坏实体书获得,成本就被转嫁给了公共知识市场。
这里不能只拿“买了就有权处理”来结束讨论。商业购买解决的是交易合法性,不解决知识资产被私人模型吸收后的去向。一本冷门书被切开扫描,短期看只是一本低价旧书少了;长期看,是公共可访问的文本少了一份,模型公司多了一份外界看不见的数据。
AI 竞争正在把冷门资料变成原材料
这也解释了为什么这条新闻会刺痛很多人。亚马逊最早就是从网上卖书起家,如今被指把书变成训练材料,这种反差太强。但我不想只停在情绪上。真正的问题是,大模型竞争越往后,越会寻找普通人不注意的边角料:绝版书、论坛旧帖、企业文档、客服记录、音视频字幕。它们都可能从“资料”变成“燃料”。
边界应该提前讲清楚:如果企业要用实体书做训练数据,至少要说明来源、处理方式、是否破坏原件,以及训练后的数据如何管理。否则这场竞争会越来越像一台看不见的碎纸机,外面的人只知道模型更聪明了,却不知道它吃掉了什么。
消息来源
- 404 Media: https://www.404media.co/we-tracked-a-shipment-of-rare-books-it-ended-at-an-amazon-ai-training-facility/
- Ars Technica: https://arstechnica.com/tech-policy/2026/08/hidden-airtag-reveals-amazon-is-trashing-rare-books-to-train-ai/
- TechCrunch: https://techcrunch.com/2026/08/17/amazon-once-an-online-bookseller-is-destroying-rare-books-to-train-ai-models/
- The Decoder: https://the-decoder.com/airtag-reveals-how-amazon-destroys-rare-books-for-ai-training/