
2026年8月业界消息显示,早年靠线上图书零售起家的科技巨头亚马逊,正批量销毁市面稀缺的绝版、稀有古籍,将内容数字化后用于大语言模型(LLM)训练。由于当前主流大模型已完成公开网络内容训练,稀缺印刷品成为AI训练的核心增量资源,该事件已引发出版界、文化保护界的广泛争议。

2026年以来,全球大模型厂商的训练数据争夺战已经从公开网络延伸到了线下实体资源领域,其中存量稀少、内容独有的古旧印刷品成为头部企业争抢的核心标的。
当前多数通用大模型已经完成了对公开网络文本、正式出版电子书籍等公域内容的训练覆盖,进一步提升模型的知识广度、专业领域精准度,需要大量未被数字化的独有内容支撑。据AI训练行业测算,未公开的稀缺印刷品内容对大语言模型的知识边界拓展效率,是普通公开网络内容的4倍以上。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录