404 Mediaがそのうちの1冊をラスベガスの同社VGT3施設まで追跡した報道によると、アマゾンは稀覯書を購入し、背表紙を切り落としてAI学習用にスキャンしている。アマゾンは「顧客が利用する製品やサービスを改善するため、商業流通を通じて書籍を購入している」と述べた。同報道は、大規模なデータセットで訓練されたAIシステムである大規模言語モデル(LLM)が容易に入手できるインターネット上の素材を使い尽くす中で、高品質なテキストの確保競争が強まっていることを示している。稀覯書や絶版本は、入手困難なテキストを提供し得るうえ、AI生成コンテンツを含む可能性が比較的低い。開発者がこれを避けたいと考えるのは、合成コンテンツで繰り返し学習すると、再帰的なAI訓練の後に出力品質が低下するモデル崩壊の一因となり得るためである。