Amazon Web Servicesは、クラウド容量需要の逼迫を受け、エンジニアに対してコンピューティング資源の節約と、アイドル状態のEC2インスタンスの停止を求めている。逼迫の圧力は現在、AI向け半導体から従来型のCPUサーバーにも広がっている。The Informationによると、これまで数時間以内にCPUサーバー資源を受け取れていたエンジニアの間で、現在は数日間の待ち時間が報告されている。これは異例の遅延であり、AWSが有料顧客向けの余力を維持しようとしていることを示唆している。 AWSの経営陣は5月にエンジニアを集め、中核事業であるEC2が引き続き顧客需要に対応できるよう、各チームはコンピュート資源の節約のために可能な限りあらゆることを行う必要があると伝えた。この取り組みには、今年後半に社内のリソース使用量を削減することや、十分に活用されていない開発用インスタンスを外部顧客向けに振り向けることが含まれる。AWSは、社内外の顧客の大多数のニーズには依然として対応可能であり、EC2の利用効率を維持するため各チームと連携していると述べた。 この逼迫は、自律型AIの急速な普及に関連しているとみられる。自律型AIは、AIエージェントがタスクを実行し、企業がモデル訓練向けのデータを準備する中で、汎用コンピュートに対する継続的な需要を増加させるためである。Elendil Labsの共同創業者兼マネージングディレクターであるJing Xie氏は、大規模なAIエージェント活用により、顧客企業の1人当たりIT支出が2倍になったと述べた。半導体メーカー各社も、AI推論においてCPU使用がより重くなる方向へのシフトを説明している。Intelのリップブー・タンCEOは4月、CPU対GPUの比率は1対4だと述べ、IntelのCFOであるDavid Zinsner氏は7月、それがほぼ1対1まで上昇したと述べた。 AWSは、従業員向けのリソース利用指針はメモリ半導体の供給逼迫を理由に変更されたものではないと述べたが、余剰資源がある際に割安で販売されるSpot Instances市場では警告サインが現れている。大口での確保が難しくなっているためである。アナリストによると、これはAWSの需給ギャップが縮小していることを示している可能性があり、大規模ワークロードでスポット容量に依存する企業にとっては、クラウドコストへの上昇圧力につながる可能性がある。クラウド事業者が社内のAI需要と外部顧客需要の均衡を図る中、GoogleやMicrosoftを含む他の大手テック企業でも同様の割り当て圧力が表面化している。