SpaceX因可靠性问题重组AI数据中心领导层

  • SpaceX在田纳西州和密西西比州出现可靠性问题后,重组了AI数据中心领导层。
  • 谷歌要求SpaceX在9月30日前交付约11万块英伟达GPU。
  • SpaceX在8月4日提交的季度文件中列出了数据中心风险。

SpaceX在田纳西州和密西西比州的设施出现工程方面的担忧和可靠性问题后,重组了AI数据中心业务的领导层。SpaceXAI物理基础设施负责人杰克·帕尔默于7月底离职,另有数名数据中心高管同时离开;来自火箭和Starlink业务的SpaceX资深员工则承担了更大职责,其中包括此前已报道的韦斯利·萨兰德罗、洛根·麦康奈尔以及Starlink高管迈克尔·尼科尔斯的职务调整。部分站点在数月内没有备用冷却和供电系统;Macrohard设施依赖100多台移动冷水机组运行,记录的正常运行时间远低于内部99.9%的目标,临时系统还导致宕机,打断了AI模型训练。由于供应链延误导致41台永久性机组迟迟无法到位,密西西比州监管机构批准临时燃气轮机的运行时间超出原计划。在最新一轮调整前数周,SpaceX在8月4日提交的季度文件中加入了AI基础设施风险因素,列举了建设延误、员工流失、电力限制和设备短缺等问题。截至6月底,公司算力容量为1.4吉瓦,高于一年前的0.4吉瓦;第二季度在AI基础设施上的支出约为158亿美元。目前,公司正赶在9月30日前交付谷歌每月9.2亿美元协议项下承诺的GPU,之后将有一个月的宽限期,期满后谷歌可以终止协议或按比例削减付款。目前没有迹象表明这些问题会影响该协议,但它们考验着埃隆·马斯克关于SpaceX能够比同行更快、更好地上线算力的说法。

本网站上的信息是使用AI生成的,我们无法保证其准确性。 请仅作为参考信息使用。