这款于7月8日发布的新模型目前宣称在 SWE Marathon 上以 29.0% 的问题解决率位居第一,同时 xAI 强调其具备快速、低成本、达到 Opus 级别的编程性能,但仍有待独立验证。
SpaceXAI 于 7 月 8 日发布 Grok 4.5,将价格定为每百万输入 tokens 收费 $2、每百万输出 tokens 收费 $6,并开始重点宣传其在 SWE Marathon 基准测试中的自报领先地位:该模型以 29.0% 的问题解决率领先于 Anthropic 的 Claude Opus 4.8(26.0%)和 Fable(24.0%)。公司表示,Grok 4.5 在数万块 NVIDIA GB300 GPU 上完成训练,并通过针对软件工程任务调优的强化学习进行优化,运行速度约为每秒 80 笔交易,在特定应用中可实现最高 4.2 倍于主要竞争对手的 token 效率。该模型已通过 Grok 应用、xAI 控制台和应用程序接口 (API) 上线,预计将于 7 月中旬在欧盟开放。此前报道还显示,其在其他测试中的编程表现不一,但在智能体任务方面获得了更强的独立支持:Artificial Analysis 在 AutomationBench-AA 上将 Grok 4.5 排名第一,成绩为 51.4%,每项任务成本为 $0.34;而 SpaceXAI 自身的发布数据则显示,其在 DeepSWE 1.1 上得分 53%,在 SWE Bench Pro 上得分 64.7%。最新的 SWE Marathon 成绩尚未经过独立验证,因此 xAI 是否真正取得该基准领先地位,仍是后续观察重点。