SpaceXAI推出Grok 4.5,定价下调且7月中旬在欧盟上线

这款于7月8日发布的新模型目前宣称在 SWE Marathon 上以 29.0% 的问题解决率位居第一,同时 xAI 强调其具备快速、低成本、达到 Opus 级别的编程性能,但仍有待独立验证。

摘要

SpaceXAI 于 7 月 8 日发布 Grok 4.5,将价格定为每百万输入 tokens 收费 $2、每百万输出 tokens 收费 $6,并开始重点宣传其在 SWE Marathon 基准测试中的自报领先地位:该模型以 29.0% 的问题解决率领先于 Anthropic 的 Claude Opus 4.8(26.0%)和 Fable(24.0%)。公司表示,Grok 4.5 在数万块 NVIDIA GB300 GPU 上完成训练,并通过针对软件工程任务调优的强化学习进行优化,运行速度约为每秒 80 笔交易,在特定应用中可实现最高 4.2 倍于主要竞争对手的 token 效率。该模型已通过 Grok 应用、xAI 控制台和应用程序接口 (API) 上线,预计将于 7 月中旬在欧盟开放。此前报道还显示,其在其他测试中的编程表现不一,但在智能体任务方面获得了更强的独立支持:Artificial Analysis 在 AutomationBench-AA 上将 Grok 4.5 排名第一,成绩为 51.4%,每项任务成本为 $0.34;而 SpaceXAI 自身的发布数据则显示,其在 DeepSWE 1.1 上得分 53%,在 SWE Bench Pro 上得分 64.7%。最新的 SWE Marathon 成绩尚未经过独立验证,因此 xAI 是否真正取得该基准领先地位,仍是后续观察重点。

术语与概念
  • SWE Marathon: 一种衡量 AI 模型解决长周期软件工程任务能力的基准测试。
  • reinforcement learning: 一种通过奖励能够产生期望结果的行为来提升模型表现的训练方法。
  • AutomationBench-AA: Artificial Analysis 的独立基准测试,用于检验 AI 智能体在遵守操作限制的同时,如何跨模拟应用完成任务。