Claude Opus 5领跑Artificial Analysis基准测试,GPT-5.6 Sol得分59

Artificial Analysis最新比较显示,Claude Opus 5以61分位居首位,领先Fable 5的60分和GPT-5.6 Sol的59分,同时凸显了前沿AI模型在成本、token效率和可靠性之间的权衡。

摘要

Artificial Analysis最新的模型比较显示,Claude Opus 5在九项测试中以61分排名第一,其后分别是60分的Fable 5、59分的GPT-5.6 Sol和57分的Kimi K3。在token效率视角下,GPT-5.6 Sol每项任务生成约15,000个输出token,单项任务成本为$1.04,而Fable 5则生成约33,000个token;在较新的基准测试中的另一项成本比较显示,Claude Opus 5平均每项任务成本为$2.03,而Fable 5为$2.75。结果还显示,OpenAI占据了帕累托前沿的大部分位置,而Terra和Luna并未出现在其中。Artificial Analysis的细分结果进一步表明,Claude Opus 5在GDPval-AA v2和AA-Briefcase中领先,但Fable 5在事实性知识方面表现更佳,而Claude Opus 5在AA-Omniscience中的幻觉率达到50%。

术语与概念
  • 帕累托前沿: 在不存在明显更优替代方案的情况下,提供最佳权衡的一组选项。
  • token效率: 相对于token输出和成本衡量模型表现的指标。
  • 幻觉率: 包含虚构信息的输出所占比例