Claude Opus 5がArtificial Analysisベンチマーク首位、GPT-5.6 Solは59点

Artificial Analysisの最新比較では、Claude Opus 5が61で首位となり、Fable 5の60、GPT-5.6 Solの59を上回った。一方で、最先端AIモデル全体ではコスト、トークン効率、信頼性を巡るトレードオフが浮き彫りとなった。

要約

Artificial Analysisの最新モデル比較では、9つのテストの総合スコアでClaude Opus 5が61点で首位となり、Fable 5が60点、GPT-5.6 Solが59点、Kimi K3が57点で続いた。トークン効率の比較では、GPT-5.6 Solは1タスク当たり約15,000出力トークンを生成し、コストは1タスク当たり1.04ドルだった一方、Fable 5は約33,000トークンを出力した。より新しいベンチマークにおける別のコスト比較では、Claude Opus 5の平均コストは1タスク当たり2.03ドルで、Fable 5の2.75ドルを下回った。結果はまた、パレート・フロンティアの大半をOpenAIが占め、TerraとLunaは含まれなかったことも示した。Artificial Analysisの内訳では、Claude Opus 5がGDPval-AA v2とAA-Briefcaseで首位だった一方、事実知識ではFable 5が上回り、Claude Opus 5はAA-Omniscienceで50%のハルシネーション率を記録した。

用語解説
  • パレート・フロンティア: 明確に上回る代替案が存在しない中で、最良のトレードオフを提供する選択肢の集合。
  • トークン効率: トークン出力量とコストに対するモデル性能の尺度。
  • ハルシネーション率: 出力に捏造情報が含まれる割合。