Sakana AI、Fugu UltraがAnthropicのFable 5を上回ったと主張もベンチマーク結果にばらつき

日本のスタートアップによる科学的推論とコーディング試験での主張に対し、足場となる実行環境次第でモデルのスコアは10〜20ポイント変動し得るとして精査の目が向けられている。

要約

信頼性検証中

用語解説

このトピックには専門用語がありません。