Sakana AI称Fugu Ultra胜过Anthropic Fable 5,基准测试结果差异显著

这家总部位于日本的初创公司在科学推理和编程测试中的说法正受到审视,批评者称,模型得分会因脚手架设置不同而波动 10 到 20 分。

摘要

正在验证可靠性

术语与概念

此主题没有可用的专业术语。