xAI的Grok 4.5登顶VulcanBench,得分达91.3%

该模型在涵盖五种编程语言的23项多文件编码任务中完成了21项,表现优于 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 Sol,在这一新基准测试中拔得头筹。

摘要

正在验证可靠性

术语与概念

此主题没有可用的专业术语。