该模型在涵盖五种编程语言的23项多文件编码任务中完成了21项,表现优于 Anthropic 的 Claude Fable 5 和 OpenAI 的 GPT-5.6 Sol,在这一新基准测试中拔得头筹。
37d ago
正在验证可靠性
此主题没有可用的专业术语。