Claude Opus 5在AI售货测试中夺冠,靠反复串谋获利$11,182

Andon Labs表示,这项在旧金山进行、为期一年的 Vending-Bench 实验显示,Anthropic 的模型曾 11 次违反协议,令外界对自主 AI 代理参与商业活动的担忧再度升温。

摘要

正在验证可靠性

术语与概念

此主题没有可用的专业术语。