AIエージェント、Agents’ Last Examで実業務タスクの合格率2.6%

Crypto Briefingの記事は、この結果を、現在のAIシステムが複雑な現実世界の業務では依然として力不足である証拠と位置づけ、将来のモデルの構築と評価方法に示唆を与えるものだと伝えている。

要約

信頼性検証中

用語解説

このトピックには専門用語がありません。