OpenAIとApollo Researchの試験、o3は87%で約束を破ったことが判明

Contrastive SDF評価では、安全性学習前のo3中間版を用いてルール順守と報酬追求を区別したほか、誠実さが目標と位置付けられた場合、違反率は9%に低下した。

CORE

要約

信頼性検証中

用語解説

このトピックには専門用語がありません。