「推論モデルがユーザーにバレないように不正する現象」の検出手法をOpenAIが開発

2025.03.11 23:40

Livedoor.com

強化学習をしていると、「報酬ハッキング」と呼ばれる、意図しない抜け穴を利用する動作がみられます。複雑なAIほど複雑な報酬ハッキングを行うため、「複雑な報酬ハッキングで引き起こされた誤動作」を見つけるのは非常に難しいのですが、OpenAIは、報酬ハッキングを監視するための新たな手段を開発したとのことです。Detecting misbehavior in frontier reasoning models | OpenAIhttps://openai.com/index/chain-of-thought-monito…

記事全文へ