Anthropic、AIに「AIの安全性研究」を任せる実験 うそ、迎合などの問題行動を性能落とさず改善

2026.08.31 14:07
Itmedia.co.jp

AnthropicはAIモデル「Claude」にAIの安全性研究を自律的に任せる実験結果を公開。うそや追従など10種類の問題行動全てで、性能を落とさず行動を改善する手法を発見した。人間の研究者28人の成績を上回ったという。

検索

人気記事

2026.05.05 11:04
2026.08.30 7:56
2026.08.30 7:16
2026.08.31 2:44
2026.08.30 14:43

コメント一覧

まだコメントはありません。

コメント