OpenAIが「SWE-Bench Proの約30%が壊れている」と報告、AIのコーディング能力を測るベンチマークに大量の不備

2026.07.09 12:40
Livedoor.com

OpenAIは2026年7月8日、AIのコーディング能力を測るベンチマーク「SWE-Bench Pro」を詳細に調査した結果、タスクのおよそ30%に評価として成立しない問題があると報告しました。Separating signal from noise in coding evaluations | OpenAIhttps://openai.com/index/separating-signal-from-noise-coding-evaluations/SWE-Bench ProはAIにソフトウェアの機能変更課題…

検索

人気記事

2026.05.05 11:04
2026.09.16 1:06
2026.09.16 0:52
2026.09.16 8:09
2026.09.14 14:15

コメント一覧

まだコメントはありません。

コメント