SWE-Bench Proの3割が壊れている──OpenAIの検証が突きつける「AIコーディング評価」の限界
OpenAIがコーディング能力の代表的ベンチマークSWE-Bench Proを精査し、全体の約30%(AI併用の検証で200件・27.4%、人間開発者5名の検証では249件・34.1%)のタスクに欠陥があると結論づけ、これまでの推奨を撤回しました。公開版731タスクでは上位モデルの正答率が8か月で23.3%から80.3%へ跳ね上がっており、その伸びが実力か測定の歪みかを問い直す動きです。