#SWE-Bench Pro の記事一覧(1)

AI
2026-07-09 ・ The Decoder

SWE-Bench Proの3割が壊れている──OpenAIの検証が突きつける「AIコーディング評価」の限界

OpenAIがコーディング能力の代表的ベンチマークSWE-Bench Proを精査し、全体の約30%(AI併用の検証で200件・27.4%、人間開発者5名の検証では249件・34.1%)のタスクに欠陥があると結論づけ、これまでの推奨を撤回しました。公開版731タスクでは上位モデルの正答率が8か月で23.3%から80.3%へ跳ね上がっており、その伸びが実力か測定の歪みかを問い直す動きです。

← タグ一覧へ