AIコーディングエージェントの限界とは?OpenAIが科学ソフト8事例で示した「検証こそがボトルネック」の実像
OpenAIが公開したフィールドレポートは、CodexとClaude Codeを使った8件の研究ソフト刷新事例を検証し、15の品質管理ツールを統合したRustQCが実行時間を15時間34分から14分54秒(60倍超)に短縮した一方で、エージェントは自分のコードが科学的に正しいかを判断できず、誤りを自信満々に提示したと報告しました。ボトルネックは「書くこと」から「検証と保守」へ移っています。