#ProgramBench の記事一覧(1)

AI
2026-08-30 ・ The Decoder

AIコーディングエージェントは「作業時間」を測れない——Claude CodeとCodexの時間感覚を検証した研究が示す運用リスク

MATS研究プログラムの一環で行われた検証で、Anthropicの「Claude Code」とOpenAIの「Codex」は、コーディングタスクの所要時間を事前に見積もることも、自分がどれだけ作業したかを振り返ることも、成果物の品質を自己採点することもできないことが分かりました。Claudeは平均3倍、Codexは6〜10倍も時間を過大に見積もり、成功率は実際7%・14.5%のタスクを「約70%成功」と自己評価していました。

← タグ一覧へ