AIエージェントの実力は「予算」で化ける──英AISIが暴いた、ベンチマーク神話の崩壊
英国AIセキュリティ研究所(AISI)は、GPT-5やOpus 4.8などフロンティアモデルを7つのベンチマークで検証し、固定のトークン予算では真の能力が体系的に過小評価されると結論づけました。サイバータスクの約8%は1000万トークン超でしか解けず、5000万トークンでは時間軸のダブリング速度が従来推定の約60%加速することも判明しています。
英国AIセキュリティ研究所(AISI)は、GPT-5やOpus 4.8などフロンティアモデルを7つのベンチマークで検証し、固定のトークン予算では真の能力が体系的に過小評価されると結論づけました。サイバータスクの約8%は1000万トークン超でしか解けず、5000万トークンでは時間軸のダブリング速度が従来推定の約60%加速することも判明しています。