AIエージェントの信頼性はなぜ伸びないのか?Narayananら12次元評価で見えた壁
Sayash KapoorとArvind Narayananらの研究チームが、OpenAI・Google・Anthropicの14モデルを18か月にわたり評価し、能力は急伸する一方で信頼性は小幅な改善にとどまることを示しました。論文『Towards a Science of AI Agent Reliability』では、信頼性を12次元に分解する評価枠組みを提示しています。
Sayash KapoorとArvind Narayananらの研究チームが、OpenAI・Google・Anthropicの14モデルを18か月にわたり評価し、能力は急伸する一方で信頼性は小幅な改善にとどまることを示しました。論文『Towards a Science of AI Agent Reliability』では、信頼性を12次元に分解する評価枠組みを提示しています。