#信頼性評価 の記事一覧(1)

AI
2026-02-24 ・ AI Snake Oil

AIエージェントの信頼性はなぜ伸びないのか?Narayananら12次元評価で見えた壁

Sayash KapoorとArvind Narayananらの研究チームが、OpenAI・Google・Anthropicの14モデルを18か月にわたり評価し、能力は急伸する一方で信頼性は小幅な改善にとどまることを示しました。論文『Towards a Science of AI Agent Reliability』では、信頼性を12次元に分解する評価枠組みを提示しています。

← タグ一覧へ