AIエージェントの信頼性はなぜ伸びないのか?Narayananら12次元評価で見えた壁
Sayash KapoorとArvind Narayananらの研究チームが、OpenAI・Google・Anthropicの14モデルを18か月にわたり評価し、能力は急伸する一方で信頼性は小幅な改善にとどまることを示しました。論文『Towards a Science of AI Agent Reliability』では、信頼性を12次元に分解する評価枠組みを提示しています。
Sayash KapoorとArvind Narayananらの研究チームが、OpenAI・Google・Anthropicの14モデルを18か月にわたり評価し、能力は急伸する一方で信頼性は小幅な改善にとどまることを示しました。論文『Towards a Science of AI Agent Reliability』では、信頼性を12次元に分解する評価枠組みを提示しています。
WIRED AI Elections Projectが追跡した2024年の選挙関連AI利用78件のうち、半数の39件には欺瞞の意図がなく、欺瞞目的の39件も数百ドル程度で代替可能だったとAI Snake Oilの分析が指摘しました。米国ではAI生成物より「チープフェイク(安価な編集偽動画)」が7倍多く使われていました。
プリンストン大学の研究チームがAIエージェントの「論文再現能力」を測るベンチマーク「CORE-Bench」を公開しました。最高性能の構成でも最難関レベルの正答率は22%にとどまり、現状のAIエージェントの実力と限界を可視化しています。
プリンストン大学のArvind NarayananとSayash Kapoorによる書籍『AI Snake Oil』の第1章(30ページ)が無料公開されました。Nature・Bloomberg・Forbesの2024年ベストブックに選出された本書は、「動かないAI」と「動いても害になるAI」を切り分ける視座を提供します。
OpenAIやAnthropic、Google、Microsoftが総額1兆ドル規模をハードウェアとデータセンターに投じる一方、AI Snake Oilは「AGI追求から実用プロダクトへ」の転換と、コスト・信頼性・プライバシー・安全性・UIという5つの障壁を指摘しています。AI統合は1〜2年ではなく10年以上かかる見立てです。
AI Snake Oilは、AIによる人類絶滅リスク(x-risk)の確率予測は信頼性が低く、公共政策の根拠としては誤解を招くと主張しました。Forecasting Research Instituteが2022年末に実施したXPTでは、AI専門家と予測専門家の見積もりが少なくとも100倍乖離したことが示されています。