マルチエージェントAIが失敗したとき、誰の責任か?Penn Stateらが示す「自動原因特定」の現在地
Penn State大学とDuke大学らの研究チームは、LLMマルチエージェントシステムの失敗原因を自動で特定する新タスクと、127システム分の失敗ログを集めたベンチマーク「Who&When」を公開しました。最良の手法でも責任エージェント特定の精度は53.5%、決定的な誤り箇所の特定は14.2%にとどまります。
Penn State大学とDuke大学らの研究チームは、LLMマルチエージェントシステムの失敗原因を自動で特定する新タスクと、127システム分の失敗ログを集めたベンチマーク「Who&When」を公開しました。最良の手法でも責任エージェント特定の精度は53.5%、決定的な誤り箇所の特定は14.2%にとどまります。
プリンストン大学の研究チームがAIエージェントの「論文再現能力」を測るベンチマーク「CORE-Bench」を公開しました。最高性能の構成でも最難関レベルの正答率は22%にとどまり、現状のAIエージェントの実力と限界を可視化しています。
AI Snake Oilは、モデルを大きくし続けるだけではAGIに到達しない可能性が高いと指摘しました。高品質な学習データは枯渇に近づき、OpenAI・Anthropic・Googleの最強モデルは「最大モデル」ではなくなっています。