#GPT-4o の記事一覧(3)

AI
2025-08-14 ・ Synced

マルチエージェントAIが失敗したとき、誰の責任か?Penn Stateらが示す「自動原因特定」の現在地

Penn State大学とDuke大学らの研究チームは、LLMマルチエージェントシステムの失敗原因を自動で特定する新タスクと、127システム分の失敗ログを集めたベンチマーク「Who&When」を公開しました。最良の手法でも責任エージェント特定の精度は53.5%、決定的な誤り箇所の特定は14.2%にとどまります。

AI
2024-09-18 ・ AI Snake Oil

CORE-Benchとは?AIエージェントが論文を再現する能力を測る新ベンチマークを解説

プリンストン大学の研究チームがAIエージェントの「論文再現能力」を測るベンチマーク「CORE-Bench」を公開しました。最高性能の構成でも最難関レベルの正答率は22%にとどまり、現状のAIエージェントの実力と限界を可視化しています。

← タグ一覧へ