AIの再帰的自己改善(RSI)は本当に近いのか?プリンストン大「シャドー評価」でエージェントが論文2本とも不合格になった理由
プリンストン大学とUK AISIの共著者らが、フロンティアAIエージェントに未公開論文2本の研究課題を渡し、数千ドル分のAPIクレジットと6日間を与えて研究させたところ、元論文の著者による査読で2本とも明確に不合格となりました。エージェントは予算の50%以上を使い残し、初日に最も野心的な目標を放棄していました。
プリンストン大学とUK AISIの共著者らが、フロンティアAIエージェントに未公開論文2本の研究課題を渡し、数千ドル分のAPIクレジットと6日間を与えて研究させたところ、元論文の著者による査読で2本とも明確に不合格となりました。エージェントは予算の50%以上を使い残し、初日に最も野心的な目標を放棄していました。
プリンストン大学のSayash KapoorやArvind Narayananらの研究チームが、AIエージェント評価の現状に潜む欠陥を指摘し、コスト制御や再現性確保など5つの改善策を提示する論文を公表しました。ベンチマーク上は優秀でも実用に耐えないエージェントが量産されている構造を、HumanEvalやWebArenaの事例で実証しています。