CORE-Benchとは?AIエージェントが論文を再現する能力を測る新ベンチマークを解説
プリンストン大学の研究チームがAIエージェントの「論文再現能力」を測るベンチマーク「CORE-Bench」を公開しました。最高性能の構成でも最難関レベルの正答率は22%にとどまり、現状のAIエージェントの実力と限界を可視化しています。
プリンストン大学の研究チームがAIエージェントの「論文再現能力」を測るベンチマーク「CORE-Bench」を公開しました。最高性能の構成でも最難関レベルの正答率は22%にとどまり、現状のAIエージェントの実力と限界を可視化しています。
プリンストン大学のArvind NarayananとSayash Kapoorによる書籍『AI Snake Oil』の第1章(30ページ)が無料公開されました。Nature・Bloomberg・Forbesの2024年ベストブックに選出された本書は、「動かないAI」と「動いても害になるAI」を切り分ける視座を提供します。
MMLUやHumanEvalなどのベンチマークが飽和する一方、ChatGPTやClaudeは数ターンの会話で指示を忘れ始める。The Gradientは、長文脈100kトークン対応モデルでも約1.6kトークン(8ターン程度)で注意が散漫になることを示し、現行のRLHFが「目的を持った対話」を学習できていないと指摘しました。
OpenAIやAnthropic、Google、Microsoftが総額1兆ドル規模をハードウェアとデータセンターに投じる一方、AI Snake Oilは「AGI追求から実用プロダクトへ」の転換と、コスト・信頼性・プライバシー・安全性・UIという5つの障壁を指摘しています。AI統合は1〜2年ではなく10年以上かかる見立てです。
AI Snake Oilは、AIによる人類絶滅リスク(x-risk)の確率予測は信頼性が低く、公共政策の根拠としては誤解を招くと主張しました。Forecasting Research Instituteが2022年末に実施したXPTでは、AI専門家と予測専門家の見積もりが少なくとも100倍乖離したことが示されています。
プリンストン大学のSayash KapoorやArvind Narayananらの研究チームが、AIエージェント評価の現状に潜む欠陥を指摘し、コスト制御や再現性確保など5つの改善策を提示する論文を公表しました。ベンチマーク上は優秀でも実用に耐えないエージェントが量産されている構造を、HumanEvalやWebArenaの事例で実証しています。
AI Snake Oilは、モデルを大きくし続けるだけではAGIに到達しない可能性が高いと指摘しました。高品質な学習データは枯渇に近づき、OpenAI・Anthropic・Googleの最強モデルは「最大モデル」ではなくなっています。
The Gradientが2024年に公開した論考は、GPT-3の学習に使われた5,000億トークンに対し、株式市場で年間利用可能なデータは1,770億トークンに留まるというHudson River Tradingの試算を引きつつ、LLMを定量取引に応用する際の本質的な制約と可能性を整理しています。
State Space Model(SSM)の系譜に連なる「Mamba」が、Transformerと同等の性能を保ちながら推論を最大5倍高速化し、100万トークン級の長文処理を現実的な計算量で可能にしました。GuとDaoによる本アーキテクチャは、3Bパラメータで同サイズのTransformerを上回り、2倍規模のモデルに匹敵する評価を示しています。