目的駆動型対話とは?LLMチャットボットが多ターン会話で「迷子」になる構造的限界
MMLUやHumanEvalなどのベンチマークが飽和する一方、ChatGPTやClaudeは数ターンの会話で指示を忘れ始める。The Gradientは、長文脈100kトークン対応モデルでも約1.6kトークン(8ターン程度)で注意が散漫になることを示し、現行のRLHFが「目的を持った対話」を学習できていないと指摘しました。
MMLUやHumanEvalなどのベンチマークが飽和する一方、ChatGPTやClaudeは数ターンの会話で指示を忘れ始める。The Gradientは、長文脈100kトークン対応モデルでも約1.6kトークン(8ターン程度)で注意が散漫になることを示し、現行のRLHFが「目的を持った対話」を学習できていないと指摘しました。
OpenAIやAnthropic、Google、Microsoftが総額1兆ドル規模をハードウェアとデータセンターに投じる一方、AI Snake Oilは「AGI追求から実用プロダクトへ」の転換と、コスト・信頼性・プライバシー・安全性・UIという5つの障壁を指摘しています。AI統合は1〜2年ではなく10年以上かかる見立てです。
AI Snake Oilは、AIによる人類絶滅リスク(x-risk)の確率予測は信頼性が低く、公共政策の根拠としては誤解を招くと主張しました。Forecasting Research Instituteが2022年末に実施したXPTでは、AI専門家と予測専門家の見積もりが少なくとも100倍乖離したことが示されています。
プリンストン大学のSayash KapoorやArvind Narayananらの研究チームが、AIエージェント評価の現状に潜む欠陥を指摘し、コスト制御や再現性確保など5つの改善策を提示する論文を公表しました。ベンチマーク上は優秀でも実用に耐えないエージェントが量産されている構造を、HumanEvalやWebArenaの事例で実証しています。
AI Snake Oilは、モデルを大きくし続けるだけではAGIに到達しない可能性が高いと指摘しました。高品質な学習データは枯渇に近づき、OpenAI・Anthropic・Googleの最強モデルは「最大モデル」ではなくなっています。
The Gradientが2024年に公開した論考は、GPT-3の学習に使われた5,000億トークンに対し、株式市場で年間利用可能なデータは1,770億トークンに留まるというHudson River Tradingの試算を引きつつ、LLMを定量取引に応用する際の本質的な制約と可能性を整理しています。
State Space Model(SSM)の系譜に連なる「Mamba」が、Transformerと同等の性能を保ちながら推論を最大5倍高速化し、100万トークン級の長文処理を現実的な計算量で可能にしました。GuとDaoによる本アーキテクチャは、3Bパラメータで同サイズのTransformerを上回り、2倍規模のモデルに匹敵する評価を示しています。
自動運転の長年の停滞を、LLM(大規模言語モデル)が「予想外の解」として打開しうる——The Gradientは2023年に活発化した知覚・計画・生成の研究を整理し、GAIA-1やPromptTrack、Talk2BEVなど具体名を挙げて検証しています。
The Gradientが、シングルセルシーケンシング(sc-seq)解析における深層学習の役割を解説しました。3万近い遺伝子と細胞単位の高次元データを扱う領域で、オートエンコーダ等が次元削減と非線形構造の抽出に不可欠な存在となっています。