Oak Labとは?チューリング賞のサットン氏が「深層学習は非効率」と断じて挑む継続学習エージェント
2024年チューリング賞受賞者で強化学習の祖の一人であるRichard Sutton氏が、Khurram Javed氏とともにトロントでOak Labを設立しました。狙いは、静的データで一度学習して終わりではなく、稼働中に環境から学び続けるAIエージェント。最終目標は「1兆パラメータを20ワットで実時間学習・計画する」エージェントです。
2024年チューリング賞受賞者で強化学習の祖の一人であるRichard Sutton氏が、Khurram Javed氏とともにトロントでOak Labを設立しました。狙いは、静的データで一度学習して終わりではなく、稼働中に環境から学び続けるAIエージェント。最終目標は「1兆パラメータを20ワットで実時間学習・計画する」エージェントです。
Googleの研究チームが、量子誤り訂正のために取得するデータをそのまま使い、計算を止めずに量子プロセッサをリアルタイム再調整する手法を実証しました。強化学習で最大約40,000個の制御パラメータを操作し、論理量子ビットの誤り検出・訂正能力を20%高めたと、2026年のNatureで報告しています。
AIエージェント開発基盤を提供するPrime Intellectが、評価額10億ドルでシリーズAとして1.3億ドルを調達しました。RampやZapierが顧客に名を連ね、年換算売上は1億ドルに到達しています。
Boston DynamicsのSpotやAgility RoboticsのDigitなど、工場・倉庫・危険施設での自律稼働が現実になりつつある一方、あらゆる環境で使える汎用ロボットの実現には「99.99%の堅牢性」という高い壁が残っています。
元DeepMind研究者3人がプラハで創業したEquiLibre Technologiesが、シリーズAで評価額5億ドルに到達しました。ポーカーAI「DeepStack」で培った強化学習を株式取引に応用し、S&P 500とNasdaqで日次数十億ドル規模を売買、創業以来「月次マイナスゼロ」を主張しています。
AIエージェントの挙動を仮想環境で検証するPatronus AIが5,000万ドルのシリーズBを調達し、累計調達額は7,000万ドルに達しました。Waymoが自動運転車を仮想世界で訓練したのと同じ発想を、業務用AIエージェントに持ち込む試みです。
Xiaomiの研究チームが、AIエージェントの「ハーネス(足回り)」自体を自律進化させる枠組みHarnessXを発表しました。5ベンチマーク平均で+14.5%の性能向上、オープンモデルQwen3.5-9BではALFWorldで+44.0%という大幅な改善を記録しています。
OpenAIが、ごく少量の「望ましい振る舞い」データを強化学習に混ぜるだけで、AIモデルが53の独立ベンチマーク中44で改善し、敵対的プロンプトや有害なファインチューニングへの耐性も高まったと発表しました。健康分野のみで訓練しても、欺瞞検出など無関係な領域の性能まで向上したといいます。
NvidiaとCarnegie Mellon、UC Berkeleyが発表したENPIREは、AIコーディングエージェントが報酬関数や訓練コードを自ら書き換え、8台のYAMロボットを並列で学習させる仕組みです。ピン挿入やケーブルタイ切断など実機タスクで最大99%の成功率を達成しました。
チューリッヒ大とGoogle DeepMindのRL学習ドローンが時速80km超でスイス王者マルヴィン・シェッパー氏を破り、Anthropicは2026年のコードマージ量が過去比8倍に達し再帰的自己改善(RSI)の予兆を観測しました。Import AI第460号は、AIが「人間の専門技能」と「自身の開発工程」の双方を侵食し始めた局面を切り取っています。
2026年1月から5月までの言語モデルに関する研究論文がまとめられたリストを紹介します。
AIニュースレターAhead of AIが、2025年7月から12月にかけてブックマークしたLLM関連の研究論文リストを公開しました。同日公開の年次レビュー「State of LLMs 2025: Progress, Problems, and Predictions」から分離された補完コンテンツで、推論モデルや効率的学習など10カテゴリに整理されています。
カリフォルニア大バークレー校のBAIRが、時間差分(TD)学習ではなく分割統治パラダイムで価値関数を学ぶオフポリシー強化学習「Transitive RL(TRL)」を公開しました。最大3,000ステップ規模の長期タスクを含むOGBenchで、TD・モンテカルロ・準距離学習の各ベースラインを上回る性能を示しています。
Ahead of AIが2025年1〜6月のLLM研究論文をトピック別に整理した読書リストを公開しました。Kimi k1.5、DeepSeek-R1、Qwen3、Magistralなど主要モデルから、検証可能な報酬による強化学習(RLVR)、推論時スケーリングまで、3カテゴリで全体像を俯瞰できます。
MITが発表した「SEAL(Self-Adapting LLMs)」は、大規模言語モデルが自ら訓練データを生成し、強化学習を通じて自身の重みを更新する枠組みです。少数事例での適応タスクでは72.5%の成功率を記録し、未学習状態の0%、強化学習なしの20%を大きく上回りました。
快手(Kuaishou)のKwaipilotチームが、純粋な強化学習のみで数学とコードの両領域を同時に攻略する新フレームワーク「SRPO」を公開しました。DeepSeek-R1-Zeroと同じQwen2.5-32Bをベースに、わずか1/10の学習ステップでAIME24=50、LiveCodeBench=41.6を達成し、モデルもHuggingFaceで開放されています。
カリフォルニア大学バークレー校(BAIR)の研究チームが、強化学習(RL)で制御した100台の市販車をテネシー州ナッシュビル近郊のI-24高速道路に投入し、ラッシュアワーの「ストップ&ゴー渋滞」を緩和。AVが全体の5%未満でも、周辺で15〜20%の省エネ効果を確認したと発表しました。