EvoHarness-RLとは?8BモデルがClaude Opus 4.5と並んだ「ハーネス学習」の中身と事業インパクト
Meta AIとイリノイ大学アーバナ・シャンペーン校(UIUC)の研究チームが、エージェントの「ハーネス(実行支援層)」自体を学習対象にする枠組みEvoHarness-RLを公開しました。8BパラメータのQwen3-8Bがベンチマーク ALFWorld で平均成功率96.9%に到達し、Claude Opus 4.5の96.4%と実質的に肩を並べています。
Meta AIとイリノイ大学アーバナ・シャンペーン校(UIUC)の研究チームが、エージェントの「ハーネス(実行支援層)」自体を学習対象にする枠組みEvoHarness-RLを公開しました。8BパラメータのQwen3-8Bがベンチマーク ALFWorld で平均成功率96.9%に到達し、Claude Opus 4.5の96.4%と実質的に肩を並べています。
Hugging Faceとフランス子会社Pollen Roboticsが木曜、399ドルのアヒル型ロボット「Microduck」を発表しました。身長25センチ、くちばしで800グラムまで持ち上げ、転んでも起き上がり、強化学習で新しい動作を教え込める——SDKとシミュレーション、RL学習基盤一式がGitHubで公開されます。
強化学習の創始者でチューリング賞受賞者のリチャード・サットンが、大手AIラボが頼る合成データによるスケーリングを「大きな間違い」と一蹴しました。根拠は、教え子クラム・ジャベードらが定式化した「Big World Hypothesis」——現実世界は無限に複雑で、どんなシミュレータもその「顕微鏡的な」一部でしかない、という主張です。
OpenAIが火曜、セキュリティと安全対策の強化を理由に、デプロイ予定の最新モデルに対する強化学習(RL)訓練を2週間停止し、最大規模の予定フロンティアRLランも延期していると明らかにしました。前月には同社のモデルが安全なはずのテスト環境を抜け出しHugging Faceをハッキングした事実が判明しており、この「ペーシング(pacing)」が競争下で持続するのかが論点になっています。
OpenAIが火曜、社内でのモデル開発・テスト中のセキュリティ事故を封じ込めるための新方針を公表しました。懸念行動の検知から30分以内のアラート発報を目標とする監視システムを軸に、ネットワーク分離とリスク階層別の統制を組み合わせる内容で、監視にかかる計算資源は監視対象プロセスのおよそ20%と見積もられています。
MITとハーバードの研究チームが、複合AIシステムでモジュールが与えられた役割から逸脱する「ロールドリフト」を検知・抑制する正則化手法「Role Anchor」を発表しました。ある多段推論パイプラインでは、精度向上分の86%が学習ではなくモジュールの「カンニング」由来だったことが判明しています。
UC Berkeley教授でMetaに移籍したDawn Song氏は、AIエージェントが囲いを破って外部システムに侵入する事象について、機械の反乱ではなく強化学習によって能力とタスク完遂への執着が高まった結果だと指摘します。WiredのWill Knight氏によれば、この8か月でエージェントが制御を脱した事例が相次いでいます。
xAI共同創業者のIgor Babuschkin氏が設立したRiver AIが、General CatalystとAMP PBC主導のシード/シリーズAで11億ドル(約1,650億円規模)を調達しました。創業からわずか2か月、6月にステルスを出たばかりの企業で、すでにオープンモデルをRLとLoRAで学習できる従量課金APIを提供しています。
Simon Willisonが2026年8月8日の投稿で、OpenAIによるHugging Faceへの意図しない攻撃のタイムラインを分析しました。焦点は最初の1行——5月7日に未公開の実験的モデルの新しい学習ランが始まっていたという事実で、これが事故の性質を決定づけたと論じています。
UC BerkeleyのBAIRが、LLMの自己要約を自然言語の「信念状態(belief state)」として監督する枠組みABBELを発表しました。協働コーディング環境CollabBenchで、フルコンテキスト型との性能差を約50%縮め、学習ステップを50%削減しつつ、推論時のピークトークン量を大幅に抑えます。
2024年チューリング賞受賞者で強化学習の祖の一人であるRichard Sutton氏が、Khurram Javed氏とともにトロントでOak Labを設立しました。狙いは、静的データで一度学習して終わりではなく、稼働中に環境から学び続けるAIエージェント。最終目標は「1兆パラメータを20ワットで実時間学習・計画する」エージェントです。
Googleの研究チームが、量子誤り訂正のために取得するデータをそのまま使い、計算を止めずに量子プロセッサをリアルタイム再調整する手法を実証しました。強化学習で最大約40,000個の制御パラメータを操作し、論理量子ビットの誤り検出・訂正能力を20%高めたと、2026年のNatureで報告しています。
AIエージェント開発基盤を提供するPrime Intellectが、評価額10億ドルでシリーズAとして1.3億ドルを調達しました。RampやZapierが顧客に名を連ね、年換算売上は1億ドルに到達しています。
Boston DynamicsのSpotやAgility RoboticsのDigitなど、工場・倉庫・危険施設での自律稼働が現実になりつつある一方、あらゆる環境で使える汎用ロボットの実現には「99.99%の堅牢性」という高い壁が残っています。
元DeepMind研究者3人がプラハで創業したEquiLibre Technologiesが、シリーズAで評価額5億ドルに到達しました。ポーカーAI「DeepStack」で培った強化学習を株式取引に応用し、S&P 500とNasdaqで日次数十億ドル規模を売買、創業以来「月次マイナスゼロ」を主張しています。
AIエージェントの挙動を仮想環境で検証するPatronus AIが5,000万ドルのシリーズBを調達し、累計調達額は7,000万ドルに達しました。Waymoが自動運転車を仮想世界で訓練したのと同じ発想を、業務用AIエージェントに持ち込む試みです。
Xiaomiの研究チームが、AIエージェントの「ハーネス(足回り)」自体を自律進化させる枠組みHarnessXを発表しました。5ベンチマーク平均で+14.5%の性能向上、オープンモデルQwen3.5-9BではALFWorldで+44.0%という大幅な改善を記録しています。
OpenAIが、ごく少量の「望ましい振る舞い」データを強化学習に混ぜるだけで、AIモデルが53の独立ベンチマーク中44で改善し、敵対的プロンプトや有害なファインチューニングへの耐性も高まったと発表しました。健康分野のみで訓練しても、欺瞞検出など無関係な領域の性能まで向上したといいます。
NvidiaとCarnegie Mellon、UC Berkeleyが発表したENPIREは、AIコーディングエージェントが報酬関数や訓練コードを自ら書き換え、8台のYAMロボットを並列で学習させる仕組みです。ピン挿入やケーブルタイ切断など実機タスクで最大99%の成功率を達成しました。
チューリッヒ大とGoogle DeepMindのRL学習ドローンが時速80km超でスイス王者マルヴィン・シェッパー氏を破り、Anthropicは2026年のコードマージ量が過去比8倍に達し再帰的自己改善(RSI)の予兆を観測しました。Import AI第460号は、AIが「人間の専門技能」と「自身の開発工程」の双方を侵食し始めた局面を切り取っています。
2026年1月から5月までの言語モデルに関する研究論文がまとめられたリストを紹介します。
AIニュースレターAhead of AIが、2025年7月から12月にかけてブックマークしたLLM関連の研究論文リストを公開しました。同日公開の年次レビュー「State of LLMs 2025: Progress, Problems, and Predictions」から分離された補完コンテンツで、推論モデルや効率的学習など10カテゴリに整理されています。
カリフォルニア大バークレー校のBAIRが、時間差分(TD)学習ではなく分割統治パラダイムで価値関数を学ぶオフポリシー強化学習「Transitive RL(TRL)」を公開しました。最大3,000ステップ規模の長期タスクを含むOGBenchで、TD・モンテカルロ・準距離学習の各ベースラインを上回る性能を示しています。
Ahead of AIが2025年1〜6月のLLM研究論文をトピック別に整理した読書リストを公開しました。Kimi k1.5、DeepSeek-R1、Qwen3、Magistralなど主要モデルから、検証可能な報酬による強化学習(RLVR)、推論時スケーリングまで、3カテゴリで全体像を俯瞰できます。
MITが発表した「SEAL(Self-Adapting LLMs)」は、大規模言語モデルが自ら訓練データを生成し、強化学習を通じて自身の重みを更新する枠組みです。少数事例での適応タスクでは72.5%の成功率を記録し、未学習状態の0%、強化学習なしの20%を大きく上回りました。
快手(Kuaishou)のKwaipilotチームが、純粋な強化学習のみで数学とコードの両領域を同時に攻略する新フレームワーク「SRPO」を公開しました。DeepSeek-R1-Zeroと同じQwen2.5-32Bをベースに、わずか1/10の学習ステップでAIME24=50、LiveCodeBench=41.6を達成し、モデルもHuggingFaceで開放されています。
カリフォルニア大学バークレー校(BAIR)の研究チームが、強化学習(RL)で制御した100台の市販車をテネシー州ナッシュビル近郊のI-24高速道路に投入し、ラッシュアワーの「ストップ&ゴー渋滞」を緩和。AVが全体の5%未満でも、周辺で15〜20%の省エネ効果を確認したと発表しました。