#強化学習 の記事一覧(17)

AI
2026-07-13 ・ The Decoder

Oak Labとは?チューリング賞のサットン氏が「深層学習は非効率」と断じて挑む継続学習エージェント

2024年チューリング賞受賞者で強化学習の祖の一人であるRichard Sutton氏が、Khurram Javed氏とともにトロントでOak Labを設立しました。狙いは、静的データで一度学習して終わりではなく、稼働中に環境から学び続けるAIエージェント。最終目標は「1兆パラメータを20ワットで実時間学習・計画する」エージェントです。

AI
2026-07-10 ・ Ars Technica

量子コンピュータのキャリブレーションを止めずに補正——Googleが強化学習で誤り訂正データを再利用、訂正能力20%向上

Googleの研究チームが、量子誤り訂正のために取得するデータをそのまま使い、計算を止めずに量子プロセッサをリアルタイム再調整する手法を実証しました。強化学習で最大約40,000個の制御パラメータを操作し、論理量子ビットの誤り検出・訂正能力を20%高めたと、2026年のNatureで報告しています。

AI
2026-06-30 ・ TechCrunch

ポーカーAIを株式取引に転用したEquiLibre、評価額500億円超に。DeepMind出身者の強化学習が金融市場で示す実力

元DeepMind研究者3人がプラハで創業したEquiLibre Technologiesが、シリーズAで評価額5億ドルに到達しました。ポーカーAI「DeepStack」で培った強化学習を株式取引に応用し、S&P 500とNasdaqで日次数十億ドル規模を売買、創業以来「月次マイナスゼロ」を主張しています。

AI
2026-06-25 ・ TechCrunch

AIエージェント評価のPatronus AIとは?50億円調達の「デジタル世界モデル」を解説

AIエージェントの挙動を仮想環境で検証するPatronus AIが5,000万ドルのシリーズBを調達し、累計調達額は7,000万ドルに達しました。Waymoが自動運転車を仮想世界で訓練したのと同じ発想を、業務用AIエージェントに持ち込む試みです。

AI
2026-06-19 ・ The Decoder

AIの「良い癖」は分野を越えて転移する——OpenAIが示したRL訓練の意外な副作用とは

OpenAIが、ごく少量の「望ましい振る舞い」データを強化学習に混ぜるだけで、AIモデルが53の独立ベンチマーク中44で改善し、敵対的プロンプトや有害なファインチューニングへの耐性も高まったと発表しました。健康分野のみで訓練しても、欺瞞検出など無関係な領域の性能まで向上したといいます。

AI
2026-06-17 ・ The Decoder

ENPIREとは?NvidiaとCMU・UC Berkeleyが示す「AIエージェントがロボットを訓練する」仕組みを解説

NvidiaとCarnegie Mellon、UC Berkeleyが発表したENPIREは、AIコーディングエージェントが報酬関数や訓練コードを自ら書き換え、8台のYAMロボットを並列で学習させる仕組みです。ピン挿入やケーブルタイ切断など実機タスクで最大99%の成功率を達成しました。

AI
2026-06-08 ・ Import AI

AIドローンが人間チャンピオンを撃破、Anthropicは「自己改善」の兆候を報告──Import AI 460が示すAIの転換点

チューリッヒ大とGoogle DeepMindのRL学習ドローンが時速80km超でスイス王者マルヴィン・シェッパー氏を破り、Anthropicは2026年のコードマージ量が過去比8倍に達し再帰的自己改善(RSI)の予兆を観測しました。Import AI第460号は、AIが「人間の専門技能」と「自身の開発工程」の双方を侵食し始めた局面を切り取っています。

AI
2025-12-30 ・ Ahead of AI

LLM研究論文リスト2025年下半期版とは?Ahead of AIが公開した分類済みブックマーク集を解説

AIニュースレターAhead of AIが、2025年7月から12月にかけてブックマークしたLLM関連の研究論文リストを公開しました。同日公開の年次レビュー「State of LLMs 2025: Progress, Problems, and Predictions」から分離された補完コンテンツで、推論モデルや効率的学習など10カテゴリに整理されています。

AI
2025-11-01 ・ BAIR (Berkeley)

Transitive RL(TRL)とは?BAIRが示した長期タスクに効く分割統治型・オフポリシー強化学習を解説

カリフォルニア大バークレー校のBAIRが、時間差分(TD)学習ではなく分割統治パラダイムで価値関数を学ぶオフポリシー強化学習「Transitive RL(TRL)」を公開しました。最大3,000ステップ規模の長期タスクを含むOGBenchで、TD・モンテカルロ・準距離学習の各ベースラインを上回る性能を示しています。

AI
2025-07-01 ・ Ahead of AI

2025年上半期のLLM推論モデル論文マップ──DeepSeek-R1からMagistralまで何を読むべきか

Ahead of AIが2025年1〜6月のLLM研究論文をトピック別に整理した読書リストを公開しました。Kimi k1.5、DeepSeek-R1、Qwen3、Magistralなど主要モデルから、検証可能な報酬による強化学習(RLVR)、推論時スケーリングまで、3カテゴリで全体像を俯瞰できます。

AI
2025-06-16 ・ Synced

SEALとは?MITが発表したLLMが自分の重みを書き換える自己適応フレームワークを解説

MITが発表した「SEAL(Self-Adapting LLMs)」は、大規模言語モデルが自ら訓練データを生成し、強化学習を通じて自身の重みを更新する枠組みです。少数事例での適応タスクでは72.5%の成功率を記録し、未学習状態の0%、強化学習なしの20%を大きく上回りました。

AI
2025-04-24 ・ Synced

SRPOとは?Kuaishouが1/10の学習ステップでDeepSeek-R1-Zeroを超えた強化学習手法を解説

快手(Kuaishou)のKwaipilotチームが、純粋な強化学習のみで数学とコードの両領域を同時に攻略する新フレームワーク「SRPO」を公開しました。DeepSeek-R1-Zeroと同じQwen2.5-32Bをベースに、わずか1/10の学習ステップでAIME24=50、LiveCodeBench=41.6を達成し、モデルもHuggingFaceで開放されています。

AI
2025-03-25 ・ BAIR (Berkeley)

強化学習で渋滞は消せるか?バークレー校『MegaVanderTest』が示した自動運転100台の実証

カリフォルニア大学バークレー校(BAIR)の研究チームが、強化学習(RL)で制御した100台の市販車をテネシー州ナッシュビル近郊のI-24高速道路に投入し、ラッシュアワーの「ストップ&ゴー渋滞」を緩和。AVが全体の5%未満でも、周辺で15〜20%の省エネ効果を確認したと発表しました。

← タグ一覧へ