記事一覧

AI
2025-04-30 ・ Synced

DeepSeek-Prover-V2とは?数学定理を自動証明するLean 4対応モデルをMiniF2F 88.9%精度で解説

DeepSeek AIが、形式的定理証明に特化したオープンソースLLM「DeepSeek-Prover-V2」を公開しました。671BパラメータのフラッグシップモデルはMiniF2F-testで88.9%の正答率を達成し、PutnamBenchでも658問中49問を解いて新たな最高水準を示しています。

AI
2025-04-24 ・ Synced

SRPOとは?Kuaishouが1/10の学習ステップでDeepSeek-R1-Zeroを超えた強化学習手法を解説

快手(Kuaishou)のKwaipilotチームが、純粋な強化学習のみで数学とコードの両領域を同時に攻略する新フレームワーク「SRPO」を公開しました。DeepSeek-R1-Zeroと同じQwen2.5-32Bをベースに、わずか1/10の学習ステップでAIME24=50、LiveCodeBench=41.6を達成し、モデルもHuggingFaceで開放されています。

AI
2025-03-25 ・ BAIR (Berkeley)

強化学習で渋滞は消せるか?バークレー校『MegaVanderTest』が示した自動運転100台の実証

カリフォルニア大学バークレー校(BAIR)の研究チームが、強化学習(RL)で制御した100台の市販車をテネシー州ナッシュビル近郊のI-24高速道路に投入し、ラッシュアワーの「ストップ&ゴー渋滞」を緩和。AVが全体の5%未満でも、周辺で15〜20%の省エネ効果を確認したと発表しました。

AI
2024-12-18 ・ AI Snake Oil

推論スケーリングとは?GPT-4以降のAI開発で語られ始めた「次の道筋」を解説

OpenAI、Anthropic、Google Geminiの次世代モデルが開発上の壁に直面しているとThe Information、Reuters、Bloombergが報道。業界の主流は「モデルスケーリング」から、o1やDeepSeek R1に代表される「推論スケーリング(test-time compute scaling)」へと急速にシフトしています。

AI
2024-12-13 ・ AI Snake Oil

AI選挙偽情報は本当に脅威か?2024年78件の分析が示す「需要」の正体

WIRED AI Elections Projectが追跡した2024年の選挙関連AI利用78件のうち、半数の39件には欺瞞の意図がなく、欺瞞目的の39件も数百ドル程度で代替可能だったとAI Snake Oilの分析が指摘しました。米国ではAI生成物より「チープフェイク(安価な編集偽動画)」が7倍多く使われていました。

AI
2024-11-16 ・ The Gradient

AI開発に数学はもう不要か?スケール則時代に変わる「数学の役割」を整理する

The Gradientは、70億パラメータ・50層級のモデルが主流となった現在、数学の役割が「性能保証」から「事後的な現象説明」へとシフトしていると論じました。畳み込みニューラルネットの基盤となった対称性の発想は40年以上前のものですが、トポロジーや代数といった純粋数学の領域が改めて注目されています。

AI
2024-09-18 ・ AI Snake Oil

CORE-Benchとは?AIエージェントが論文を再現する能力を測る新ベンチマークを解説

プリンストン大学の研究チームがAIエージェントの「論文再現能力」を測るベンチマーク「CORE-Bench」を公開しました。最高性能の構成でも最難関レベルの正答率は22%にとどまり、現状のAIエージェントの実力と限界を可視化しています。

AI
2024-09-10 ・ AI Snake Oil

AI Snake Oilとは?プリンストン大研究者が説く「効かないAI」の見抜き方

プリンストン大学のArvind NarayananとSayash Kapoorによる書籍『AI Snake Oil』の第1章(30ページ)が無料公開されました。Nature・Bloomberg・Forbesの2024年ベストブックに選出された本書は、「動かないAI」と「動いても害になるAI」を切り分ける視座を提供します。