DeepSeek-Prover-V2とは?数学定理を自動証明するLean 4対応モデルをMiniF2F 88.9%精度で解説
DeepSeek AIが、形式的定理証明に特化したオープンソースLLM「DeepSeek-Prover-V2」を公開しました。671BパラメータのフラッグシップモデルはMiniF2F-testで88.9%の正答率を達成し、PutnamBenchでも658問中49問を解いて新たな最高水準を示しています。
DeepSeek AIが、形式的定理証明に特化したオープンソースLLM「DeepSeek-Prover-V2」を公開しました。671BパラメータのフラッグシップモデルはMiniF2F-testで88.9%の正答率を達成し、PutnamBenchでも658問中49問を解いて新たな最高水準を示しています。
快手(Kuaishou)のKwaipilotチームが、純粋な強化学習のみで数学とコードの両領域を同時に攻略する新フレームワーク「SRPO」を公開しました。DeepSeek-R1-Zeroと同じQwen2.5-32Bをベースに、わずか1/10の学習ステップでAIME24=50、LiveCodeBench=41.6を達成し、モデルもHuggingFaceで開放されています。
中国Zhipu.AIが次世代モデルGLM-4とGLM-Z1シリーズをMITライセンスで完全オープンソース化し、国際向けプラットフォームZ.aiを公開しました。推論モデルGLM-Z1はDeepSeek-R1比で最大8倍の推論速度を主張し、IPOを見据えた攻勢が鮮明です。
カリフォルニア大学バークレー校(BAIR)の研究チームが、強化学習(RL)で制御した100台の市販車をテネシー州ナッシュビル近郊のI-24高速道路に投入し、ラッシュアワーの「ストップ&ゴー渋滞」を緩和。AVが全体の5%未満でも、周辺で15〜20%の省エネ効果を確認したと発表しました。
OpenAI、Anthropic、Google Geminiの次世代モデルが開発上の壁に直面しているとThe Information、Reuters、Bloombergが報道。業界の主流は「モデルスケーリング」から、o1やDeepSeek R1に代表される「推論スケーリング(test-time compute scaling)」へと急速にシフトしています。
WIRED AI Elections Projectが追跡した2024年の選挙関連AI利用78件のうち、半数の39件には欺瞞の意図がなく、欺瞞目的の39件も数百ドル程度で代替可能だったとAI Snake Oilの分析が指摘しました。米国ではAI生成物より「チープフェイク(安価な編集偽動画)」が7倍多く使われていました。
The Gradientは、70億パラメータ・50層級のモデルが主流となった現在、数学の役割が「性能保証」から「事後的な現象説明」へとシフトしていると論じました。畳み込みニューラルネットの基盤となった対称性の発想は40年以上前のものですが、トポロジーや代数といった純粋数学の領域が改めて注目されています。
プリンストン大学の研究チームがAIエージェントの「論文再現能力」を測るベンチマーク「CORE-Bench」を公開しました。最高性能の構成でも最難関レベルの正答率は22%にとどまり、現状のAIエージェントの実力と限界を可視化しています。
プリンストン大学のArvind NarayananとSayash Kapoorによる書籍『AI Snake Oil』の第1章(30ページ)が無料公開されました。Nature・Bloomberg・Forbesの2024年ベストブックに選出された本書は、「動かないAI」と「動いても害になるAI」を切り分ける視座を提供します。