AIによる開発加速は「まだら」だった——METR調査が示すサイバー・数学・AI研究の落差と、事業側が読むべき兆候
METRがサイバーセキュリティ・数学・AI研究の3領域を調べたところ、AIの寄与はサイバーに大きく、数学にわずか、AI研究では測定不能という結果になりました。Import AI 470はこれを「差分的加速(differential acceleration)」と呼び、加速はモデル能力の相転移に追随して局所的に起きると整理しています。
METRがサイバーセキュリティ・数学・AI研究の3領域を調べたところ、AIの寄与はサイバーに大きく、数学にわずか、AI研究では測定不能という結果になりました。Import AI 470はこれを「差分的加速(differential acceleration)」と呼び、加速はモデル能力の相転移に追随して局所的に起きると整理しています。
Import AI 469号が紹介したDiG-bench(Discovery in Games)は、ルールも目的も隠したまま70本のテキストゲームをAIに解かせ、「対話しながら世界の法則を推測できるか」を測る新ベンチマークです。Opus 5とFable 5がClaude Code併用で最高成績ながら、最難関のTier 7は0.2しか突破できず、人間には全ゲームをクリアした個人がいます。
チューリッヒ大とGoogle DeepMindのRL学習ドローンが時速80km超でスイス王者マルヴィン・シェッパー氏を破り、Anthropicは2026年のコードマージ量が過去比8倍に達し再帰的自己改善(RSI)の予兆を観測しました。Import AI第460号は、AIが「人間の専門技能」と「自身の開発工程」の双方を侵食し始めた局面を切り取っています。
Anthropic共同創業者でニュースレター「Import AI」を10年運営する著者が、AIが自らの後継モデルを生む「再帰的自己改善(RSI)」が今後2年以内に到来し得ると主張。Epoch Capabilities Index(ECI)や数学オリンピック金メダル獲得などの実績を根拠に、事業環境の前提が崩れつつあると警鐘を鳴らしています。
Import AI 455は、人間が関与しないAIによるエンドツーエンドの研究開発が2028年末までに実現する確率を60%超と見積もりました。SWE-Benchの93.9%到達、CORE-Benchの「攻略宣言」、カーネル設計やポストトレーニング自動化の進展を根拠としています。
Anthropic所属の著者がClaude Cowork等の研究エージェントに論文読解や分析レポート作成を任せ、約1週間分の作業を大幅短縮、数年間着手できなかったニュースレター10年分のベクトル検索構築も1時間未満で完了させた。Import AI 441は、こうした「複数エージェントによる自己multiplying」の到来と、それに対抗するPoison Fountainなどの反AI運動、Eric Drexlerの「サービス群としてのAI」構想までを横断する。