CRUXとは?AIエージェントがiOSアプリを公開した実験から見える「現実世界での実力」
研究者連合CRUXの第1弾実験で、AIエージェントが約1,000ドルのコストでiOSアプリを開発しApp Storeに公開することに成功しました。ベンチマーク飽和時代の新しい評価手法「オープンワールド評価」が示す、AIの現在地と事業リスクを整理します。
研究者連合CRUXの第1弾実験で、AIエージェントが約1,000ドルのコストでiOSアプリを開発しApp Storeに公開することに成功しました。ベンチマーク飽和時代の新しい評価手法「オープンワールド評価」が示す、AIの現在地と事業リスクを整理します。
Anthropicが今週発表したサイバーセキュリティに強い新モデル「Claude Mythos」をきっかけに、オープンウェイトAIへの規制論が再燃しています。Interconnectsは、能力差・推論コスト・実害という3点を分けて議論しなければ、政策判断としても安全保障としても誤ると指摘します。
スタンフォード大学のアンディ・ホール教授が、AIを「政治的スーパーインテリジェンス」として活用する3層構造を提唱しました。同号のImport AI 451では、Google研究者による「AIは単一の巨大知能ではなく社会的institutionsへ向かう」という主張や、Meta関連の自己改善型LLM「ハイパーエージェント」も取り上げられています。
機械学習研究者のSebastian Raschka氏が、現行の主要オープンウェイトLLM45種を網羅する「アーキテクチャ図鑑」を公開し、KVキャッシュ削減で主流となったGrouped-Query Attention(GQA)と、DeepSeekが採用するMulti-head Latent Attention(MLA)の使い分けを解説した。同じSarvamでも30BはGQA、105BはMLAと選択が分かれており、モデル規模で最適解が変わる実態が浮き彫りになっている。
OpenAIがCodex向けに投入したGPT 5.4は、git操作で頻発していた途中停止を解消し、文脈管理と推論効率を改善。月額200ドルのChatGPTプランに含まれるFastモードで、月額100ドルのClaudeとの実用差を急速に詰めてきました。
カリフォルニア大学バークレー校(BAIR)が、大規模言語モデルの内部で「どの特徴の組み合わせが出力を決めているか」を桁違いの規模で特定する手法SPEXとProxySPEXを発表しました。GPT-4o miniが改変版トロッコ問題に8%しか正答できない原因が、4単語の高次相互作用にあることを突き止めています。
Ajeya Cotra氏が1月14日のAI能力予測を「保守的すぎた」と上方修正し、年末までにAIエージェントがMETRベンチマークで100時間超のソフトウェアタスクをこなすと示唆しました。Opus 4.6はすでに12時間の時間軸を達成しています。
米Department of War(DoW)がAnthropicを「サプライチェーンリスク」に指定したことを受け、Dean W. BallとNathan Lambertは、皮肉にもこの動きが今後5〜10年でオープンウェイトAIを「権力構造の安定均衡」に押し上げると論じました。NVIDIAのGPU販売やAmazonのクラウド契約、両社からAnthropicへの出資までもが遮断されかねないという、極めて重い措置です。
Ai2が、Gated DeltaNet(GDN)とAttentionを3:1で混ぜた7Bオープンモデル「Olmo Hybrid」を公開し、ハイブリッド構造がTransformerを理論・実証の両面で上回ると主張する論文を同時に発表しました。事前学習段階でOlmo 3比約2倍の学習効率を達成した一方、推論ツールの未成熟により効率優位は現場では消えるという、重要な「但し書き」も明らかになっています。