AIが自らの後継モデルを作る日は2028年末か——Import Aiが示すR&D自動化のロードマップ
Import AI 455は、人間が関与しないAIによるエンドツーエンドの研究開発が2028年末までに実現する確率を60%超と見積もりました。SWE-Benchの93.9%到達、CORE-Benchの「攻略宣言」、カーネル設計やポストトレーニング自動化の進展を根拠としています。
Import AI 455は、人間が関与しないAIによるエンドツーエンドの研究開発が2028年末までに実現する確率を60%超と見積もりました。SWE-Benchの93.9%到達、CORE-Benchの「攻略宣言」、カーネル設計やポストトレーニング自動化の進展を根拠としています。
AI解説者Sebastian Raschka氏が、自身のLLM-Galleryや記事制作で使うLLMアーキテクチャ把握の手順を公開しました。技術レポートが詳細を欠く中、Hugging Face Model Hub上のconfigファイルとtransformersライブラリの参照実装を直接読むという、あえて手動の方法です。
研究者連合CRUXの第1弾実験で、AIエージェントが約1,000ドルのコストでiOSアプリを開発しApp Storeに公開することに成功しました。ベンチマーク飽和時代の新しい評価手法「オープンワールド評価」が示す、AIの現在地と事業リスクを整理します。
Anthropicが今週発表したサイバーセキュリティに強い新モデル「Claude Mythos」をきっかけに、オープンウェイトAIへの規制論が再燃しています。Interconnectsは、能力差・推論コスト・実害という3点を分けて議論しなければ、政策判断としても安全保障としても誤ると指摘します。
スタンフォード大学のアンディ・ホール教授が、AIを「政治的スーパーインテリジェンス」として活用する3層構造を提唱しました。同号のImport AI 451では、Google研究者による「AIは単一の巨大知能ではなく社会的institutionsへ向かう」という主張や、Meta関連の自己改善型LLM「ハイパーエージェント」も取り上げられています。
機械学習研究者のSebastian Raschka氏が、現行の主要オープンウェイトLLM45種を網羅する「アーキテクチャ図鑑」を公開し、KVキャッシュ削減で主流となったGrouped-Query Attention(GQA)と、DeepSeekが採用するMulti-head Latent Attention(MLA)の使い分けを解説した。同じSarvamでも30BはGQA、105BはMLAと選択が分かれており、モデル規模で最適解が変わる実態が浮き彫りになっている。
OpenAIがCodex向けに投入したGPT 5.4は、git操作で頻発していた途中停止を解消し、文脈管理と推論効率を改善。月額200ドルのChatGPTプランに含まれるFastモードで、月額100ドルのClaudeとの実用差を急速に詰めてきました。
カリフォルニア大学バークレー校(BAIR)が、大規模言語モデルの内部で「どの特徴の組み合わせが出力を決めているか」を桁違いの規模で特定する手法SPEXとProxySPEXを発表しました。GPT-4o miniが改変版トロッコ問題に8%しか正答できない原因が、4単語の高次相互作用にあることを突き止めています。
Ajeya Cotra氏が1月14日のAI能力予測を「保守的すぎた」と上方修正し、年末までにAIエージェントがMETRベンチマークで100時間超のソフトウェアタスクをこなすと示唆しました。Opus 4.6はすでに12時間の時間軸を達成しています。