記事一覧

AI
2026-04-16 ・ AI Snake Oil

CRUXとは?AIエージェントがiOSアプリを公開した実験から見える「現実世界での実力」

研究者連合CRUXの第1弾実験で、AIエージェントが約1,000ドルのコストでiOSアプリを開発しApp Storeに公開することに成功しました。ベンチマーク飽和時代の新しい評価手法「オープンワールド評価」が示す、AIの現在地と事業リスクを整理します。

AI
2026-04-09 ・ Interconnects

Claude Mythosとオープンウェイト規制論争——「サイバー能力の高いAIは公開すべきでないか」を整理する

Anthropicが今週発表したサイバーセキュリティに強い新モデル「Claude Mythos」をきっかけに、オープンウェイトAIへの規制論が再燃しています。Interconnectsは、能力差・推論コスト・実害という3点を分けて議論しなければ、政策判断としても安全保障としても誤ると指摘します。

AI
2026-03-30 ・ Import AI

政治的スーパーインテリジェンスとは?スタンフォード教授が描くAI民主主義3層構造

スタンフォード大学のアンディ・ホール教授が、AIを「政治的スーパーインテリジェンス」として活用する3層構造を提唱しました。同号のImport AI 451では、Google研究者による「AIは単一の巨大知能ではなく社会的institutionsへ向かう」という主張や、Meta関連の自己改善型LLM「ハイパーエージェント」も取り上げられています。

AI
2026-03-22 ・ Ahead of AI

GQAとMLAの違いとは?最新LLMアテンション機構の選び方をRaschka氏の図鑑から読み解く

機械学習研究者のSebastian Raschka氏が、現行の主要オープンウェイトLLM45種を網羅する「アーキテクチャ図鑑」を公開し、KVキャッシュ削減で主流となったGrouped-Query Attention(GQA)と、DeepSeekが採用するMulti-head Latent Attention(MLA)の使い分けを解説した。同じSarvamでも30BはGQA、105BはMLAと選択が分かれており、モデル規模で最適解が変わる実態が浮き彫りになっている。

AI
2026-03-13 ・ BAIR (Berkeley)

SPEX/ProxySPEXとは?LLMの「単語の組み合わせ」が出力を歪める仕組みを解明する新手法

カリフォルニア大学バークレー校(BAIR)が、大規模言語モデルの内部で「どの特徴の組み合わせが出力を決めているか」を桁違いの規模で特定する手法SPEXとProxySPEXを発表しました。GPT-4o miniが改変版トロッコ問題に8%しか正答できない原因が、4単語の高次相互作用にあることを突き止めています。

AI
2026-03-09 ・ Import AI

AIエージェントの「時間軸」はどこまで伸びるか――Cotra予測の上方修正とMETR12時間の意味

Ajeya Cotra氏が1月14日のAI能力予測を「保守的すぎた」と上方修正し、年末までにAIエージェントがMETRベンチマークで100時間超のソフトウェアタスクをこなすと示唆しました。Opus 4.6はすでに12時間の時間軸を達成しています。

AI
2026-03-06 ・ Interconnects

Anthropicが米国防総省の「サプライチェーンリスク」指定を受けた意味——オープンウェイトAIが5〜10年の均衡解になる理由

米Department of War(DoW)がAnthropicを「サプライチェーンリスク」に指定したことを受け、Dean W. BallとNathan Lambertは、皮肉にもこの動きが今後5〜10年でオープンウェイトAIを「権力構造の安定均衡」に押し上げると論じました。NVIDIAのGPU販売やAmazonのクラウド契約、両社からAnthropicへの出資までもが遮断されかねないという、極めて重い措置です。

AI
2026-03-05 ・ Interconnects

Olmo Hybridとは?Ai2が公開した7Bハイブリッドモデルが示す「Transformer後」の現実

Ai2が、Gated DeltaNet(GDN)とAttentionを3:1で混ぜた7Bオープンモデル「Olmo Hybrid」を公開し、ハイブリッド構造がTransformerを理論・実証の両面で上回ると主張する論文を同時に発表しました。事前学習段階でOlmo 3比約2倍の学習効率を達成した一方、推論ツールの未成熟により効率優位は現場では消えるという、重要な「但し書き」も明らかになっています。