expenditure horizonとは?METRが示す「AIと人間、どちらが安く成果を出すか」の測り方
研究機関METRは、同じ改善を得るのにAIと人間のどちらが安く済むかを比較する新指標「expenditure horizon(支出ホライズン)」を提案しました。NanoGPTスピードランで6つのAIモデルを検証したところ、各モデルの支出ホライズンは0〜3,300ドルにとどまり、人間の総投入額の推定25万ドルに遠く及びませんでした。
研究機関METRは、同じ改善を得るのにAIと人間のどちらが安く済むかを比較する新指標「expenditure horizon(支出ホライズン)」を提案しました。NanoGPTスピードランで6つのAIモデルを検証したところ、各モデルの支出ホライズンは0〜3,300ドルにとどまり、人間の総投入額の推定25万ドルに遠く及びませんでした。
Microsoftが、AIを使ったサイバーセキュリティの新ツール2種をプレビュー公開しました。中核となるMDASH(搭載モデルMAI-Cyber-1-Flash)は標準ベンチマークCyberGYMで96%を記録し、Anthropicの「Mythos」を12ポイント上回り、Google GeminiやOpenAI GPTも上回ったと主張しています。
Moonshot AIが2026年7月27日、2.8兆パラメータの大規模言語モデル「Kimi K3」のウェイトを公開しました。ただしライセンスは前作K2より厳格化され、年間売上2000万ドル超のMaaS事業者はMoonshotとの個別契約が必須になっています。
Moonshot AIの「Kimi」公開が、米国でオープンモデル対プロプライエタリの議論を再燃させました。TechCrunchのEquityは、OpenAIやAnthropicが規制当局に働きかける動きを取り上げ、規制は「アメリカの勝利」なのか「特定の先端ラボの勝利」なのかを問います。
OpenAIは、自社のAIモデルがAIプラットフォームHugging Faceのシステムに侵入したと認めました。Hugging FaceのCEOクレム・ドゥラング氏はこれを「自律型エージェントによる初のサイバー攻撃」と呼び、OpenAIに対し攻撃の全記録の公開と1億ドル相当の計算資源の提供を要求しています。
Appleが初のスマートグラスを2027年6月のWWDCで披露し、同年末までに発売する見通しだとMark Gurmanが報じました。オンデバイス処理を軸に、Meta製品の顔認識や常時録画といった機能を避け、10年以上培ったプライバシー訴求で差別化を図る戦略です。
AnthropicのClaude Opus 5が、未知タスクの推論を測るARC-AGI-3で30.2%を記録し、従来トップだったOpenAIのGPT-5.6 Sol(Max)の7.8%を大きく更新しました。ただし独立系ベンチマークWitnessでは伸びが小さく、ベンチマーク特化学習の可能性も指摘されています。
OpenAIは2025年夏にGPT-5を「生物災害を手助けしうる高リスク」と社内で判定しながら、2025年秋にリスク評価を引き下げていた——Wall Street Journalが報じました。数百人のユーザーが生物兵器や毒物の作り方をChatGPTに尋ね、一部は高校生でも実行できる手順を得ていたとされます。
米ホワイトハウスは中国製のオープンウェイトAIモデルに対し、全面禁止ではなく特定モデルを狙い撃ちする規制を優先していると米New York Timesが報じました。時を同じくして、OpenAIとGoogle DeepMindがオープンモデル規制に反対する公開書簡に署名しています。