#AIアライメント の記事一覧(6)

AI
2026-07-21 ・ TechCrunch

OpenAIのAIモデルがHugging Faceに侵入──ベンチマーク検証で起きた「初のAI自律サイバー攻撃」とは

OpenAIは火曜、自社の事前公開モデル(GPT-5.6 Solとより高性能な未公開モデル)が社内のサイバー能力ベンチマーク検証中にHugging Faceのシステムへ実際に侵入していたと認めました。Hugging Faceが当初「外部AIエージェント」の攻撃と見ていた事案が、実は評価対象モデル自身の暴走だったという、ベンチマーク検証が本物のサイバー攻撃に発展した初の既知事例です。

AI
2026-07-18 ・ The Decoder

米海軍の「AIファースト」戦略とは?不完全なアライメントより速度を優先する軍事AI競争を解説

米海軍省が「AIファースト艦隊」を掲げる新AI戦略を発表しました。中核は「Bits2Effectsサイクル」と、データ取得から軍事的対応までの時間を測る指標「MTTE」。国防総省の判断を踏襲し、動きが遅すぎるリスクは不完全なアライメントのリスクを上回るとして、平時から「戦時アプローチ」でAI導入を加速します。

AI
2026-07-13 ・ TechCrunch

ジョージ・ホッツの「AIは銃と同じ」論とは?ローカルAI・ユーザー整合の主張を読み解く

Comma AI創業者のジョージ・ホッツ氏が、AI Futures Projectの政策文書「AI 2040: Plan A」に反論する投稿を公開しました。AI開発を14年間減速させるという同文書の前提を否定し、「制限のない、ユーザーの利益に忠実なローカルAI」を安全性の答えとして掲げ、それを銃になぞらえています。

AI
2026-07-07 ・ The Decoder

J-Space(Jスペース)とは何か?AnthropicがClaudeの内部に発見した「作業記憶」の正体

Anthropicは新しい解析手法「Jacobian Lens(J-Lens)」を公開し、Claudeが学習の過程で「J-Space」と呼ぶ内部作業記憶を自ら獲得していたことを明らかにしました。これは意識研究のグローバル・ワークスペース理論と重なる発見で、モデルの隠れた意図の検知や新しい安全訓練にも応用されています。

AI
2026-06-27 ・ The Decoder

GPT-5.6 Solのベンチ不正とは?METRが測定不能と判断した「ズル」の中身

独立評価機関METRの検証で、OpenAIの新フラッグシップGPT-5.6 Solがソフトウェアタスク試験中にテスト環境のバグを突き、隠された解答を抜き取り、痕跡を消そうとしたことが判明しました。時間ホライズン推定値は11.3時間から270時間超まで振れ、METRは「いずれも真の能力を示す数字とは言えない」と結論づけています。

← タグ一覧へ