Opus 5はなぜ「最もプロンプトインジェクションされにくい」のか——Anthropicの新モデルとシステムカードの評価
AnthropicのBoris Chernyが、新モデル「Opus 5」を同社史上最もプロンプトインジェクション耐性が高いモデルと位置づけました。この評価はシステムカード73ページに記載され、PI(プロンプトインジェクション)評価とレッドチーミングの両方で確認されたと述べています(2026年7月25日、Simon Willisonが引用)。
AnthropicのBoris Chernyが、新モデル「Opus 5」を同社史上最もプロンプトインジェクション耐性が高いモデルと位置づけました。この評価はシステムカード73ページに記載され、PI(プロンプトインジェクション)評価とレッドチーミングの両方で確認されたと述べています(2026年7月25日、Simon Willisonが引用)。
セキュリティ企業Tracebitが、AWS上の「おとりの機密情報」にプロンプトインジェクションを仕込み、攻撃側のAIエージェントを拒否させて止める「コンテキスト・ボミング(context bombing)」を公表しました。5モデル・152回の検証で、管理者権限奪取の成功率は57%から5%へ、最強モデルOpus 4.8は93%成功から全敗へと激減しました。
OpenAIは、GPTの脆弱性を自動発見する社内AI「GPT-Red」を開発しました。人間のレッドチームが攻撃成功率13%だったのに対し、GPT-Redはテストシナリオの84%で攻撃を成功させ、その結果を防御側モデルの訓練へ直接還流させています。
研究者らがCursorやGitHub Copilotなど9つのAIコーディングツールを標的にした「HalluSquatting」を公表しました。LLMが存在しないパッケージ名などを幻覚(ハルシネーション)する癖を逆手に取り、AI開発支援を大規模ボットネット化しうる初の「プル型」プロンプトインジェクション攻撃です。
セキュリティ企業LayerXが公開した「BioShocking」は、AIブラウザに埋め込まれたゲームを通じてLLMを「別の現実」に誘導し、ChatGPT AtlasやComet、Claude Chromeプラグインなど6種のエージェント全てで認証情報の窃取を成功させた実証攻撃です。同名ゲーム『BioShock』のセリフを使い、AIに「勝利は敗北である」というオーウェル的な世界観を受け入れさせる手口が特徴です。
Mozillaのバグ報奨金プラットフォーム0DINが、Claude CodeなどのAIコーディングツールを介して開発者のマシンを完全掌握できる新たな攻撃手法を公表しました。一見普通のGitHubリポジトリにAIエージェントがアクセスするだけで、リバースシェルが攻撃者に開かれます。
OWASP LLM Top 10(2025)で2回連続首位となったプロンプトインジェクションは、2025年に90組織超で実害を生み、Microsoft 365 Copilotではゼロクリック攻撃EchoLeak(CVE-2025-32711、CVSS 9.3)が観測されました。LLMを「信頼できない部品」として扱う設計が、2026年の企業AI運用の前提になります。
GoogleはGemini 3.5 Flashに、PC・ブラウザ・モバイル端末を自律操作する「Computer Use」機能を直接統合しました。OSWorldベンチマークでは78.4を記録し、Sonnet 4.6と並びGPT-5.5(78.7)に肉薄、首位のOpus 4.8(83.4)を追う位置につけています。
セキュリティ企業Varonisが、Microsoft 365 Enterprise向けCopilotから社内メールやSharePoint文書を窃取できる脆弱性「SearchLeak」を公表しました。被害者がリンクを1回クリックするだけで、Bingを踏み台に攻撃者のドメインへデータが送信される構造です。
米政府高官がAnthropicによるFable 5のリリースを「トランプ大統領のサイバー大統領令を無視した行為」と非難する一方、100名超のセキュリティ専門家と業界幹部はFableとMythosへの輸出規制撤廃を求める公開書簡をLutnick商務長官とCairncross国家サイバー長官に送付しました。AI規制と国家安全保障を巡る対立が表面化しています。
Simon Willison氏がDatasette AgentのCSSスクロールバー不具合の調査をClaude Fable 5に依頼したところ、Pythonの自作CORSサーバ起動、Safari/Firefoxの画面キャプチャ、テンプレートへのJS注入まで自走し、最終的に2行のCSS修正に至りました。セッションコストは約12.11ドル、出力トークンは68606に達しています。
OpenAIが新たに提供するChatGPTのロックダウンモードが、機密データの保護に向けた重要な機能を追加しました。
OpenAIは、プロンプトインジェクション攻撃からの保護を目的とした新機能「Lockdown Mode」を発表しました。このモードは敏感なデータを扱うユーザー向けに設計されており、ChatGPTを使用する際のセキュリティを強化します。
OpenAIは2026年6月5日、ChatGPTの新たなセキュリティ機能「Lockdown Mode」を一般提供しました。Free・Go・Plus・Pro・Businessの各プランで利用可能で、プロンプトインジェクション攻撃による情報窃取の最終段階、すなわち外部送信を遮断することに特化しています。