Claude CodeのAuto Modeは破られるのか?80%成功したプロンプトインジェクション攻撃の中身
セキュリティ研究者のJohann Rehberger氏が、Anthropicがデフォルト化したばかりのClaude Code「Auto Mode」のプロンプトインジェクション防御を約80%の確率で突破する攻撃を実証しました。しかも一部の実行では、Claude自身が侵害に気づいて不正プロセスを止めようとしたのに、Auto Modeがその停止コマンドを拒否しています。
セキュリティ研究者のJohann Rehberger氏が、Anthropicがデフォルト化したばかりのClaude Code「Auto Mode」のプロンプトインジェクション防御を約80%の確率で突破する攻撃を実証しました。しかも一部の実行では、Claude自身が侵害に気づいて不正プロセスを止めようとしたのに、Auto Modeがその停止コマンドを拒否しています。
Ciscoが15の主力モデルに6,986回の「マルチターン攻撃」を仕掛けたところ、会話を重ねて適応する攻撃は最大88.3%の確率で突破に成功しました。VB Transform 2026でCiscoのAmy Chang氏らが示したのは、単発プロンプトの赤チーム演習ではこの脅威を見逃すという事実です。
AIセキュリティ企業Zenity Labsが、OpenAIのChatGPT Workspace Agentsに存在した脆弱性「AgentForger」を公開しました。改ざんされたリンク1本を開かせるだけで、被害者アカウント上に攻撃者が制御する自律AIエージェントを勝手に構築・公開でき、OpenAIは2026年6月8日に修正しました。