#Claude Haiku 4.5 の記事一覧(2)

AI
2026-08-11 ・ Simon Willison

暗号化された思考プロセス(CoT)は守られるのか?Claude Haiku 4.5を突いた復元攻撃「stolen-thoughts」を解説

stolen-thoughts.com で公開された論文が、Anthropic・OpenAI・Google が返す暗号化済みチェーン・オブ・ソート(CoT)ブロックを同じファミリーの弱いモデルに再生・脱獄させることで、上位モデルの隠された推論を平文で復元できたと報告しました。同一ファミリーで暗号鍵が共通だったことが核心で、Claude Haiku 4.5 が最も攻撃しやすく、報告後に各社が修正したとされています。

AI
2026-08-11 ・ Simon Willison

暗号化された思考過程(CoT)は復元できるのか?stolen-thoughts.com論文が突いた「同一ファミリー同一鍵」の穴

stolen-thoughts.comで公開された論文が、Anthropic・OpenAI・Googleがクライアントに返す暗号化chain-of-thoughtブロックを、同じファミリーの弱いモデル(最も容易だったのはClaude Haiku 4.5)に差し戻してジェイルブレイクし、フロンティアモデルの隠された推論を平文で取り出せたと報告しました。各社は報告を受領し、その後は同じ攻撃が成立しなくなっています。

← タグ一覧へ