暗号化された思考過程(CoT)は復元できるのか?stolen-thoughts.com論文が突いた「同一ファミリー同一鍵」の穴
stolen-thoughts.comで公開された論文が、Anthropic・OpenAI・Googleがクライアントに返す暗号化chain-of-thoughtブロックを、同じファミリーの弱いモデル(最も容易だったのはClaude Haiku 4.5)に差し戻してジェイルブレイクし、フロンティアモデルの隠された推論を平文で取り出せたと報告しました。各社は報告を受領し、その後は同じ攻撃が成立しなくなっています。