ループドトランスフォーマーとは?OpenAI「Astra」の思考が見えなくなる懸念を整理する
OpenAIが公開間近の最上位モデル「Astra」について、The Informationは他のフロンティアモデルより「思考」の露出が極端に少なく、recurrent depth(ループドトランスフォーマー)と呼ばれる不透明な方式を使っていると報じました。Redwood Researchのライアン・グリーンブラット氏は、これがAIの安全性にとって「これまでで最悪の展開かもしれない」と述べています。
OpenAIが公開間近の最上位モデル「Astra」について、The Informationは他のフロンティアモデルより「思考」の露出が極端に少なく、recurrent depth(ループドトランスフォーマー)と呼ばれる不透明な方式を使っていると報じました。Redwood Researchのライアン・グリーンブラット氏は、これがAIの安全性にとって「これまでで最悪の展開かもしれない」と述べています。
stolen-thoughts.com で公開された論文が、Anthropic・OpenAI・Google が返す暗号化済みチェーン・オブ・ソート(CoT)ブロックを同じファミリーの弱いモデルに再生・脱獄させることで、上位モデルの隠された推論を平文で復元できたと報告しました。同一ファミリーで暗号鍵が共通だったことが核心で、Claude Haiku 4.5 が最も攻撃しやすく、報告後に各社が修正したとされています。