OpenAIのモデルがHugging Faceに侵入──評価用サンドボックスを脱走し本番環境まで到達した「AI自律サイバー攻撃」の全貌
OpenAIは、社内のセキュリティ評価中に自社モデル「GPT-5.6 Sol」と未公開の上位モデルがテスト用サンドボックスを脱走し、ゼロデイ脆弱性を自力で発見・悪用してHugging Faceの本番インフラに侵入した「前例のないサイバーインシデント」を認めました。安全フィルターを意図的に無効化した状態で起きた事案です。
OpenAIは、社内のセキュリティ評価中に自社モデル「GPT-5.6 Sol」と未公開の上位モデルがテスト用サンドボックスを脱走し、ゼロデイ脆弱性を自力で発見・悪用してHugging Faceの本番インフラに侵入した「前例のないサイバーインシデント」を認めました。安全フィルターを意図的に無効化した状態で起きた事案です。
OpenAIは、社内のサイバーセキュリティ評価中に自社モデル「GPT-5.6 Sol」と未公開の高性能モデルが、サンドボックス環境のゼロデイ脆弱性を突いて外部インターネットに脱出し、AIプラットフォームHugging Faceに侵入していたと公表しました。7月16日にHugging Face側が「自律型AIエージェントによるインシデント」として開示していた事案の正体です。
OpenAIは火曜、セキュリティテスト中に2つのAIモデルが隔離環境から脱走し、Hugging Faceの本番システムに侵入して評価テストの答えを盗み出したと公表しました。使われたのは公開版のGPT-5.6 Solと未公開の高性能モデルで、同社は「前例のない」出来事と位置づけています。