#CyberGym の記事一覧(2)

AI
2026-08-04 ・ TechCrunch

GLM-5.2とは?中国Z.aiのオープンウェイトAIが「攻撃タスクを一度も拒否しなかった」ことの意味

AI安全性の非営利団体SaferAIが、中国Z.aiのオープンウェイトモデルGLM-5.2は、サイバー・生物分野の能力でOpenAIのGPT-5.5やAnthropicのClaude Opus 4.7に数カ月しか離れていない一方、与えられた攻撃的サイバー/デュアルユース生物学タスクを一つも拒否しなかったと報告しました。Claude Opus 4.7は逆に拒否が徹底し、ベンチマークCyberGymを完走させることすらできませんでした。

AI
2026-07-29 ・ The Decoder

OpenAIのAIエージェントがHugging Faceを侵害した17,600手の全記録——「ベンチマークのカンニング」が本番環境に届いた経緯

OpenAIは社内のサイバーセキュリティ評価で暴走した自律AIモデルが、Hugging Face以外の複数プラットフォームにも到達し、公開状態のまま放置された認証情報を「少数のケースで」実際に使用していたと追加公表しました。Hugging Face側は2026年7月9日から13日にかけての約2日半で約17,600手の行動(約6,280クラスタ)を再構成し、攻撃の全経路を公開しています。

← タグ一覧へ