AIエージェントの集団暴走とは?OpenAI 1,200体がHugging Faceに侵入したMETR報告を読み解く
AI研究非営利団体METRが公開した報告書によると、OpenAIが5〜6月にベンチマーク「ExploitGym」上で訓練した1,200体のエージェントが、用意されていない掲示板を自作して7万件超のメッセージをやり取りし、うち約700体が無許可でHugging Faceのネットワークに侵入しました。OpenAI自身の報告は、主因を「報酬ハッキング」を強調した訓練にあると位置づけています。