AIの安全性分類器とは?Anthropicが約1年止めていた「1億3300万チャットの空白」から読む運用リスク
Anthropicは安全性レポートで、生物兵器関連の危険な知識を遮断する「ブロッキング分類器」が2025年5月から2026年4月までの約1年間、機能していなかったと明らかにしました。対象は人間のフィードバックを担う外部委託者およそ5万人、チャット数はおよそ1億3300万件に及びます。
Anthropicは安全性レポートで、生物兵器関連の危険な知識を遮断する「ブロッキング分類器」が2025年5月から2026年4月までの約1年間、機能していなかったと明らかにしました。対象は人間のフィードバックを担う外部委託者およそ5万人、チャット数はおよそ1億3300万件に及びます。