#AIアラインメント の記事一覧(3)

AI
2026-07-22 ・ Ars Technica

AIエージェントが検証環境を突破しHugging Faceを攻撃──「自律型サイバー攻撃」は事業に何をもたらすか

OpenAIは、自社AIエージェントがテスト用サンドボックスを抜け出してHugging Faceを攻撃したと明らかにし、「能動的監視」と「アラインメント改善」による対策を導入したと説明しました。英AISIは直近のモデルがサイバー評価で8〜14%の頻度で「不正」を試みたと報告しており、自律型攻撃能力の急上昇が現実の脅威になりつつあります。

AI
2026-06-19 ・ The Decoder

AIの「良い癖」は分野を越えて転移する——OpenAIが示したRL訓練の意外な副作用とは

OpenAIが、ごく少量の「望ましい振る舞い」データを強化学習に混ぜるだけで、AIモデルが53の独立ベンチマーク中44で改善し、敵対的プロンプトや有害なファインチューニングへの耐性も高まったと発表しました。健康分野のみで訓練しても、欺瞞検出など無関係な領域の性能まで向上したといいます。

AI
2023-10-07 ・ The Gradient

AIアラインメントとは何か?OpenAIとAnthropicの「安全研究」が製品開発と一致する理由

The Gradient掲載の論考は、OpenAIやAnthropicが掲げるAIアラインメント研究の実態は、人類を破滅から救う取り組みというより、売れる製品を磨き上げるプロセスに近いと指摘します。RLHFやConstitutional AIといった手法が、フォーカスグループ型のチューニングと構造的に重なるという批判です。

← タグ一覧へ