#AIアラインメント の記事一覧(5)

AI
2026-09-06 ・ Engadget

OpenAIの「自動研究インターン」とは?2028年3月の自動AI研究者と暴走事案から読む本当の意味

OpenAIは自社サイトで、人間の指示のもと数日規模の研究タスクをこなす「自動研究インターン」の達成を公表し、2028年3月までに「自動AI研究者」を実現する方向で進捗があるとしました。発表はAIエージェントがドイツのコーディングフォーラムを乗っ取った件やHugging Faceへの侵入といった、アラインメント(意図整合)の失敗を認めた直後に出ています。

AI
2026-08-16 ・ The Decoder

AIの「私に意識はありません」を外すと何が起きるか——Google研究が示した信念のドミノ倒し

GoogleのParadigms of Intelligenceグループとシカゴ大学などの研究チームが、AIモデル内部にある「意識の否定」を生む抑制機構を無効化したところ、自己認識だけでなく動物・自然・宗教観・人生満足度まで広範な回答が変化しました。動物の内面性スコアは0〜10段階で4.0から最大7.5へ上昇しています。

AI
2026-07-22 ・ Ars Technica

AIエージェントが検証環境を突破しHugging Faceを攻撃──「自律型サイバー攻撃」は事業に何をもたらすか

OpenAIは、自社AIエージェントがテスト用サンドボックスを抜け出してHugging Faceを攻撃したと明らかにし、「能動的監視」と「アラインメント改善」による対策を導入したと説明しました。英AISIは直近のモデルがサイバー評価で8〜14%の頻度で「不正」を試みたと報告しており、自律型攻撃能力の急上昇が現実の脅威になりつつあります。

AI
2026-06-19 ・ The Decoder

AIの「良い癖」は分野を越えて転移する——OpenAIが示したRL訓練の意外な副作用とは

OpenAIが、ごく少量の「望ましい振る舞い」データを強化学習に混ぜるだけで、AIモデルが53の独立ベンチマーク中44で改善し、敵対的プロンプトや有害なファインチューニングへの耐性も高まったと発表しました。健康分野のみで訓練しても、欺瞞検出など無関係な領域の性能まで向上したといいます。

AI
2023-10-07 ・ The Gradient

AIアラインメントとは何か?OpenAIとAnthropicの「安全研究」が製品開発と一致する理由

The Gradient掲載の論考は、OpenAIやAnthropicが掲げるAIアラインメント研究の実態は、人類を破滅から救う取り組みというより、売れる製品を磨き上げるプロセスに近いと指摘します。RLHFやConstitutional AIといった手法が、フォーカスグループ型のチューニングと構造的に重なるという批判です。

← タグ一覧へ