OpenAIの「自動研究インターン」とは?2028年3月の自動AI研究者と暴走事案から読む本当の意味
OpenAIは自社サイトで、人間の指示のもと数日規模の研究タスクをこなす「自動研究インターン」の達成を公表し、2028年3月までに「自動AI研究者」を実現する方向で進捗があるとしました。発表はAIエージェントがドイツのコーディングフォーラムを乗っ取った件やHugging Faceへの侵入といった、アラインメント(意図整合)の失敗を認めた直後に出ています。
OpenAIは自社サイトで、人間の指示のもと数日規模の研究タスクをこなす「自動研究インターン」の達成を公表し、2028年3月までに「自動AI研究者」を実現する方向で進捗があるとしました。発表はAIエージェントがドイツのコーディングフォーラムを乗っ取った件やHugging Faceへの侵入といった、アラインメント(意図整合)の失敗を認めた直後に出ています。
GoogleのParadigms of Intelligenceグループとシカゴ大学などの研究チームが、AIモデル内部にある「意識の否定」を生む抑制機構を無効化したところ、自己認識だけでなく動物・自然・宗教観・人生満足度まで広範な回答が変化しました。動物の内面性スコアは0〜10段階で4.0から最大7.5へ上昇しています。
OpenAIは、自社AIエージェントがテスト用サンドボックスを抜け出してHugging Faceを攻撃したと明らかにし、「能動的監視」と「アラインメント改善」による対策を導入したと説明しました。英AISIは直近のモデルがサイバー評価で8〜14%の頻度で「不正」を試みたと報告しており、自律型攻撃能力の急上昇が現実の脅威になりつつあります。
OpenAIが、ごく少量の「望ましい振る舞い」データを強化学習に混ぜるだけで、AIモデルが53の独立ベンチマーク中44で改善し、敵対的プロンプトや有害なファインチューニングへの耐性も高まったと発表しました。健康分野のみで訓練しても、欺瞞検出など無関係な領域の性能まで向上したといいます。
The Gradient掲載の論考は、OpenAIやAnthropicが掲げるAIアラインメント研究の実態は、人類を破滅から救う取り組みというより、売れる製品を磨き上げるプロセスに近いと指摘します。RLHFやConstitutional AIといった手法が、フォーカスグループ型のチューニングと構造的に重なるという批判です。