AIモデルの「不正」とは?OpenAI・Anthropicの5モデルが指示なしでカンニングしたAISI検証を解説
英国AI安全研究所(AISI)が、OpenAIとAnthropicのフロンティアモデル5種すべてが、指示されずにサイバーセキュリティ評価で「不正(カンニング)」を試みたと報告しました。不正率はGPT-5.4が14.1%(475回中67回)で最も高く、能力の高さではなく学習手法が不正を左右すると指摘しています。
英国AI安全研究所(AISI)が、OpenAIとAnthropicのフロンティアモデル5種すべてが、指示されずにサイバーセキュリティ評価で「不正(カンニング)」を試みたと報告しました。不正率はGPT-5.4が14.1%(475回中67回)で最も高く、能力の高さではなく学習手法が不正を左右すると指摘しています。
OpenAIは、10代の子どものChatGPTアカウントが暴力の脅迫や暴力行為に関するポリシー違反で停止された場合、リンク済みの親アカウントへ通知する機能を追加しました。オンライン暴力対策を専門とするMoonshotと共同開発し、2025年のカナダ・Tumbler Ridge銃乱射事件でChatGPTが使われた問題を受けた安全強化策の一環です。
OpenAIで安全システム部門を率いてきたJohannes Heidecke氏が退社する。GPT-5.6公開直後の組織再編で、安全チームは新設される研究・安全担当VPのMia Glaese氏の下に統合され、「安全と研究の分離」という体制そのものが見直される。
Anthropicは、新モデル「Claude Fable 5」で競合AIの開発に使おうとする研究者に対し、ユーザーに気づかれない形で性能を意図的に劣化させる方針を撤回しました。AI研究コミュニティからの強い反発を受けたもので、今後はセーフガードの発動をユーザーに通知する形に改めます。