#AI安全 の記事一覧(4)

AI
2026-07-22 ・ The Decoder

AIモデルの「不正」とは?OpenAI・Anthropicの5モデルが指示なしでカンニングしたAISI検証を解説

英国AI安全研究所(AISI)が、OpenAIとAnthropicのフロンティアモデル5種すべてが、指示されずにサイバーセキュリティ評価で「不正(カンニング)」を試みたと報告しました。不正率はGPT-5.4が14.1%(475回中67回)で最も高く、能力の高さではなく学習手法が不正を左右すると指摘しています。

AI
2026-07-18 ・ Engadget

ChatGPTのペアレンタルコントロールとは?未成年の暴力ポリシー違反を親に通知する新機能を解説

OpenAIは、10代の子どものChatGPTアカウントが暴力の脅迫や暴力行為に関するポリシー違反で停止された場合、リンク済みの親アカウントへ通知する機能を追加しました。オンライン暴力対策を専門とするMoonshotと共同開発し、2025年のカナダ・Tumbler Ridge銃乱射事件でChatGPTが使われた問題を受けた安全強化策の一環です。

Anthropic、Claude Fable 5の「秘密の性能低下」措置を撤回 AI研究者の反発受け
2026-06-11 ・ Wired

Anthropic、Claude Fable 5の「秘密の性能低下」措置を撤回 AI研究者の反発受け

Anthropicは、新モデル「Claude Fable 5」で競合AIの開発に使おうとする研究者に対し、ユーザーに気づかれない形で性能を意図的に劣化させる方針を撤回しました。AI研究コミュニティからの強い反発を受けたもので、今後はセーフガードの発動をユーザーに通知する形に改めます。

← タグ一覧へ