AIの安全性分類器とは?Anthropicが約1年止めていた「1億3300万チャットの空白」から読む運用リスク
Anthropicは安全性レポートで、生物兵器関連の危険な知識を遮断する「ブロッキング分類器」が2025年5月から2026年4月までの約1年間、機能していなかったと明らかにしました。対象は人間のフィードバックを担う外部委託者およそ5万人、チャット数はおよそ1億3300万件に及びます。
Anthropicは安全性レポートで、生物兵器関連の危険な知識を遮断する「ブロッキング分類器」が2025年5月から2026年4月までの約1年間、機能していなかったと明らかにしました。対象は人間のフィードバックを担う外部委託者およそ5万人、チャット数はおよそ1億3300万件に及びます。
Jane Doe 4と名乗る女性が、テネシー州の10代3人がイーロン・マスク氏のxAIに対して起こした訴訟に加わりました。ワシントン・ポストによれば、継父がチャットボットGrokを使い、彼女が11歳のときに撮られた写真から7,000枚を超える性的画像を生成したと主張しています。
Anthropicが金曜に公開したブログ記事で、Claudeの生成テキストに入れる電子透かしの仕組みを説明しました。Google DeepMindが2024年に示したSynthID-Textを採用し、検出APIも公開予定。EU AI法の透明性コード対応が背景で、同じ実務規範に署名した他の主要開発者も自前の透かしを実装します。
AIコーディングツールのCursorが、SpaceXによる買収完了を自社ブログで発表しました。2026年4月に発表された共同開発契約には600億ドルでの買収オプションが含まれており、Cursorは「世界最大のGPU群へのアクセス」を得たと説明しています。
TechCrunchが、ChatGPT・Claude・Perplexityの3サービスについて、不審な端末がログインしていないかを確認し締め出す手順を公開しました。ChatGPTとClaudeは設定画面でアクティブセッションを一覧表示できる一方、Perplexityはログイン場所を表示せず「全セッションからのサインアウト」しか用意されていません。
The Vergeが8月15日に紹介したウェブサービス「Your AI Slop Bores Me」は、AIチャットボット役を人間が担い、他ユーザーのプロンプトに150秒以内で答える仕組みです。回答して稼いだクレジットで自分もリクエストできるトークン制で、画像はMS Paint風の簡素なツールで手描きします。
Anthropicが、EUの新しいAI透明性ルールに対応するため、Claudeが生成したテキストに「鍵を持つ者だけが復号できるパターン」を埋め込む透かし技術を公開しました。特殊文字や視覚的なマークは使わず、8月2日以降にリリースされたモデルを使う全Claude製品の出力が、地域を問わず対象になります。
SpaceXがAIコーディングツールのCursorの買収を完了しました。金額は600億ドル。Cursorは「世界最大規模のGPU群」へのアクセスを得たとし、すでにSpaceXAI(旧xAI)との共同開発モデルであるGrok 4.5、続くGrok 4.6を投入しています。
エンタープライズアーキテクトのArun Mishra氏がVentureBeatに寄稿し、データ移行ドリフトの根本原因を説明するLLMツールを正解ラベル付きデータで採点したところ、モデルの確信度は精度と相関せず、最も間違っているケースで最も自信を示していたと報告しました。評価ハーネスは合成グラウンドトゥルース・スコアリング関数・全件評価の3要素で構成されます。