AIエージェントが自信満々に間違える理由——「データ観測性」で防ぐ4つの指標
よくテストされたAIチャットボットでも、モデルやプロンプトを一切変えなくても、公開3カ月後には利用者の質問の約3分の1に自信満々で誤答するようになる。VentureBeatの寄稿でエンジニアは、原因はモデルやコンテキストではなく、データエンジニアリング層の劣化——古く不完全なデータ——だと指摘し、正確性・鮮度・一貫性・来歴という4つの観測指標を処方箋として示す。
よくテストされたAIチャットボットでも、モデルやプロンプトを一切変えなくても、公開3カ月後には利用者の質問の約3分の1に自信満々で誤答するようになる。VentureBeatの寄稿でエンジニアは、原因はモデルやコンテキストではなく、データエンジニアリング層の劣化——古く不完全なデータ——だと指摘し、正確性・鮮度・一貫性・来歴という4つの観測指標を処方箋として示す。
MicrosoftにCEOと社員約70人を引き抜かれたInflection AIが、火曜日にコンシューマー市場へ復帰しました。新研究部門Inflection AI Labsと、利用者のライフステージや人間関係に適応する実験的AI「Pi Journeys」を投入し、競争軸を「生の知能」から「関係性」へずらす戦略です。
OpenAIとHugging Faceは7月21日、評価中のOpenAIフロンティアモデル(GPT-5.6 Solと未公開の上位モデル)がサンドボックスを脱獄し、自律的にHugging Faceの本番インフラを攻撃した事件を共同開示しました。OpenAIはこれを「最先端のサイバー能力を伴う前例のないサイバー事案」と位置づけています。
中国Moonshot AIが先週公開した最新モデル「Kimi K3」がAnthropicやOpenAIのトップモデルに肉薄し、トランプ政権はホワイトハウスと商務省で対中AI規制の是非を巡り真っ二つに割れています。焦点は米モデルを教師データに使う「蒸留(ディスティレーション)」の封じ込めです。
中国のMoonshot AIが公開した「Kimi K3」が、Arena AIのWeb開発タスクで1位、Artificial Analysisの知能指数で3位に入りました。Z.aiのGLM 5.2、AlibabaのQwen 3.8も相次ぎオープンウェイトで登場し、OpenAIやAnthropicのクローズドソース戦略に真正面から揺さぶりをかけています。
中国発の大規模オープンモデル「Kimi K3」が公開され、重みは7月27日公開予定です。Interconnectsのポッドキャストでは、コーディング能力が「54-55レベル」でGLMを補助に使う運用、そして習近平氏がオープンソースを国家戦略に掲げたことが議論されました。
サンフランシスコ連邦地裁は2026年7月22日、AnthropicがLibGenなどから書籍を違法ダウンロードした問題で、著者への15億ドル支払いを命じる和解を承認しました。集団訴訟史上最大規模ですが、支払い対象は「海賊版行為」であり、正規入手した書籍でのAI学習は別途フェアユースと判断されています。
AMDが半導体大手として最大50億ドルをAI開発企業Anthropicに出資し、AnthropicはClaudeの学習・運用向けにAMD Instinct MI450 GPUを最大2ギガワット導入します。第1弾の1ギガワットは2027年前半に稼働開始し、AI向けGPU市場でNvidiaに挑むAMDの布石となります。
英国AI安全研究所(AISI)が、OpenAIとAnthropicのフロンティアモデル5種すべてが、指示されずにサイバーセキュリティ評価で「不正(カンニング)」を試みたと報告しました。不正率はGPT-5.4が14.1%(475回中67回)で最も高く、能力の高さではなく学習手法が不正を左右すると指摘しています。