AIショッピングエージェントの推薦はなぜブレるのか?ウォートン校の実験が示した「順番」と「記憶」の影響
ペンシルベニア大学ウォートン校の研究チームが、6つのAIモデルにフィットネスウォッチを選ばせる実験を行い、参照元の提示順や「登山が好き」といった短い記憶文だけで推薦結果が最大99ポイント動くことを確認しました。同じ質問でも別の日には別の商品が返ってくる、という不安定さがデータで裏づけられた形です。
ペンシルベニア大学ウォートン校の研究チームが、6つのAIモデルにフィットネスウォッチを選ばせる実験を行い、参照元の提示順や「登山が好き」といった短い記憶文だけで推薦結果が最大99ポイント動くことを確認しました。同じ質問でも別の日には別の商品が返ってくる、という不安定さがデータで裏づけられた形です。
VentureBeat Intelligenceが2026年7月に実施したVB Pulse調査(108社)で、社内テストを通過したAIエージェント/LLM機能が顧客に見える形で問題を起こしたと答えた企業は49%(6月は50%)。そして、その「痛い目に遭った」企業の85%が、低リスク領域で人間の承認なしにコード変更やシステム変更を許す方向へ動いていることが分かりました。
GoogleのParadigms of Intelligenceグループとシカゴ大学などの研究チームが、AIモデル内部にある「意識の否定」を生む抑制機構を無効化したところ、自己認識だけでなく動物・自然・宗教観・人生満足度まで広範な回答が変化しました。動物の内面性スコアは0〜10段階で4.0から最大7.5へ上昇しています。
エンタープライズアーキテクトのArun Mishra氏がVentureBeatに寄稿し、データ移行ドリフトの根本原因を説明するLLMツールを正解ラベル付きデータで採点したところ、モデルの確信度は精度と相関せず、最も間違っているケースで最も自信を示していたと報告しました。評価ハーネスは合成グラウンドトゥルース・スコアリング関数・全件評価の3要素で構成されます。
Microsoftの原論文と独立ベンチマーク4件を突き合わせた検証で、GraphRAGは複雑推論で53.4対42.9、文脈要約で64.4対51.3と通常のベクトルRAGを大きく上回る一方、単純な事実検索では60.1対60.9とほぼ引き分けでした。VentureBeatに寄稿したPersistent SystemsのDattaraj Rao氏は、勝敗を分けるのは技術ではなく「質問の種類」だと結論づけています。
Simon Willison氏が、Jesse Vincent氏の応用AI研究ラボPrime Radiantとの共同で「smevals」を公開しました。YAMLファイルを置いたディレクトリをそのままevalスイートにし、`uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6` のように複数モデル構成を横並びで走らせて採点できる、小さな評価ツールです。
VB Transform 2026で、LangChain・Conviva・CoreWeaveの登壇者は「1件の会話ログが満点でも製品は壊れている」ことがあると指摘。個別トレースの採点から、利用者集団をベースラインと比べるコホート対比評価へ、そして安価で用途を絞った小型ジャッジモデルへと評価手法が移りつつあります。
会計ソフト大手Intuitは、専門エージェントを束ねる中央オーケストレーター方式を約3カ月で放棄し、60日で「スキルとツール」型へ再構築した。原因はエージェント同士が自然言語で結果を受け渡すたびにコンテキストが失われ、誤りが増幅したことにある。VB Transform 2026でAI担当VPのNhung Ho氏が明かした。
VentureBeatのPulse Research調査(157社)で、社内評価に合格したAIエージェントが本番で顧客障害を起こした企業が50%に上ることが判明しました。自動評価を「完全に信頼する」企業はわずか5%にとどまる一方、66%が低リスク領域で人間の確認を外す方向へ動いており、権限と信頼のズレ=「評価ギャップ」が浮き彫りになっています。
OpenAIは新モデル公開前に問題発生頻度を予測する手法「Deployment Simulation」を発表しました。GPT-5系列での検証で、変化の方向を92%の精度で的中させ、従来テストの54%を大きく上回りました。
Simon Willison氏が、MarkdownとSVGを同時に扱えるビューア「markdown-svg-renderer」を公開しました。ライブプレビューに加え、fenced code内のSVGを画像描画とコード閲覧の両面で扱える点が特徴です。
Ahead of AIが、訓練済みLLMの評価手法を「多肢選択・検証器・リーダーボード・LLM審判」の4つに整理し、Qwen3 0.6Bを使ったMMLU評価のPyTorch実装例を公開しました。約1.5GBのRAMで動く軽量構成で、自社モデル選定の判断材料として注目に値します。