#LLM評価 の記事一覧(12)

AI
2026-08-27 ・ The Decoder

AIショッピングエージェントの推薦はなぜブレるのか?ウォートン校の実験が示した「順番」と「記憶」の影響

ペンシルベニア大学ウォートン校の研究チームが、6つのAIモデルにフィットネスウォッチを選ばせる実験を行い、参照元の提示順や「登山が好き」といった短い記憶文だけで推薦結果が最大99ポイント動くことを確認しました。同じ質問でも別の日には別の商品が返ってくる、という不安定さがデータで裏づけられた形です。

AI
2026-08-18 ・ VentureBeat

AIエージェントの評価(Evals)はなぜ機能しないのか——「社内テスト合格→顧客に迷惑」を経験した企業の85%が人間承認を外す理由

VentureBeat Intelligenceが2026年7月に実施したVB Pulse調査(108社)で、社内テストを通過したAIエージェント/LLM機能が顧客に見える形で問題を起こしたと答えた企業は49%(6月は50%)。そして、その「痛い目に遭った」企業の85%が、低リスク領域で人間の承認なしにコード変更やシステム変更を許す方向へ動いていることが分かりました。

AI
2026-08-16 ・ The Decoder

AIの「私に意識はありません」を外すと何が起きるか——Google研究が示した信念のドミノ倒し

GoogleのParadigms of Intelligenceグループとシカゴ大学などの研究チームが、AIモデル内部にある「意識の否定」を生む抑制機構を無効化したところ、自己認識だけでなく動物・自然・宗教観・人生満足度まで広範な回答が変化しました。動物の内面性スコアは0〜10段階で4.0から最大7.5へ上昇しています。

AI
2026-08-15 ・ VentureBeat

LLM評価ハーネスとは?正解データで測ると見えた「自信満々な誤答」の正体

エンタープライズアーキテクトのArun Mishra氏がVentureBeatに寄稿し、データ移行ドリフトの根本原因を説明するLLMツールを正解ラベル付きデータで採点したところ、モデルの確信度は精度と相関せず、最も間違っているケースで最も自信を示していたと報告しました。評価ハーネスは合成グラウンドトゥルース・スコアリング関数・全件評価の3要素で構成されます。

AI
2026-08-02 ・ VentureBeat

GraphRAGはいつベクトルRAGに勝つのか?4つのベンチマークが示した「グラフを使う質問・使わない質問」

Microsoftの原論文と独立ベンチマーク4件を突き合わせた検証で、GraphRAGは複雑推論で53.4対42.9、文脈要約で64.4対51.3と通常のベクトルRAGを大きく上回る一方、単純な事実検索では60.1対60.9とほぼ引き分けでした。VentureBeatに寄稿したPersistent SystemsのDattaraj Rao氏は、勝敗を分けるのは技術ではなく「質問の種類」だと結論づけています。

AI
2026-07-31 ・ Simon Willison

smevalsとは?Simon Willison発の軽量evalツールが変える「モデル選定」の作法

Simon Willison氏が、Jesse Vincent氏の応用AI研究ラボPrime Radiantとの共同で「smevals」を公開しました。YAMLファイルを置いたディレクトリをそのままevalスイートにし、`uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6` のように複数モデル構成を横並びで走らせて採点できる、小さな評価ツールです。

AI
2026-07-20 ・ VentureBeat

AIエージェント評価は「1件満点」では危険——コホート対比評価とは何か、LangChain・Convivaが語った次の潮流

VB Transform 2026で、LangChain・Conviva・CoreWeaveの登壇者は「1件の会話ログが満点でも製品は壊れている」ことがあると指摘。個別トレースの採点から、利用者集団をベースラインと比べるコホート対比評価へ、そして安価で用途を絞った小型ジャッジモデルへと評価手法が移りつつあります。

AI
2026-07-17 ・ VentureBeat

AIエージェントの設計はなぜ壊れるのか──Intuitが4カ月で2度作り直した「オーケストレーターの限界」

会計ソフト大手Intuitは、専門エージェントを束ねる中央オーケストレーター方式を約3カ月で放棄し、60日で「スキルとツール」型へ再構築した。原因はエージェント同士が自然言語で結果を受け渡すたびにコンテキストが失われ、誤りが増幅したことにある。VB Transform 2026でAI担当VPのNhung Ho氏が明かした。

AI
2026-07-16 ・ VentureBeat

AIエージェントの「評価ギャップ」とは?社内テスト合格でも顧客障害が半数——VentureBeat調査

VentureBeatのPulse Research調査(157社)で、社内評価に合格したAIエージェントが本番で顧客障害を起こした企業が50%に上ることが判明しました。自動評価を「完全に信頼する」企業はわずか5%にとどまる一方、66%が低リスク領域で人間の確認を外す方向へ動いており、権限と信頼のズレ=「評価ギャップ」が浮き彫りになっています。

← タグ一覧へ