AIエージェント評価は「1件満点」では危険——コホート対比評価とは何か、LangChain・Convivaが語った次の潮流
VB Transform 2026で、LangChain・Conviva・CoreWeaveの登壇者は「1件の会話ログが満点でも製品は壊れている」ことがあると指摘。個別トレースの採点から、利用者集団をベースラインと比べるコホート対比評価へ、そして安価で用途を絞った小型ジャッジモデルへと評価手法が移りつつあります。
VB Transform 2026で、LangChain・Conviva・CoreWeaveの登壇者は「1件の会話ログが満点でも製品は壊れている」ことがあると指摘。個別トレースの採点から、利用者集団をベースラインと比べるコホート対比評価へ、そして安価で用途を絞った小型ジャッジモデルへと評価手法が移りつつあります。
会計ソフト大手Intuitは、専門エージェントを束ねる中央オーケストレーター方式を約3カ月で放棄し、60日で「スキルとツール」型へ再構築した。原因はエージェント同士が自然言語で結果を受け渡すたびにコンテキストが失われ、誤りが増幅したことにある。VB Transform 2026でAI担当VPのNhung Ho氏が明かした。
VentureBeatのPulse Research調査(157社)で、社内評価に合格したAIエージェントが本番で顧客障害を起こした企業が50%に上ることが判明しました。自動評価を「完全に信頼する」企業はわずか5%にとどまる一方、66%が低リスク領域で人間の確認を外す方向へ動いており、権限と信頼のズレ=「評価ギャップ」が浮き彫りになっています。
OpenAIは新モデル公開前に問題発生頻度を予測する手法「Deployment Simulation」を発表しました。GPT-5系列での検証で、変化の方向を92%の精度で的中させ、従来テストの54%を大きく上回りました。
Simon Willison氏が、MarkdownとSVGを同時に扱えるビューア「markdown-svg-renderer」を公開しました。ライブプレビューに加え、fenced code内のSVGを画像描画とコード閲覧の両面で扱える点が特徴です。
Ahead of AIが、訓練済みLLMの評価手法を「多肢選択・検証器・リーダーボード・LLM審判」の4つに整理し、Qwen3 0.6Bを使ったMMLU評価のPyTorch実装例を公開しました。約1.5GBのRAMで動く軽量構成で、自社モデル選定の判断材料として注目に値します。