#LLM評価 の記事一覧(6)

AI
2026-07-20 ・ VentureBeat

AIエージェント評価は「1件満点」では危険——コホート対比評価とは何か、LangChain・Convivaが語った次の潮流

VB Transform 2026で、LangChain・Conviva・CoreWeaveの登壇者は「1件の会話ログが満点でも製品は壊れている」ことがあると指摘。個別トレースの採点から、利用者集団をベースラインと比べるコホート対比評価へ、そして安価で用途を絞った小型ジャッジモデルへと評価手法が移りつつあります。

AI
2026-07-17 ・ VentureBeat

AIエージェントの設計はなぜ壊れるのか──Intuitが4カ月で2度作り直した「オーケストレーターの限界」

会計ソフト大手Intuitは、専門エージェントを束ねる中央オーケストレーター方式を約3カ月で放棄し、60日で「スキルとツール」型へ再構築した。原因はエージェント同士が自然言語で結果を受け渡すたびにコンテキストが失われ、誤りが増幅したことにある。VB Transform 2026でAI担当VPのNhung Ho氏が明かした。

AI
2026-07-16 ・ VentureBeat

AIエージェントの「評価ギャップ」とは?社内テスト合格でも顧客障害が半数——VentureBeat調査

VentureBeatのPulse Research調査(157社)で、社内評価に合格したAIエージェントが本番で顧客障害を起こした企業が50%に上ることが判明しました。自動評価を「完全に信頼する」企業はわずか5%にとどまる一方、66%が低リスク領域で人間の確認を外す方向へ動いており、権限と信頼のズレ=「評価ギャップ」が浮き彫りになっています。

← タグ一覧へ