LLM評価ハーネスとは?正解データで測ると見えた「自信満々な誤答」の正体
エンタープライズアーキテクトのArun Mishra氏がVentureBeatに寄稿し、データ移行ドリフトの根本原因を説明するLLMツールを正解ラベル付きデータで採点したところ、モデルの確信度は精度と相関せず、最も間違っているケースで最も自信を示していたと報告しました。評価ハーネスは合成グラウンドトゥルース・スコアリング関数・全件評価の3要素で構成されます。
エンタープライズアーキテクトのArun Mishra氏がVentureBeatに寄稿し、データ移行ドリフトの根本原因を説明するLLMツールを正解ラベル付きデータで採点したところ、モデルの確信度は精度と相関せず、最も間違っているケースで最も自信を示していたと報告しました。評価ハーネスは合成グラウンドトゥルース・スコアリング関数・全件評価の3要素で構成されます。
よくテストされたAIチャットボットでも、モデルやプロンプトを一切変えなくても、公開3カ月後には利用者の質問の約3分の1に自信満々で誤答するようになる。VentureBeatの寄稿でエンジニアは、原因はモデルやコンテキストではなく、データエンジニアリング層の劣化——古く不完全なデータ——だと指摘し、正確性・鮮度・一貫性・来歴という4つの観測指標を処方箋として示す。