#eval の記事一覧(2)

AI
2026-07-31 ・ Simon Willison

smevalsとは?Simon Willison発の軽量evalツールが変える「モデル選定」の作法

Simon Willison氏が、Jesse Vincent氏の応用AI研究ラボPrime Radiantとの共同で「smevals」を公開しました。YAMLファイルを置いたディレクトリをそのままevalスイートにし、`uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6` のように複数モデル構成を横並びで走らせて採点できる、小さな評価ツールです。

AI
2026-07-20 ・ VentureBeat

AIエージェント評価は「1件満点」では危険——コホート対比評価とは何か、LangChain・Convivaが語った次の潮流

VB Transform 2026で、LangChain・Conviva・CoreWeaveの登壇者は「1件の会話ログが満点でも製品は壊れている」ことがあると指摘。個別トレースの採点から、利用者集団をベースラインと比べるコホート対比評価へ、そして安価で用途を絞った小型ジャッジモデルへと評価手法が移りつつあります。

← タグ一覧へ