Co-Scientistとは?Google DeepMindの「実験まで回すAI科学者」が示した4%の捏造率と、ベンチマークの限界
Google DeepMindが、仮説生成AI「Co-Scientist」を実験計画・装置制御・論文執筆まで担う研究パートナーへ拡張し、材料科学・生物学・計算機科学の3分野で実験検証済みの結果を出したと発表しました。信頼性モジュール有効時の重要結果の捏造率は4%(無効時46%、比較システム90%)で、一方で医療AIの性能はベンチマークと医師評価が食い違いました。
Google DeepMindが、仮説生成AI「Co-Scientist」を実験計画・装置制御・論文執筆まで担う研究パートナーへ拡張し、材料科学・生物学・計算機科学の3分野で実験検証済みの結果を出したと発表しました。信頼性モジュール有効時の重要結果の捏造率は4%(無効時46%、比較システム90%)で、一方で医療AIの性能はベンチマークと医師評価が食い違いました。
GoogleのGal Yona氏らの研究チームは、大規模言語モデル(LLM)のハルシネーション問題を「確信度と言語表現のずれ」と捉え直す「誠実な不確実性(Faithful Uncertainty)」という技術概念を発表した。誤り率を25%から5%に抑えようとすると正しい回答の52%が失われるという従来のトレードオフを、回答拒否ではなく確信度に応じた表現で応答することにより解消しようとするものだ。