AIハルシネーションは「知識不足」ではない?Google Research論文が示す記憶と想起のズレ
Google ResearchとTechnionの研究チームが、GPT-5やGemini-3といった最先端LLMは検証対象の事実の95〜98%を内部に保持しながら、そのうち26〜34%を直接の質問では引き出せないとする分析を公開しました。推論時に「考えさせる」だけで、引き出せなかった事実の40〜65%が回復するといいます。
Google ResearchとTechnionの研究チームが、GPT-5やGemini-3といった最先端LLMは検証対象の事実の95〜98%を内部に保持しながら、そのうち26〜34%を直接の質問では引き出せないとする分析を公開しました。推論時に「考えさせる」だけで、引き出せなかった事実の40〜65%が回復するといいます。
Kimiを開発する中国のMoonshot AIが、マルチモーダルLLMの「視覚認識だけ」を切り出して測るベンチマークPerceptionBenchを公開しました。フロンティア16モデルを評価した結果、最高はGPT-5.6 Solの59.7%で、60%を超えたモデルは1つもありません。
AA-Omniscienceの精度スコアはClaude Fable 5(Max)61%対GPT 5.6 Sol(Max)59%とほぼ互角ですが、ハルシネーション率はClaude 55%対ChatGPT 89%と大差がつきました。Engadgetの比較記事は、性能差より「間違えなさ」「無料枠の広告」「2026年2月の米政府契約」という三点が両者の選択を分けていると指摘しています。
AlibabaのQwen3.8 MaxがArtificial Analysis Intelligence Indexで56点を記録し、前世代46点から10点上昇してClaude Opus 4.8と同水準に並びました。ただしトークン単価を下げたにもかかわらず1タスクあたりのコストは0.53ドルから1.14ドルへ倍増し、57点を0.86ドルで出すKimi K3に価格性能で逆転されています。
『侍女の物語』の著者マーガレット・アトウッドが、Anthropicの「Claude」を一度だけ使った経験を根拠にAIを酷評しました。英ドラマ『ファーザー・ブラウン』に関する質問でClaudeが誤った回答を返したことを、彼女は「嘘をついた」と表現しています。
ドイツ・ミュンヘン地方裁判所は、GoogleのAI Overviewsを「単なる検索結果ではなく独立したコンテンツ」と認定し、Googleに直接責任を負わせる判決を下しました。Googleは控訴の方針を表明し、AI生成コンテンツの法的位置づけを巡る欧州での攻防が本格化しています。
AIの幻覚(ハルシネーション)を構造的に潰すスタートアップProbablyが、Andreessen Horowitzから900万ドルのシードを調達。LLMの一次回答を決定論的バリデータで検証する「ハーネス」で、99.99%の精度と「フロンティアモデルより4階級下のモデルでデスクトップ動作」を両立させる狙いです。
ドイツ・ミュンヘン地方裁判所が、GoogleのAI要約機能「AI Overviews」が生成した虚偽情報についてGoogleの責任を認める仮処分を下しました。Googleは名誉毀損とされた記述の大部分の削除と、訴訟費用の80%負担を命じられています。
Anthropicは2026年5月28日にClaude Opus 4.8を公開しました。性能向上は控えめながら、コードの欠陥を見逃す割合が前世代比で約4分の1に減るなど「ハルシネーション抑制」に明確な進歩が見られる点が特徴です。