#ハルシネーション の記事一覧(9)

AI
2026-09-01 ・ VentureBeat

AIハルシネーションは「知識不足」ではない?Google Research論文が示す記憶と想起のズレ

Google ResearchとTechnionの研究チームが、GPT-5やGemini-3といった最先端LLMは検証対象の事実の95〜98%を内部に保持しながら、そのうち26〜34%を直接の質問では引き出せないとする分析を公開しました。推論時に「考えさせる」だけで、引き出せなかった事実の40〜65%が回復するといいます。

AI
2026-08-15 ・ The Decoder

PerceptionBenchとは?「見る力」だけを測るベンチマークで全モデルが60%未満だった理由

Kimiを開発する中国のMoonshot AIが、マルチモーダルLLMの「視覚認識だけ」を切り出して測るベンチマークPerceptionBenchを公開しました。フロンティア16モデルを評価した結果、最高はGPT-5.6 Solの59.7%で、60%を超えたモデルは1つもありません。

AI
2026-08-08 ・ Engadget

ClaudeとChatGPTの違いを2026年版で比較——幻覚率55%対89%、無料枠の広告、Cowork/skillsまで

AA-Omniscienceの精度スコアはClaude Fable 5(Max)61%対GPT 5.6 Sol(Max)59%とほぼ互角ですが、ハルシネーション率はClaude 55%対ChatGPT 89%と大差がつきました。Engadgetの比較記事は、性能差より「間違えなさ」「無料枠の広告」「2026年2月の米政府契約」という三点が両者の選択を分けていると指摘しています。

AI
2026-08-06 ・ The Decoder

Qwen3.8 Maxはなぜ「1タスク1.14ドル」になったのか──スコア56でClaude Opus 4.8並みでも割高になる理由

AlibabaのQwen3.8 MaxがArtificial Analysis Intelligence Indexで56点を記録し、前世代46点から10点上昇してClaude Opus 4.8と同水準に並びました。ただしトークン単価を下げたにもかかわらず1タスクあたりのコストは0.53ドルから1.14ドルへ倍増し、57点を0.86ドルで出すKimi K3に価格性能で逆転されています。

AI
2026-06-27 ・ The Verge

マーガレット・アトウッドはなぜClaudeを「ガベージイン・ガベージアウト」と切り捨てたか

『侍女の物語』の著者マーガレット・アトウッドが、Anthropicの「Claude」を一度だけ使った経験を根拠にAIを酷評しました。英ドラマ『ファーザー・ブラウン』に関する質問でClaudeが誤った回答を返したことを、彼女は「嘘をついた」と表現しています。

AI
2026-06-19 ・ The Decoder

AI Overviewsの法的責任は誰にあるか?ミュンヘン地裁判決とGoogle控訴から読む生成AIの線引き

ドイツ・ミュンヘン地方裁判所は、GoogleのAI Overviewsを「単なる検索結果ではなく独立したコンテンツ」と認定し、Googleに直接責任を負わせる判決を下しました。Googleは控訴の方針を表明し、AI生成コンテンツの法的位置づけを巡る欧州での攻防が本格化しています。

ハルシネーション対策スタートアップ「Probably」とは?a16zが9億円超を投じた「データサイエンス機械スーツ」の中身
2026-06-16 ・ TechCrunch

ハルシネーション対策スタートアップ「Probably」とは?a16zが9億円超を投じた「データサイエンス機械スーツ」の中身

AIの幻覚(ハルシネーション)を構造的に潰すスタートアップProbablyが、Andreessen Horowitzから900万ドルのシードを調達。LLMの一次回答を決定論的バリデータで検証する「ハーネス」で、99.99%の精度と「フロンティアモデルより4階級下のモデルでデスクトップ動作」を両立させる狙いです。

← タグ一覧へ