#AA-Briefcase の記事一覧(2)

AI
2026-07-25 ・ The Decoder

Claude Opus 5とは?ベンチマークでFable 5を上回り「より安い」最上位AIの実力を解説

AnthropicのClaude Opus 5が、Artificial Analysis Intelligence Indexで61点を記録しFable 5(60)やGPT-5.6 Sol(59)を上回りながら、1タスク平均$2.03とFable 5($2.75)より安いと複数の評価機関が報告しました。ただし推論の最上位より「high」設定が実用では有利という逆転現象も明らかになっています。

AI
2026-06-19 ・ The Decoder

AA-Briefcaseとは?AIが現実の知識労働で「3%しか完遂できない」現実

Artificial Analysisの新ベンチマーク「AA-Briefcase」で、最上位のClaude Fable 5でも全基準を満たして完遂できたのは全タスクのわずか3%。SlackやメールなどバラバラのファイルからAIが多週間の業務を遂行できるかを測ると、現行モデルの限界が一気に露呈しました。

← タグ一覧へ