#Artificial Analysis の記事一覧(17)

AI
2026-09-05 ・ The Decoder

Artificial Analysis Intelligence Index 4.2とは?GPT-6 Astraの評価が変わった理由と、AIベンチマークの読み方

AI評価機関Artificial Analysisが、Intelligence Indexをバージョン4.2に更新しました。GPT-6 Astraの実力を捉えられていないという批判を受けたもので、更新後はAstraが前世代Sol比で4ポイント上昇。首位はAnthropicのClaude Fable 5.1、Astraが2位、Metaが3位となっています。

AI
2026-09-02 ・ The Verge

Gemini 3.8 Flashはなぜ「値上げ」に見えるのか?単価据え置きでもタスク単価が約40%上がる理由

Googleが前世代Gemini 3.7 Flashからわずか数週間でGemini 3.8 Flashを投入しました。入力100万トークン0.75ドル・出力3.75ドルという単価は据え置きですが、Artificial Analysisの計測ではタスクあたりコストは約40%上昇。原因は出力トークンが30%増え、エージェント評価での往復回数が増えたことにあります。

AI
2026-08-27 ・ VentureBeat

GLM-5.3-Flashとは?OpenRouterの謎モデル「Ox Alpha」の正体と、100万トークン15セントが崩す推論コストの前提

OpenRouterで6日間正体不明のまま1日数兆トークンを処理していた「Ox Alpha」は、中国Z.aiのGLM-5.3-Flashでした。8月26日の公表と同時に、MITライセンスの公開重み、中国製チップのみでの推論提供、100万トークンあたり15セント/50セントという価格が明らかになり、上位モデルとの「知能2ポイント差に7倍の価格差」という構図が可視化されています。

AI
2026-08-19 ・ VentureBeat

GLM-5.3のAPI料金は入力$1.40・出力$4.40——「据え置き」でもコストが上がる理由

中国のZ.aiが、フロンティア級オープンソースモデル「GLM-5.3」をAPIで提供開始しました。料金は前世代GLM-5.2と同じ100万トークンあたり入力$1.40/出力$4.40。ただしArtificial Analysisの試算では、1タスクあたりのコストは約$0.44から約$0.68へ上昇しています。

AI
2026-08-19 ・ The Decoder

GLM-5.3とは?Z.aiの最新モデルがKimi K3と並びオープン最高峰、脆弱性検出力ゆえの公開延期まで解説

中国のスタートアップZ.aiのGLM-5.3が、Artificial Analysis Intelligence Indexで60点を記録し、Kimi K3と並んでオープンモデル首位に立ちました。タスク単価は0.68ドルでKimi K3の0.84ドルより19%安い一方、オープンウェイトの公開は「脆弱性検出能力が高すぎる」として約2週間延期されています。

AI
2026-08-18 ・ The Decoder

検索APIベンチマーク「Search Index」とは?AIエージェントの精度・コスト・速度をParallel/Exa/Firecrawlで比較

Artificial Analysisが、AIエージェント向け検索APIを品質・コスト・速度で順位づけするベンチマーク「Search Index」を公開しました。同一モデル(GPT-5.6 Luna)で検索プロバイダーだけを差し替えて比較した結果、検索なしの33点に対し、Parallel 75点、Exa 74点、Firecrawl 73点と、検索の有無が2倍以上のスコア差を生んでいます。

AI
2026-08-12 ・ The Decoder

Grok 4.6は「同性能で6割安」か?61点・53ステップの数字からAI調達コストの転換点を読む

SpaceXAIのGrok 4.6がArtificial Analysis Intelligence Indexで61点を獲得し、OpenAIのGPT-5.6 Solと同点に並びました。価格は100万トークンあたり$2/$6と据え置きで、$5/$30のGPT-5.6 Solより6割以上安く、上位モデルとの「性能差」より「価格差」が事業判断の主変数になりつつあります。

AI
2026-08-11 ・ The Decoder

Nemotron 3.5 Lightningとは?31.6B・毎秒670トークンのNvidia新モデルが示す「小さいAIで足りる」の実証

Nvidiaが新シリーズ第1弾となるオープンウェイトモデル「Nemotron 3.5 Lightning」を公開しました。総パラメータ31.6B・アクティブ3.6Bながら、Artificial AnalysisのIntelligence Indexで24点とOpenAIのgpt-oss-120bに並び、毎秒約670トークンという比較対象中で最速のスループットを記録しています。

AI
2026-08-06 ・ The Decoder

Qwen3.8 Maxはなぜ「1タスク1.14ドル」になったのか──スコア56でClaude Opus 4.8並みでも割高になる理由

AlibabaのQwen3.8 MaxがArtificial Analysis Intelligence Indexで56点を記録し、前世代46点から10点上昇してClaude Opus 4.8と同水準に並びました。ただしトークン単価を下げたにもかかわらず1タスクあたりのコストは0.53ドルから1.14ドルへ倍増し、57点を0.86ドルで出すKimi K3に価格性能で逆転されています。

AI
2026-07-31 ・ The Decoder

DeepSeek V4 Flash「0731」とは?GPT-5.6 Lunaに1点差で6割安いコスト構造を解説

DeepSeekが2026年7月31日に公開した廉価モデル「V4 Flash 0731」は、Artificial Analysis Intelligence Indexで50点を記録し、OpenAIの廉価モデルGPT-5.6 Lunaにわずか1点差まで迫りました。OpenAIが80%の値下げを実施した後でも、タスクあたりのコストは約60%安く、価格性能比で首位に立っています。

AI
2026-07-20 ・ Interconnects

Kimi K3とは?中国Moonshot AIの2.8兆パラメータ・オープンモデルが示す「差」の縮小

Moonshot AIが2026年7月16日にオープンウェイトのMoEモデル「Kimi K3」を発表しました。2.8兆パラメータ、重みは7月27日公開予定で、Artificial Analysisの知能指数で総合3位、Frontend Code Arenaで1位。オープンと最先端の差は「6〜9カ月」から「3〜5カ月」へ縮んだと筆者は論じます。

AI
2026-07-16 ・ Simon Willison

Kimi K3とは?Moonshot AIの2.8兆パラメータ「3Tクラス」モデルの実力と価格を解説

中国のMoonshot AIが、同社最強を謳う2.8兆パラメータのAIモデル「Kimi K3」を発表しました。7月27日にオープンウェイト公開を予定し、価格は入力$3/出力$15(100万トークンあたり)と、中国製モデルとして過去最高値を付けました。

AI
2026-07-16 ・ The Decoder

Kimi K3とは?2.8兆パラメータの中国製オープンモデルが示す「激安AIの終わり」

中国のKimiが総パラメータ2.8兆・コンテキスト100万トークンのマルチモーダルモデル「K3」を発表し、7月27日までに全重みを公開します。性能はFable 5とGPT-5.6 Solに次ぐ水準に迫る一方、価格は前世代K2.6から大幅に引き上げられ、中国勢による「フロンティアモデルの激安提供」が転換点を迎えたことを示しています。

AI
2026-07-09 ・ The Decoder

GPT-5.6 Solとは?Claude Fable 5に1点差・コストは3分の1という価格破壊の中身

OpenAIの新フラッグシップGPT-5.6 SolがArtificial AnalysisのIntelligence Indexで59点を記録し、首位のClaude Fable 5(60点)に1点差まで迫りました。しかもタスク単価は1.04ドルとFable 5の2.75ドルの約3分の1で、コーディングエージェント指標では80点で全モデル中トップです。

AI
2026-07-01 ・ The Decoder

Claude Sonnet 5の実質値上げ問題──トークン単価据え置きでもタスク単価が2倍に膨らむ理由

Anthropicの新モデルClaude Sonnet 5は入力$3・出力$15/百万トークンと価格を据え置いた一方、Artificial Analysisの計測では平均タスクコストが前世代Sonnet 4.6の約$1.20から$2.29へとほぼ倍増した。単価は変えず、トークン消費量で実質値上げする構造が続いている。

AI
2026-06-19 ・ The Decoder

AA-Briefcaseとは?AIが現実の知識労働で「3%しか完遂できない」現実

Artificial Analysisの新ベンチマーク「AA-Briefcase」で、最上位のClaude Fable 5でも全基準を満たして完遂できたのは全タスクのわずか3%。SlackやメールなどバラバラのファイルからAIが多週間の業務を遂行できるかを測ると、現行モデルの限界が一気に露呈しました。

← タグ一覧へ