Android Benchとは?Googleのアプリ開発AI評価で自社Geminiが5位に沈む理由
Googleが自ら運営するAndroidアプリ開発向けLLM評価ベンチマーク「Android Bench」の最新版で、Gemini 3.1 Proは5位。首位はClaude Fable 5の84.5%で、GPT 5.4やClaude Sonnet 5にも及ばず、モバイル開発領域でのGeminiの遅れが自社ベンチで可視化された格好です。
Googleが自ら運営するAndroidアプリ開発向けLLM評価ベンチマーク「Android Bench」の最新版で、Gemini 3.1 Proは5位。首位はClaude Fable 5の84.5%で、GPT 5.4やClaude Sonnet 5にも及ばず、モバイル開発領域でのGeminiの遅れが自社ベンチで可視化された格好です。
Moonshot AIはコーディング特化モデル「Kimi K2.7-Code」をオープンソースで公開し、前世代K2.6比で思考トークンを30%削減したと発表したが、独自ベンチマークでの好成績に対し研究者からは「自社テストでの改善は誰でも示せる」との批判が上がっている。