何が起きたか
Googleが今年3月に立ち上げた「Android Bench」は、100件のAndroidアプリ開発タスクでLLMの実力を測るベンチマークです。今回のアップデートでは、Claude Fable 5、Claude Sonnet 5、Claude Opus 4.8、GLM 5.2、Kimi K2.7 Code、MiniMax M3、Qwen 3.7 Plus、Qwen 3.7 Maxの8モデルが追加され、フレームワークも刷新されました。開発者は自らテストを走らせフィードバックを送ることができます。
リーダーボード首位はClaude Fable 5で正答率84.5%。GPT 5.4、Claude Sonnet 5、Claude Fable 5に続き、Gemini 3.1 Proは5位に留まりました。3月の初回リリース時点でもGoogleのモデルは首位ではなくOpenAIがわずかにリードしていましたが、その構図はさらに広がった形です。
なぜ重要か
Android Benchは他社ではなく「Google自身」が設計・運営している評価軸です。そこで自社モデルが5位という結果は、少なくともAndroid開発というホームグラウンドで、AnthropicとOpenAIに対して実装能力の差が開いていることを、Googleが自ら公表したことを意味します。
論点:プラットフォーマー優位は成立しない
Android SDK、Kotlin、Jetpack Composeなどエコシステムを握るGoogleがコード生成でも優位に立つ、という直感的な仮説は今回のスコアで揺らぎました。学習データの量や独自の内部知識よりも、モデル本体の推論能力とコード品質が結果を支配していると読むのが自然です。GLM、Kimi、MiniMax、Qwenなど中国勢を横並びで追加している点も、Googleが「勝てる相手」を選ぶより「実力の現在地」を晒すことを優先したと解釈できます。
💼 事業会社視点:これは自社にどう効くか
日本の事業責任者は何を読み取るべきか
モバイルアプリを外注・内製で持つEC、金融、メディア、ゲーム各社にとって、この結果は「開発補助AIのデフォルト選定」を見直すシグナルです。多くの日本企業はGoogle Workspace契約の延長線上でGeminiをコーディング用途にも当てがちですが、Android実装に限れば現時点でClaude Fable 5・Sonnet 5、GPT 5.4の方が実装精度が高いことをGoogle自身が示しました。
受託開発・SIerは、顧客に「Gemini前提の開発体制」を提案してきた場合、根拠を再検証すべきです。逆にAndroidを主戦場とするスタートアップは、Cursor等のエディタでモデルを切り替え、タスク別に使い分ける運用が費用対効果で有利になります。役員層は「どのAIを全社標準にするか」ではなく「用途別にどの組み合わせを許容するか」を意思決定の単位に切り替える時期です。契約・情報漏洩リスクの整理を法務と並走させ、四半期ごとにベンチ結果と実案件品質を突き合わせる仕組みを持てるかが差になります。