#LLMベンチマーク の記事一覧(2)

AI
2026-07-08 ・ Ars Technica

Android Benchとは?Googleのアプリ開発AI評価で自社Geminiが5位に沈む理由

Googleが自ら運営するAndroidアプリ開発向けLLM評価ベンチマーク「Android Bench」の最新版で、Gemini 3.1 Proは5位。首位はClaude Fable 5の84.5%で、GPT 5.4やClaude Sonnet 5にも及ばず、モバイル開発領域でのGeminiの遅れが自社ベンチで可視化された格好です。

Moonshot AIがKimi K2.7-Codeを公開――思考トークン30%削減を主張するも、独立ベンチマークでは疑問符
2026-06-12 ・ VentureBeat

Moonshot AIがKimi K2.7-Codeを公開――思考トークン30%削減を主張するも、独立ベンチマークでは疑問符

Moonshot AIはコーディング特化モデル「Kimi K2.7-Code」をオープンソースで公開し、前世代K2.6比で思考トークンを30%削減したと発表したが、独自ベンチマークでの好成績に対し研究者からは「自社テストでの改善は誰でも示せる」との批判が上がっている。

← タグ一覧へ