PerceptionBenchとは?「見る力」だけを測るベンチマークで全モデルが60%未満だった理由
Kimiを開発する中国のMoonshot AIが、マルチモーダルLLMの「視覚認識だけ」を切り出して測るベンチマークPerceptionBenchを公開しました。フロンティア16モデルを評価した結果、最高はGPT-5.6 Solの59.7%で、60%を超えたモデルは1つもありません。
Kimiを開発する中国のMoonshot AIが、マルチモーダルLLMの「視覚認識だけ」を切り出して測るベンチマークPerceptionBenchを公開しました。フロンティア16モデルを評価した結果、最高はGPT-5.6 Solの59.7%で、60%を超えたモデルは1つもありません。