#K-Search の記事一覧(1)

AI
2026-07-29 ・ BAIR (Berkeley)

MLXのカーネル最適化はどこまで進んだか?K-SearchがCUDA資産をApple Siliconに移植し、attentionを0.97倍・prefill最大20倍にした仕組み

UC Berkeley Sky Labの進化的カーネル探索フレームワークK-SearchにMLXバックエンドと構造化CUDA→MLX変換層が追加され、Apple製の最先端attentionカーネル比0.26倍だった性能が0.97倍まで到達、Mamba系SSMカーネルではコミュニティ実装mlx-lm比で最大20倍のprefill高速化を記録しました。ローカル推論の実効性能を左右する「カーネル格差」を、人手ではなくAI探索で埋める試みです。

← タグ一覧へ