MLXのカーネル最適化はどこまで進んだか?K-SearchがCUDA資産をApple Siliconに移植し、attentionを0.97倍・prefill最大20倍にした仕組み
UC Berkeley Sky Labの進化的カーネル探索フレームワークK-SearchにMLXバックエンドと構造化CUDA→MLX変換層が追加され、Apple製の最先端attentionカーネル比0.26倍だった性能が0.97倍まで到達、Mamba系SSMカーネルではコミュニティ実装mlx-lm比で最大20倍のprefill高速化を記録しました。ローカル推論の実効性能を左右する「カーネル格差」を、人手ではなくAI探索で埋める試みです。