Perplexity「Hybrid Compute」とは?機密データはMacのローカルLLM、残りはOpus 5に振り分ける仕組みを解説
Perplexityが、Macアプリ上で1つのタスクをクラウドのフロンティアモデル(Opus 5やGPT-5.6 Sol)とローカルLLMに分割実行する「Hybrid Compute」を発表しました。機密情報はGemma E4BやQwen 3.6(350億パラメータ)などローカルモデルが処理し、そのトークンは課金対象外になります。
Perplexityが、Macアプリ上で1つのタスクをクラウドのフロンティアモデル(Opus 5やGPT-5.6 Sol)とローカルLLMに分割実行する「Hybrid Compute」を発表しました。機密情報はGemma E4BやQwen 3.6(350億パラメータ)などローカルモデルが処理し、そのトークンは課金対象外になります。
WiredがLM Studio Bionicを使ったローカルLLM環境の作り方を紹介しました。MetaやGoogleなどのモデルを無料でダウンロードし、Windows・macOS・Linuxのいずれでもオフライン動作させられる一方、快適に動かすにはRAM 16GB以上、できれば8GB超のVRAMを持つ専用GPUが要るという現実的な条件も示されています。
UC Berkeley Sky Labの進化的カーネル探索フレームワークK-SearchにMLXバックエンドと構造化CUDA→MLX変換層が追加され、Apple製の最先端attentionカーネル比0.26倍だった性能が0.97倍まで到達、Mamba系SSMカーネルではコミュニティ実装mlx-lm比で最大20倍のprefill高速化を記録しました。ローカル推論の実効性能を左右する「カーネル格差」を、人手ではなくAI探索で埋める試みです。
MLX-VLMの開発者Prince Canuma氏が2026年7月21日、AppleのMLXをMacネイティブのデスクトップアプリとして包んだ「Nativ」を公開しました。チャット画面とlocalhost APIサーバーを備え、LM Studioと同じ形でローカルAIを動かせます。