#Apple Silicon の記事一覧(4)

AI
2026-09-01 ・ Engadget

Perplexity「Hybrid Compute」とは?機密データはMacのローカルLLM、残りはOpus 5に振り分ける仕組みを解説

Perplexityが、Macアプリ上で1つのタスクをクラウドのフロンティアモデル(Opus 5やGPT-5.6 Sol)とローカルLLMに分割実行する「Hybrid Compute」を発表しました。機密情報はGemma E4BやQwen 3.6(350億パラメータ)などローカルモデルが処理し、そのトークンは課金対象外になります。

AI
2026-08-29 ・ Wired

ローカルLLMとは?LM Studio Bionicで自社PCにAIを置く条件とメリットを解説

WiredがLM Studio Bionicを使ったローカルLLM環境の作り方を紹介しました。MetaやGoogleなどのモデルを無料でダウンロードし、Windows・macOS・Linuxのいずれでもオフライン動作させられる一方、快適に動かすにはRAM 16GB以上、できれば8GB超のVRAMを持つ専用GPUが要るという現実的な条件も示されています。

AI
2026-07-29 ・ BAIR (Berkeley)

MLXのカーネル最適化はどこまで進んだか?K-SearchがCUDA資産をApple Siliconに移植し、attentionを0.97倍・prefill最大20倍にした仕組み

UC Berkeley Sky Labの進化的カーネル探索フレームワークK-SearchにMLXバックエンドと構造化CUDA→MLX変換層が追加され、Apple製の最先端attentionカーネル比0.26倍だった性能が0.97倍まで到達、Mamba系SSMカーネルではコミュニティ実装mlx-lm比で最大20倍のprefill高速化を記録しました。ローカル推論の実効性能を左右する「カーネル格差」を、人手ではなくAI探索で埋める試みです。

← タグ一覧へ