#ローカルLLM の記事一覧(14)

AI
2026-09-02 ・ Engadget

NVIDIA RTX Sparkとは?AcerのAI小型デスクトップ2機種から見える「AIをオフィスに置く」時代の始まり

Acerが、NVIDIA RTX Spark搭載の「Acer SFF RTX Spark」と、Intel Core Ultra X7 358Hを積む「Veriton RI110 AI Mini Workstation」という小型AIデスクトップ2機種を発表しました。前者は最大6,144コアのBlackwell RTX GPU、最大20コアのGrace CPU、最大128GBメモリという構成で、最大1ペタフロップスの演算性能を掲げます。

AI
2026-09-01 ・ Engadget

Perplexity「Hybrid Compute」とは?機密データはMacのローカルLLM、残りはOpus 5に振り分ける仕組みを解説

Perplexityが、Macアプリ上で1つのタスクをクラウドのフロンティアモデル(Opus 5やGPT-5.6 Sol)とローカルLLMに分割実行する「Hybrid Compute」を発表しました。機密情報はGemma E4BやQwen 3.6(350億パラメータ)などローカルモデルが処理し、そのトークンは課金対象外になります。

AI
2026-08-29 ・ Wired

ローカルLLMとは?LM Studio Bionicで自社PCにAIを置く条件とメリットを解説

WiredがLM Studio Bionicを使ったローカルLLM環境の作り方を紹介しました。MetaやGoogleなどのモデルを無料でダウンロードし、Windows・macOS・Linuxのいずれでもオフライン動作させられる一方、快適に動かすにはRAM 16GB以上、できれば8GB超のVRAMを持つ専用GPUが要るという現実的な条件も示されています。

AI
2026-08-26 ・ Simon Willison

Qwen3.8-Flash-Nextとは?125Bで6Bだけ動くMoEが「手元のGPU」に降りてくる意味

Qwenが公開したオープンウェイトのマルチモーダルMoE「Qwen3.8-Flash-Next」は、125Bという規模でありながら実際に動くのは6Bのみ。Simon Willison氏は2026年8月26日、Unslothの量子化版(72.5GB版・78.9GB版)をDGX Spark上でローカル実行した経過を公開しました。次世代Qwen4アーキテクチャの先行版という位置づけです。

AI
2026-08-16 ・ Simon Willison

Qwen 3.8 27Bとは?17GBでノートPCが「1年前の最強モデル」になった実測と、xhigh既定値の罠

AlibabaのQwen研究チームが8月14日に公開したApache 2ライセンスの27BパラメータVLM「Qwen 3.8 27B」を、Simon Willison氏が128GB M5 Max MacBook ProとNVIDIA DGX Sparkで実測。17GBの量子化ファイルでツール呼び出しもコーディングエージェントも回る一方、既定の推論強度「xhigh」では円を1つ描かせるだけで数分、SVG生成に21分・推論トークン22,276という異常な挙動を示しました。

AI
2026-08-15 ・ Simon Willison

CORS Chatとは?ブラウザだけでローカルLLMを叩けるOpenAI Responses互換チャットUIの意味を解説

開発者のSimon Willison氏が、CORSヘッダーに対応したOpenAI Responses互換エンドポイントとブラウザから直接会話できるツール「CORS Chat」を公開しました。LM Studio上のQwen 3.8 27BをM5 MacBook ProとNVIDIA DGX Sparkで検証するために、GPT-5.6-Sol xhighを使って1日で作られたものです。

AI
2026-08-10 ・ Simon Willison

Muse Glimmerとは?Metaの30BモデルがApache 2.0で出た意味を、ローカル実行の現実解から読む

Metaがオープンウェイトモデルの公開に復帰し、30BのビジョンモデルMuse GlimmerをApache 2.0ライセンスで公開しました。LM Studio版は18.16GBで、32GBメモリのマシンなら他アプリと同時に動かせる——エージェント用途のモデルが「自社のPCの中」に降りてきたことが最大の変化です。

AI
2026-07-30 ・ Simon Willison

OpenAI互換APIをローカルで立てるとは?llm-chat-completions-serverが突く会話ログ肥大化の盲点

Simon Willison氏がLLMプラグイン「llm-chat-completions-server 0.1a0」を公開しました。`llm chat-completions-server -p 9001` の一行で、インストール済みの全モデルをOpenAI Chat Completions互換のローカルエンドポイントとして公開でき、真の狙いはLLM 0.32rc1で導入されたコンテンツアドレッサブルなログ、つまり会話履歴の重複をハッシュで排除する仕組みの検証にあります。

AI
2026-06-27 ・ Ahead of AI

ローカルコーディングエージェントとは?Qwen3.6とOllamaで自前構築する手順を解説

Ahead of AIが、Qwen3.6 35B-A3BとOllama、Qwen-Codeハーネスを組み合わせ、ファイル編集やコマンド実行まで行える「production-readyなローカルコーディングエージェント」の構築手順を公開しました。CodexやClaude Codeへの依存を減らし、固定費・オフライン・プライバシーを担保する実践的な代替案です。

AI
2026-06-24 ・ VentureBeat

ローカル完結型AIエージェントOS「Rebel」とは?Markdownで記憶を持つ新潮流をMindstoneが投入

ロンドン拠点のAIスタートアップMindstoneが、ローカルファースト型のエージェント型AI OS「Rebel」をFair Sourceライセンスで正式公開した。エージェントの記憶と命令をMarkdownファイル(agents.md)で管理し、100ユーザー未満の組織は無償で利用できる。

AI
2026-06-03 ・ VentureBeat

Gemma 4 12Bとは?ノートPCで動く新型オープンモデルが企業のAI内製を変える理由

Googleが11.95Bパラメータのオープンモデル「Gemma 4 12B」をApache 2.0で公開しました。エンコーダーレスの統合アーキテクチャを採用し、16GBメモリの業務用ノートPC上でマルチモーダル処理と256Kトークンの長文脈、エージェント機能をローカル実行できます。

AI
2025-08-09 ・ Ahead of AI

gpt-oss-120b/20bとは?OpenAIが6年ぶりに公開したオープンウェイトLLMの中身を解説

OpenAIが2019年のGPT-2以来となるオープンウェイトモデル「gpt-oss-120b」「gpt-oss-20b」を公開しました。20bは16GBのコンシューマGPUで、120bは80GBのH100単体で動かせる設計で、Mixture-of-ExpertsやGrouped Query Attentionなど現代的なアーキテクチャを採用しています。

← タグ一覧へ