Perplexity「Hybrid Compute」とは?機密データはMacのローカルLLM、残りはOpus 5に振り分ける仕組みを解説
Perplexityが、Macアプリ上で1つのタスクをクラウドのフロンティアモデル(Opus 5やGPT-5.6 Sol)とローカルLLMに分割実行する「Hybrid Compute」を発表しました。機密情報はGemma E4BやQwen 3.6(350億パラメータ)などローカルモデルが処理し、そのトークンは課金対象外になります。
Perplexityが、Macアプリ上で1つのタスクをクラウドのフロンティアモデル(Opus 5やGPT-5.6 Sol)とローカルLLMに分割実行する「Hybrid Compute」を発表しました。機密情報はGemma E4BやQwen 3.6(350億パラメータ)などローカルモデルが処理し、そのトークンは課金対象外になります。
アリババが動画生成モデル「Wan3.0」のベータ版を公開しました。最長30秒(前世代Wan2.5の2倍)で、テキストだけでなくPDF・Webページ・PowerPointファイルまで入力に使えるのが最大の変化で、1080pの30秒動画はStandardで6.00ドル、高速なPrimeで8.40ドルです。
気候科学者Zeke Hausfather氏が自身のClaude Codeのセッションログ8週間分を解析し、エージェント型AIの消費電力を1プロンプトあたり約150Wh、Geminiの中央値プロンプト0.24Whの約600倍と試算しました。1,138回の入力が14,000回超のモデル呼び出しを生み、処理トークンは32億に達しています。
Anthropicは7月20日から、Claude Fable 5をMaxとTeam Premiumプランに大幅減枠で残す一方、ProとTeam StandardのユーザーはFable 5を実質失い、一度限りの100ドルクレジット後はAPI料金の支払いへ移行させます。当初は全サブスクからのFable撤去を計画していましたが、方針を転換しました。
MicrosoftがExcelやWordの一部プロンプト処理を、自社開発の「MAI」モデルに切り替え始めたとBloombergが報じました。OpenAIとAnthropicへの依存度を下げ、AI提供コストを圧縮する動きです。
Teslaが7月6日から社内エンジニアのAI利用料を週200ドルに制限しました。これまで一人あたり週数千ドル規模のトークンを消費していた実態への歯止めであり、AI活用を加速したい号令と現場のコスト暴走が同時進行している構図が浮き彫りになっています。
Anthropicが2026年6月30日にリリースしたClaude Sonnet 5は、表示上の単価はSonnet 4.6と同じ$3/$15を据え置きつつ、新トークナイザーが同じ入力に対し約30%多くトークンを生成するため、実質的な値上げとなっている。英語では約1.42倍、Pythonコードでは約1.28倍のトークン数となり、実際の請求額に直結する。
Googleが2026年6月30日、画像生成モデル「Nano Banana 2 Lite(Gemini 3.1 Flash Lite Image)」を公開しました。API識別子はgemini-3.1-flash-lite-imageで、Gemini画像モデルの中で最速・最安を謳い、大量生成用途に振り切った位置づけです。
AnthropicのClaudeなど生成AIの利用料が急増し、Royal Bank of Canadaでは半年でトークン使用量が500%増加。8x8は18か月で約500万ドルのソフト費用を削減した一方、Meta・Uber・Salesforceは利用上限の導入に動いています。