モデルの「重み」で会話させるMostikとは?4Bモデルが753Bの半分の性能に届く仕組みと事業インパクト
ロシアの数学者が創業したスタートアップMostikが、AIモデル同士をテキストではなく重み(weights)の数値レベルで接続する手法を公開しました。753BパラメータのGLM-5.2と、スマホで動く4BのQwen-3.5を「橋渡し」したハイブリッドは、GLM単体の20分の1のコストで、両者のちょうど中間の性能を出したとされています。
ロシアの数学者が創業したスタートアップMostikが、AIモデル同士をテキストではなく重み(weights)の数値レベルで接続する手法を公開しました。753BパラメータのGLM-5.2と、スマホで動く4BのQwen-3.5を「橋渡し」したハイブリッドは、GLM単体の20分の1のコストで、両者のちょうど中間の性能を出したとされています。
AIチップ新興のEtchedが、Jane Street主導で7億ドルを調達し評価額210億ドルに到達しました。7月の103億ドルから1カ月で約110億ドル上乗せという異例の再評価で、鍵は学習ではなく「推論」に特化した2つの新規部品です。
マーケター向けAIツールを手がけるWriterが木曜、オープンソースのGLM-5.2(Z.ai)を追加学習した新フラッグシップモデル「Palmyra X6」と、エージェント実行基盤(ハーネス)の大幅アップデートを同時提供しました。基本的なタスクで顧客のコストを最大50%削減できると見込んでおり、競争軸がベンチマーク性能から単価へ移りつつあることを示す動きです。
OpenAIは来週から、ChatGPT FreeとGoでテキストのみのプロンプトに対するレート制限を撤廃します。あわせて今週中に、Free/Goの既定モデルが今年5月から使われてきたGPT-5.5 Instantから、GPT-5.6ファミリー最小モデルのGPT-5.6 Lunaへ切り替わります。
Microsoft AIは万能フロンティアモデルではなく、分野特化の小型モデルに軸足を移しています。CEOのMustafa Suleyman氏によれば、セキュリティ特化のMAI-Cyber-1-FlashはCyberGymでAnthropicのMythosを12ポイント上回り、コストは半分。画像生成のMAI-Image-2.5-FlashはGPT-Image-2比でGPUコストを最大84%削減するとしています。
OpenAIは2026年7月30日、GPT-5.6の価格改定を発表し、Lunaを80%、Terraを20%値下げしました。Lunaは入力$0.20/出力$1.20(百万トークンあたり)となり、Google Gemini 3.1 Flash-Liteより安く、Claude Haiku 4.5の入力価格の5分の1です。
AlphabetがGeminiを効率的に動かす自社サーバーチップ「Frozen v2」を設計中で、2028年の投入を予定しています。米The Informationが報じ、既存AIチップ比で電力あたりのトークン生成量が6〜10倍向上する可能性があるとされ、報道後にGoogle株は月曜午前に約3%上昇しました。
DeepSeekがV4-Proを75%値下げしても、多くのAIベンダーの粗利は改善していません。VentureBeat寄稿記事は、チャットボットの入力対課金比が約1:5なのに対し、複数ステップのエージェントでは1:700に達する「100倍問題」を指摘。トークン消費の増加が価格下落を上回っている、という構図です。
プリンストン大のArvind NarayananとAkash Kapurが、AIラボの持続的な利益は半導体・データセンター・モデルという基盤層ではなく、その「上のレイヤー」——垂直統合、業務に埋め込まれたエンタープライズ導入、意図的に作り込むスイッチングコスト——から生まれると論じました。鉄道・電力・通信・航空など6つの資本集約型インフラ産業の歴史を引き、2030年代前半までに4〜8兆ドルとされるAIインフラ投資の担い手が、その価値を回収できるとは限らないと指摘しています。
OpenAIが既存モデルの推論コストを半分以下に圧縮し、アカウント無しのChatGPT訪問者を「数百台」のNvidia GPUだけで捌く体制に移行したとThe Informationが報じました。DeepSeekも推論を60〜85%高速化するオープンソース手法を公開しており、フロンティア各社の単位コスト競争が新局面に入っています。
中国DeepSeekがMITライセンスで公開したDSparkは、LLMの出力を変えずにユーザー単位の推論速度を最大85%、厳しい遅延要件下での総スループットを600%超まで引き上げる投機的デコーディング基盤です。V4-Flash(284B)、V4-Pro(1.6T)に加え、QwenやGemmaにも適用検証されており、オープンウェイトを自社運用する企業のコスト構造に直接効く出来事です。
AI推論基盤を提供するBasetenが、$13B(約2兆円規模)の評価額で$1.5Bの資金調達を最終段階に入れたとWall Street Journalが報じました。わずか5カ月前のシリーズEから評価額は160%上昇し、VCマネーが「推論レイヤー」に殺到する構図が鮮明になっています。
Ahead of AIが、モデルの重みを変えずに推論時の計算量で回答精度を高める「推論時スケーリング(inference-time scaling)」の主要6カテゴリを整理しました。書籍『Build a Reasoning Model (From Scratch)』の実験では、ベースモデルの精度が約15%から約52%へと引き上げられたといいます。