#LLMコスト最適化 の記事一覧(3)

AI
2026-07-30 ・ Simon Willison

OpenAI互換APIをローカルで立てるとは?llm-chat-completions-serverが突く会話ログ肥大化の盲点

Simon Willison氏がLLMプラグイン「llm-chat-completions-server 0.1a0」を公開しました。`llm chat-completions-server -p 9001` の一行で、インストール済みの全モデルをOpenAI Chat Completions互換のローカルエンドポイントとして公開でき、真の狙いはLLM 0.32rc1で導入されたコンテンツアドレッサブルなログ、つまり会話履歴の重複をハッシュで排除する仕組みの検証にあります。

AI
2026-07-23 ・ VentureBeat

MAI-Image-2.5-ProとMAI-Voice-2-Flashとは?MicrosoftがOpenAIモデルを自社製に置き換える理由を解説

Microsoftの超知能チームが水曜日、自社製の画像生成モデルMAI-Image-2.5-Proと音声モデルMAI-Voice-2-Flashをパブリックプレビューで公開しました。同社はDynamics 365でGPUコストを最大89%、PowerPointでOpenAIのGPT-Image-2比で最大84%削減したと自社データを示し、フロンティアモデル一択から「用途別に切り替える」戦略へ舵を切っています。

AI
2026-07-13 ・ VentureBeat

ACRouterとは?AIモデル自動振り分けで推論コストを2.6分の1にする「Agent-as-a-Router」を解説

研究者らがオープンソースのモデルルーティング基盤「Agent-as-a-Router」と、その実装であるACRouterを公開しました。実行結果をメモリに書き戻して学習し続ける設計により、全タスクをClaude Opusに投げる場合の34.02ドルを13.21ドルまで圧縮、約2.6分の1のコストで同等水準の性能を実現しています。

← タグ一覧へ