#AI推論コスト の記事一覧(7)

AI
2026-08-28 ・ TechCrunch

NvidiaがHugging Faceを1.3兆円規模で買収か——オープンウェイトモデル争奪戦が事業会社に迫る選択

Nvidiaがオープンウェイトモデルの共有基盤Hugging Faceを130億ドルで買収すると報じられました(未確認)。2週間前にはStripeがOpenRouterを70億ドル超で買収しており、テック大手による「オープンウェイト経済圏」の囲い込みが一気に加速しています。

AI
2026-08-27 ・ The Decoder

GLM-5.3-Flashとは?320B・API単価0.15ドルの中国製モデルが「NVIDIA非依存」で示したもの

Z.aiが公開したGLM-5.3-Flashは、総パラメータ3200億(アクティブ180億)・100万トークン文脈・MITライセンスのマルチモーダルモデルで、Artificial AnalysisのIntelligence Indexで57点と上位モデル並みの水準を、1タスク0.09ドル(GLM-5.3は0.68ドル)で達成しました。さらに事前テストのトラフィックはNVIDIA製ではなく中国製AIチップだけで捌かれ、SemiAnalysisは日次100兆トークンの処理能力だったと報告しています。

AI
2026-08-20 ・ TechCrunch

AIモデルルーターとは?Rampが投入した「Router」で見えるLLM調達の新常識

経費管理SaaSのRampが水曜夜、複数プロバイダーのLLMをAPI経由で切り替えて使えるモデルルーティングサービス「Router」を公開しました。OpenAI、Anthropic、DeepSeek、xAIなど8社のモデルに対応し、2026年内は利用料無料(推論費用は別途)、26ドル分のクレジット特典付きという設計です。

AI
2026-08-16 ・ VentureBeat

RAGのカスケード構成とは?LLM推論コストを約6分の1にした3段階パイプラインを解説

VentureBeatに寄稿したAI/MLエンジニアのVineet Vijay氏は、規制業種の高リスク分類タスクで「決定的ルール→検索→LLM」の3段階カスケードを組み、LLMに回すケースを全体の10〜15%に絞ることで、全件LLM方式に比べ推論コストを約6分の1に削減したと述べています。監査対応と一貫性も同時に改善した点が要点です。

AI
2026-08-05 ・ TechCrunch

Anthropicの自社AIチップ開発とは?「custom silicon team」設立が示す推論コスト競争の本質

AnthropicがAI用の独自チップを設計する専任チーム「custom silicon team」を立ち上げ、TechCrunchに事実を認めました(2026年8月5日報道、初報はBusiness Insider)。同社はハードウェアとモデルを共同設計し、処理を高速かつ効率的にする方針で、先月にはThe Informationがサムスンをパートナー候補として接触していると報じています。

AI
2026-07-27 ・ The Decoder

Kimi K3とは?中国Moonshot AIが公開したオープンモデルの実力と「蒸留疑惑」を整理

中国のMoonshot AIが2026年7月27日、フロンティアモデル競争を揺るがしたKimi K3のモデル重みと技術レポートを公開しました。Hugging Faceで重みが入手可能になり、計算資源あたりの知能が2.5倍という新アーキテクチャや、高性能なアテンションカーネルなどインフラの一部もオープンソース化されています。

AI推論コストの逆風で「小型モデルへの大移動」は起きるか?ArmstrongとHarveyが示す現実解
2026-06-09 ・ TechCrunch

AI推論コストの逆風で「小型モデルへの大移動」は起きるか?ArmstrongとHarveyが示す現実解

Coinbase共同創業者のBrian Armstrongが「12〜18カ月以内に80%のワークロードが99%安価なモデルへ移る」とX上で予測。法務AIのHarveyはFireworks AIと組み、Claude OpusとGLM 5.1を使い分けることで推論コストを3分の1に削減した実例を示しました。

← タグ一覧へ