#CUDA の記事一覧(4)

AI
2026-08-27 ・ The Decoder

GLM-5.3-Flashとは?320B・API単価0.15ドルの中国製モデルが「NVIDIA非依存」で示したもの

Z.aiが公開したGLM-5.3-Flashは、総パラメータ3200億(アクティブ180億)・100万トークン文脈・MITライセンスのマルチモーダルモデルで、Artificial AnalysisのIntelligence Indexで57点と上位モデル並みの水準を、1タスク0.09ドル(GLM-5.3は0.68ドル)で達成しました。さらに事前テストのトラフィックはNVIDIA製ではなく中国製AIチップだけで捌かれ、SemiAnalysisは日次100兆トークンの処理能力だったと報告しています。

AI
2026-07-29 ・ BAIR (Berkeley)

MLXのカーネル最適化はどこまで進んだか?K-SearchがCUDA資産をApple Siliconに移植し、attentionを0.97倍・prefill最大20倍にした仕組み

UC Berkeley Sky Labの進化的カーネル探索フレームワークK-SearchにMLXバックエンドと構造化CUDA→MLX変換層が追加され、Apple製の最先端attentionカーネル比0.26倍だった性能が0.97倍まで到達、Mamba系SSMカーネルではコミュニティ実装mlx-lm比で最大20倍のprefill高速化を記録しました。ローカル推論の実効性能を左右する「カーネル格差」を、人手ではなくAI探索で埋める試みです。

AI
2026-07-20 ・ TechCrunch

CUDAの代替を狙うInfinityとは?「どんなチップでもAIを動かす」カーネル自動生成の狙いを解説

AIインフラ企業Infinityが評価額1億ドルで1500万ドルを調達しました。Nvidia依存の要であるCUDAに代わり、SRAM・GPU・スマホチップ・Systolic Arrayなど「あらゆるチップ」でAIモデルを動かす低レベルソフト(カーネル)をAIエージェントで自動生成するのが狙いです。

← タグ一覧へ