LLM推論の高速化は専用チップかGPU最適化か——仏Kogの3,000TPSと「30倍」の落差を読む
フランスのスタートアップKogが、AMD MI300XとNvidia H200という既存のデータセンター向けGPU上で、1リクエストあたり毎秒3,000トークンのデコードを実証しました。ただし使ったのは約20億パラメータの自社モデルLaneformer 2Bで、掲げる「LLM推論30倍高速化」までにはまだ距離があります。
フランスのスタートアップKogが、AMD MI300XとNvidia H200という既存のデータセンター向けGPU上で、1リクエストあたり毎秒3,000トークンのデコードを実証しました。ただし使ったのは約20億パラメータの自社モデルLaneformer 2Bで、掲げる「LLM推論30倍高速化」までにはまだ距離があります。