#マルチモーダル の記事一覧(3)

AI
2026-08-21 ・ The Decoder

Deepseek V4-Flash-Vision-Expとは?画像1枚384トークンで動くエージェント向け視覚モデルを解説

中国のDeepseekが、V4-Flashに画像理解を足した実験的マルチモーダルモデル「V4-Flash-Vision-Exp」を公開しました。社内のマルチモーダルエージェントベンチマークではOpus 4.8に迫り、項目によっては上回るとされ、画像1枚あたりのコストは最大384トークン、1リクエストに最大600枚を投入できます。

AI
2026-07-23 ・ VentureBeat

FLUX 3とは?画像・音声付き動画20秒・ロボット行動まで生成するBFLの新モデルを解説

独Black Forest Labsが、画像・最大20秒の音声付き動画・ロボットの行動予測までを単一アーキテクチャで生成するマルチモーダル基盤モデル「FLUX 3」を発表しました。同社初の公開動画モデルですが、当面はAPI公開のない審査制の限定早期アクセスで、価格や画像ベンチマークは未公表です。

← タグ一覧へ