Deepseek V4-Flash-Vision-Expとは?画像1枚384トークンで動くエージェント向け視覚モデルを解説
中国のDeepseekが、V4-Flashに画像理解を足した実験的マルチモーダルモデル「V4-Flash-Vision-Exp」を公開しました。社内のマルチモーダルエージェントベンチマークではOpus 4.8に迫り、項目によっては上回るとされ、画像1枚あたりのコストは最大384トークン、1リクエストに最大600枚を投入できます。
中国のDeepseekが、V4-Flashに画像理解を足した実験的マルチモーダルモデル「V4-Flash-Vision-Exp」を公開しました。社内のマルチモーダルエージェントベンチマークではOpus 4.8に迫り、項目によっては上回るとされ、画像1枚あたりのコストは最大384トークン、1リクエストに最大600枚を投入できます。
OpenAIがGPT-Image-2のAPIで背景透過PNGの生成をプレビュー提供しています。パラメータ「background=transparent」を指定するだけで、切り抜き処理を挟まずにアルファチャンネル込みの画像が得られる仕組みで、Cookbookでは商品写真・PowerPoint図版・アイコンやステッカー・グッズ用アートワークという4つの用途が示されています。
Redditが、LLMでルール違反を判定する新モデレーションツール「Rules Hub」を新規作成コミュニティ全体へ拡大しました。700以上のコミュニティでの数カ月の試験を経たもので、同社は2026年内の一般提供を予定。同じ日に、新規サードパーティアプリの公開APIからDeveloper Platformへの移行義務化と、old Redditへの追加変更も明らかにしています。
Xは月曜、AIツールが利用者自身のアカウント権限でX APIに接続できるホスト型MCPサーバーを公開しました。ClaudeやCursorなどのAIアシスタントから、開発者がサーバー構築や認証実装をせずにXの検索・投稿分析機能を呼び出せるようになります。
Googleは動画生成AI「Gemini Omni Flash」をAPI公開しました。720p・最大10秒の動画を1秒0.10ドル(10秒約1ドル)で生成でき、会話形式でリライティングや衣装変更などを重ねられる点が特徴です。