World LabsのAtlasとは?写真数枚から3D空間を生成・復元する「空間文脈」モデルを解説
フェイフェイ・リー氏率いるWorld Labsが、テキスト・画像・動画・3Dデータをゼロから学習した「オムニモデル」Atlasを公開しました。2〜3枚の写真から3D空間を再構成し、1440pで最長1分の映像をカメラ位置指定つきで生成、再構成誤差の中央値25.3で専用3Dモデルを上回るとしています。
フェイフェイ・リー氏率いるWorld Labsが、テキスト・画像・動画・3Dデータをゼロから学習した「オムニモデル」Atlasを公開しました。2〜3枚の写真から3D空間を再構成し、1440pで最長1分の映像をカメラ位置指定つきで生成、再構成誤差の中央値25.3で専用3Dモデルを上回るとしています。
Runwayが、コードを実行せずにユーザーインターフェースを1フレームずつ生成する新モデル「Solaris」を公開しました。同社が「Interface World Models」と名付けた新カテゴリの第1号で、720pでUIそのものを描画し、クリック・ドラッグ・音声に反応します。
Lightricksからスピンアウトしたモデル企業LTXが、オープンウェイトの動画・ワールドモデル「LTX-2.5」を公開し、ノードベース制作ツールComfyUIへの初日統合を実現しました。年間経常収益1000万ドル未満の組織は無償、720p+音声で1秒0.09ドル、最小16GB VRAMで自社環境に置ける一方、派生モデルまで縛る独自ライセンスが実務上の争点になります。
シンガポール発のAI動画スタートアップPixVerseが、シリーズCの延長ラウンドで4億3900万ドルを調達し、評価額20億ドル超に達しました。出資にはAlibaba、Mirae Assetらが名を連ね、元ByteDanceのWang Changhu氏らが2023年に創業した同社は登録ユーザー1億5000万人を抱えます。
ベゾス出資のGeneral Intuitionが3.2億ドルを調達し、評価額23億ドルに到達しました。ChatGPTやClaudeが不得意な「空間と時間の理解」を、ゲームプレイ映像から学習させる「ワールドモデル」で埋める構想です。
ニューヨークのスタートアップGeneral Intuitionが、評価額20億ドル超で約3億ドルの資金調達を協議中です。Medalが持つ年間20億本のゲームプレイ動画を学習データに、AIエージェントに空間・時間の推論能力を教え込む基盤モデルを構築しています。
自動運転出身者が率いる米Odysseyが、評価額14.5億ドルでシリーズBに3.1億ドルを調達。Amazon・AMD Ventures・GVが参画し、テキスト中心の大規模言語モデルの次に来るとされる「ワールドモデル」開発を加速します。
AmazonとNvidia、AMDのVC部門が、3Dで物理世界をシミュレートする「ワールドモデル」を開発するOdyssey MLに3.1億ドルを出資し、評価額は14.5億ドルに達しました。言語モデルの次の主戦場として、物理・空間理解を担うAIに巨額資金が流れ始めています。