Atlas: 空間知能のための世界モデル
World Labsは、"空間知能"を実現することを目的とした次世代の世界モデルであるAtlasを発表しました。Atlasは、テキスト、画像、動画、3Dデータをネイティブに扱えるように、完全に新規に事前学習されたマルチモーダル自己回帰拡散トランスフォーマーです。これらの入力を共有される空間的文脈に統合することで、Atlasは一貫性のある3D環境の生成、スパースな画像からの現実世界シーンの再構築、ロボット工学やVFX向けの複雑な時空間ダイナミクスのシミュレーションが可能になります。
ネイティブな空間制御とカメラ駆動生成
Atlasは、粗いテキスト記述に頼るのではなく、正確なカメラ幾何学をネイティブな入力タイプとして使用することで、ピクセル単位のカメラ制御を可能にします。これにより、ユーザーはシーンの新しいビューを生成するために正確なカメラ位置と角度を指定できます。
- 単一画像の外挿: 単一の入力画像から、Atlasはシーンの残りの部分を想像し、幾何学的に一貫性を保ちながら任意の角度からのビューを生成できます。
- 空間的文脈の管理: Atlasは入力を3D基準の空間的文脈にエンコードします。関係のない参照画像を3D空間に配置すると、モデルはそれらの間を滑らかに補間する世界を生成し、通路やドアといった遷移を想像できます。
- 長編動画: 手動で設計されたカメラパスと空間的文脈を組み合わせることで、Atlasは1440p解像度で最大1分間の一貫性のある動画を生成できます。
高精細な空間再構築
Atlasは、スパースな入力からの新視点合成という根本的なコンピュータビジョンの課題に取り組んでいます。2~3枚の画像だけで現実世界の空間を再構築でき、多くの場合、専用の3D再構築モデルを上回ります。
- スパースから密集への再構築: データが欠落しているシーンのギャップを、事前学習された世界知識に基づいて埋めることができます。入力画像が増えるにつれて、モデルは妥当な補完から忠実で正確な再構築へと移行します。
- 明示的な3D出力: 2Dフレームに加えて、Atlasはネイティブに3D深度マップを生成します。これにより、モデルはポイントクラウドや3Dガウススプラットとして世界を出力でき、ゲーム制作、設計、VFXワークフローで再構築された環境を活用できるようになります。
ロボット工学とVFX向けの時空間シミュレーション
Atlasは、環境が時間とともにどのように変化するかをモデル化する世界シミュレーターとして機能します。この能力は、ロボット工学における「リアルからシミュレーション」ワークフローに特に有用です。
- ロボットシミュレーション: Atlasはスマートフォンの動画から空間を再構築し、その空間をロボットが移動する際にセンサーが観測するRGBデータと深度データを生成できます。これにより、高価なLiDARや専用の撮影設備を必要とせずに、ロボットのナビゲーションや操作のための多様な訓練データを構築できます。
- 動画の再構図: Atlasは、数枚の通常のカメラビューを「ブルットタイム」効果に変換でき、ユーザーは時間を止めて、3台のスマートフォンからの映像を使って不可能な角度からショットを再構図できます。
技術的アーキテクチャ:マルチモーダル自己回帰拡散トランスフォーマー
Atlasは、標準的なLLMや動画モデルのアーキテクチャとは異なり、空間制御を最優先に設計されています。そのアーキテクチャは以下の4つの主要な特徴で定義されます。
- マルチモーダル: テキスト、画像、カメラポーズ、3D深度マップをネイティブに処理します。
- 自己回帰: シーケンスの要素を1つずつ生成するため、異なるシーケンスタイプとして扱うことで、さまざまなタスクに適応できます。
- 拡散: 修正されたフローモデルとして、出力を徐々にノイズ除去することで生成するため、推論速度と品質の間でトレードオフが可能です。
- トランスフォーマー: KVキャッシュを含む現代のハードウェアアクセラレーションと互換性を持つトランスフォーマーベースのバックボーンを使用しています。
性能とスケーリング
World Labsは、Atlasがカメラ条件付き生成および3D再構築の両面で専用モデルを上回っていると報告しています。カメラ制御生成に関する人間評価試験では、カメラ軌道が複雑になるほど、最近の動画モデルと比較して顕著な優位性を示しました。3D再構築ベンチマークでは、最高のオープンソース専用再構築モデルよりも低い誤差率を達成しました。
World Labsは、モデルの性能が訓練用コンピューティングリソースの増加に伴って一貫して向上することを示しており、スケーリングが今後も能力の向上を促進すると述べています。
コミュニティの洞察と反論
技術ユーザー間の議論は、現在の世界モデルアプローチの可能性と限界の両方を浮き彫りにしています。
"明らかに価値があるのは、合成ビューを生成するために利用できる潜在的な知識です... Atlasが入力画像の『床』のように見える領域を識別できることから、『床のような歩行可能領域』という概念を持っていることが示唆されます。これは学習によって得られたものでしょう。"
他のユーザーは、特に動的なシーンにおいて時間的整合性や幻覚の問題に言及しました。
"物が出現したり消えたりする(つまり一貫性のない幻覚)のが見えます。ドミノが倒れるシーンを見てください。ドミノが空から出現したり消えたりするのは容易にわかります。"
また、一部の開発者は、メッシュやスプラットだけでなく、構造化されたシーンプリミティブ(例:パラメトリックな表面)の必要性を指摘しており、CADアプリケーションではユーザーが寸法を設定できるパラメトリックな表面が必要であり、単なる視覚的再構築だけでは不十分であると述べています。
Sources
関連
- Dispatch
- プロジェクト
- プロジェクト
- Dispatch
- Dispatch