Lucid
Winter 2025活動中インタラクティブな動画モデル
- サマリー
- インタラクティブな映像モデルで、操作可能な宇宙シミュレーションを構築する
- 課題
- ゲームや物理エンジンでは、リアルな環境をハードコードして構築する必要がある
- 解決策
- 動的なneural networkで、没入感のある操作可能な環境をリアルタイムにシミュレーションする
AI による要約
- 所在地
- San Francisco, CA, USA
- チーム規模
- 3 人
事業内容
インタラクティブな動画モデルを基盤とする世界シミュレーションを構築する。 没入感のある操作が可能な超写実的環境をシミュレーションする動画モデルを訓練し、ハードコードされたゲームエンジンや物理エンジンを動的なニューラルネットワークに置き換える。 Minecraftをシミュレーションする、action-conditioned diffusion video modelを構築した。4090 gaming GPU上で20fps以上で動作し、他のMinecraft World Modelより5倍高速で、訓練に必要なリソースも100分の1に抑えている。独自の着眼点は、tokenizerで大幅な圧縮を行うことにある。従来の8倍に対して128倍の圧縮を実現しており、attentionの計算量はtoken数に対して二次関数的に増加するため、モデルを圧倒的に高速に実行できる。 現在は、超写実的なworld modelを訓練している。