何が起きたか
研究チームは、世界行動モデル(WAM)の新手法「Flex-π」を発表した。Flex-πは6Bパラメータのモデルで、RGBに加えて3D幾何学とオブジェクト中心のDINO意味情報を活用する。彼らは、凍結したビデオ生成VAEがRGBを符号化する際に、3D点群マップもほぼ損失なく符号化することを発見した。これにより、追加のセンサーや事前学習、推論レイテンシの増加なしに、3D幾何学とDINO意味情報を教師信号として利用できる。すべての視覚信号は共有潜在空間に投影され、Mixture-of-Transformersバックボーン内でアクションと共同でデノイズされる。また、ストリームごとのドロップアウトとクロスモダリティ強制により、単一の訓練済みチェックポイントが任意のストリームのサブセットで動作可能で、高速なアクション専用モードから完全な共同生成まで対応する。結果として、デモ効率が非常に高く、分布内外の実世界の両腕操作タスクで最強ベースラインを最大2〜7倍上回り、π0.5よりも高速に動作する。
Key Facts
| Flex-πは6Bパラメータの世界行動モデル(WAM)である。 | 出典一覧 |
| Flex-πはRGBに加えて3D幾何学とオブジェクト中心のDINO意味情報を活用する。 | 出典一覧 |
| 凍結したビデオ生成VAEがRGBを符号化する際に、3D点群マップもほぼ損失なく符号化することを発見した。 | 出典一覧 |
| 追加のセンサー、事前学習、推論レイテンシの増加なしで3D幾何学とDINO意味情報を教師信号として利用できる。 | 出典一覧 |
| すべての視覚信号は共有潜在空間に投影され、Mixture-of-Transformersバックボーン内でアクションと共同でデノイズされる。 | 出典一覧 |
| ストリームごとのドロップアウトとクロスモダリティ強制により、単一の訓練済みチェックポイントが任意のストリームのサブセットで動作可能である。 | 出典一覧 |
| 実世界の両腕操作タスクで最強ベースラインを最大2〜7倍上回る性能を示した。 | 出典一覧 |
| Flex-πはπ0.5よりも高速に動作する。 | 出典一覧 |
なぜ重要か
この研究は、世界行動モデルにおいて、追加のセンサーや事前学習なしで3D幾何学と意味情報を活用できることを示しており、ロボット操作のデモ効率と汎化性能を大幅に向上させる可能性がある。特に、実世界の両腕操作タスクでの性能向上は、産業応用への期待を高める。