何が起きたか
研究チームは2026年8月11日、6Bパラメータの世界行動モデル(WAM)「Flex-π」を発表した。Flex-πは、凍結した動画生成VAEがRGBに加えて3D点群マップをほぼ無損失で符号化することを利用し、追加センサーや事前学習なしで3D幾何と物体中心のDINO意味論をRGBと同時に学習する。単一のチェックポイントで、行動のみの高速モードから全ストリームの同時生成まで、任意の入力サブセットで動作可能。実世界の両腕操作タスクで、分布内外ともに最強のベースラインを最大2〜7倍上回る性能を示し、π0.5よりも高速に動作する。
詳細
Flex-πは、RGB、3D点群マップ、DINO意味論、行動を共通の潜在空間に投影し、Mixture-of-Transformersバックボーン内で行動とともに共同でデノイズする。各ストリームにドロップアウトを適用し、クロスモダリティ強制を行うことで、単一の訓練済みチェックポイントが任意のストリームサブセットで動作可能。これにより、行動のみの高速モードから全ストリームの同時生成までを柔軟に切り替えられる。実験では、器用で精密な実世界の両腕操作タスクにおいて、分布内外の両方で最強のベースラインを最大2〜7倍上回る性能を達成し、π0.5よりも高速に動作することを確認した。
Key Facts
| Flex-πは6Bパラメータの世界行動モデルであり、RGB、3D点群マップ、DINO意味論、行動を共通の潜在空間で処理する。 | [1] |
| 凍結した動画生成VAEが3D点群マップをほぼ無損失で符号化することを発見し、点群マップ固有の訓練を一切行わない。 | [1] |
| 単一のチェックポイントが任意のストリームサブセットで動作可能で、行動のみの高速モードから全ストリームの同時生成までを切り替えられる。 | [1] |
| 実世界の両腕操作タスクで、分布内外ともに最強のベースラインを最大2〜7倍上回る性能を示した。 | [1] |
| Flex-πはπ0.5よりも高速に動作する。 | [1] |
本紙の見方
Flex-πの発表は、世界行動モデル(WAM)の設計における重要な転換点を示す。従来のWAMはRGB潜在表現のみを予測し、ピクセル再構成のみに訓練されるため、3D幾何や物体意味論といった操作に必要な信号が欠如していた。Flex-πは、凍結した動画生成VAEがRGBと同時に3D点群マップをほぼ無損失で符号化するという「無料の昼食」を利用し、追加センサーや事前学習なしで3D幾何と物体中心のDINO意味論を統合する。これは、既存のVAEが持つ潜在的な能力を活用する点で、計算資源を追加せずにモデルの性能を向上させる手法として注目に値する。 本手法の核心は、複数の視覚信号を共通の潜在空間に投影し、Mixture-of-Transformersバックボーン内で行動とともに共同でデノイズする点にある。さらに、各ストリームにドロップアウトを適用し、クロスモダリティ強制を行うことで、単一のチェックポイントが任意のストリームサブセットで動作可能となる。これは、推論時の計算柔軟性を提供し、行動のみの高速モードから全ストリームの同時生成までを状況に応じて切り替えることを可能にする。この設計は、実世界のロボット操作において、計算資源が限られた環境でも高性能を発揮するための実用的な解決策となる。 実験結果では、器用で精密な実世界の両腕操作タスクにおいて、分布内外の両方で最強のベースラインを最大2〜7倍上回る性能を達成し、π0.5よりも高速に動作することを示した。これは、Flex-πがデモ効率に優れ、汎化性能が高いことを示唆する。特に、分布外のタスクでの性能向上は、モデルが単なる記憶ではなく、3D幾何と物体意味論を活用した汎用的な操作スキルを獲得していることを示している。 業界構造への含意として、Flex-πのアプローチは、ロボット学習におけるデータ効率と計算効率の両立を可能にする。追加センサーや事前学習を必要としないため、既存のデータセットと計算資源で高性能なポリシーを訓練できる可能性がある。これは、ロボット操作の研究開発コストを削減し、より多くの研究者や企業が高度な操作スキルを開発することを促進する。また、単一のチェックポイントで複数の動作モードを切り替えられることは、エッジデバイスや組み込みシステムなど、計算資源が限られた環境での展開を容易にする。 未確定の論点として、Flex-πの性能が実際の産業用ロボットに適用された場合にどの程度の効果を発揮するかは不明である。実験は特定のタスクに限定されており、より多様なタスクや環境での汎化性能は今後の検証が必要である。また、6Bパラメータのモデルは依然として大規模であり、実用化にはモデルの軽量化や蒸留などの技術が求められる。さらに、3D点群マップの符号化がどの程度の精度で行われるか、またDINO意味論との統合がどのように操作性能に寄与しているかの詳細な分析も今後の課題である。
なぜ重要か
Flex-πは、世界行動モデルにおける3D幾何と物体意味論の統合を、追加センサーや事前学習なしで実現した点で画期的である。これにより、ロボット操作の性能と効率が大幅に向上する可能性があり、実世界の応用に向けた重要な一歩となる。