何が起きたか
研究チームは2026年8月25日、arxiv.orgでGaussianWAMを発表した。これはWorld-Action Models(WAM)の訓練時に、3Dガウシアン場を通じて幾何・意味的教師信号を表現に蒸留するフレームワークである。LIBERO-Plusベンチマークで、FastWAMの成功率を52.05%から71.29%に、Cosmos Policyを71.52%から77.30%に向上させた。
詳細
GaussianWAMは、同期マルチビュー観測から、凍結された幾何・視覚基盤モデルが深度・カメラパラメータ・高密度意味特徴を提供し、これらを共有ガウシアンプリミティブに結合して、空間的に整列した意味・深度・カバレッジターゲットをレンダリングし、WAMの現在観測表現に蒸留する。訓練後は教師モデル・ガウシアン成分・補助予測ヘッドをすべて除去し、元のWAM推論パスに追加モジュールや追加計算を残さない。直接のCLIPおよびVGGT蒸留でFastWAMのベースラインは69.37%に達し、ガウシアン場による統合で71.29%に向上した。標準LIBEROでも性能が向上し、RoboTwinおよび実世界操作で正の転移傾向を示した。
Key Facts
| GaussianWAMは、3Dガウシアン場を介して幾何・意味的教師信号をWAM表現に蒸留する訓練時フレームワークである。 | [1] |
| LIBERO-PlusでFastWAMの成功率を52.05%から71.29%に改善した。 | [1] |
| LIBERO-PlusでCosmos Policyの成功率を71.52%から77.30%に改善した。 | [1] |
| 直接のCLIPおよびVGGT蒸留でFastWAMのベースラインは69.37%に達し、ガウシアン場による統合で71.29%に向上した。 | [1] |
| 訓練後は教師モデル・ガウシアン成分・補助予測ヘッドをすべて除去し、元のWAM推論パスに追加モジュールや追加計算を残さない。 | [1] |
本紙の見方
今回の発表は、ロボット操作の基盤モデルであるWorld-Action Models(WAM)の表現学習に、3Dガウシアン場という中間表現を導入した点で新規性がある。従来のWAMはビデオダイナミクスを表現学習の信号としてきたが、そのビデオ潜在表現は視覚予測に最適化されており、クロスビュー幾何構造や空間的に局在したオブジェクト関連意味を明示的に保持するようには設計されていなかった。GaussianWAMは、凍結された基盤モデルから得られる深度・カメラパラメータ・高密度意味特徴を、共有ガウシアンプリミティブに結合し、空間的に整列したターゲットをレンダリングしてWAMの表現に蒸留する。これにより、幾何と意味の教師信号を明示的に注入しつつ、推論時には追加モジュールを一切残さないという実用的な設計を実現している。 本紙の過去報道との接続は、関連記事が提供されていないため直接の比較はできないが、WAMの進化という観点では、ビデオ予測から幾何・意味の明示的注入への移行は、ロボット操作における表現学習の方向性を示すものと言える。 業界構造への含意として、まず、この手法は訓練時のみの強化であり、推論時の計算コストを増やさない点が重要である。実ロボットへの展開では推論効率が実用性を左右するため、この特性は導入障壁を下げる。次に、教師モデルとしてCLIPやVGGTなどの視覚基盤モデルを利用することで、大規模な事前学習済みモデルの知識をロボット操作に転移する流れを強化する。これは、基盤モデルの活用がロボット学習の標準になりつつあることを示す。さらに、LIBERO-Plusでの改善幅(FastWAMで約19ポイント、Cosmos Policyで約6ポイント)は、幾何・意味の明示的注入が特に複雑なタスクで効果的であることを示唆する。 未確定の論点としては、実世界操作での転移が「正の傾向」とされているが、具体的な成功率やタスク数は論文本文に明記されていない。また、標準LIBEROでの改善幅や、RoboTwinでの詳細な結果も本文からは不明である。さらに、ガウシアン場の解像度やプリミティブ数などのハイパーパラメータが性能に与える影響も、今後の検証が待たれる。
なぜ重要か
GaussianWAMは、ロボット操作の基盤モデルに幾何・意味の明示的監督を注入する実用的な方法を提供し、推論時の追加コストなしで性能を大幅に向上させる。これは、シミュレーションから実世界への転移を目指すロボット学習において、表現の質が重要であることを示すとともに、基盤モデルの知識を活用する新たな道を開く。