日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2610.12451

VersaCamVLA: カメラ構成に柔軟なロボットマニピュレーション用VLAポリシー

VersaCamVLA: Camera-Configurable VLA Policies for Robotic Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

任意の台数・姿勢のカメラ映像を固定長のシーントークンに変換し、事前学習済みVLAに注入することで、カメラ構成が変わっても頑健に動作するマニピュレーション手法を提案。

詳しい要約

1. どんなもの?

- Vision-Language-Action (VLA) モデルはロボット操作の基盤だが、訓練時の固定カメラ構成に依存し、展開時のカメラ数や姿勢の変化に脆弱。 - これを克服するため、カメラ構成可能なフレームワーク VersaCamVLA を提案。 - カメラセット表現と行動学習を分離。 - 任意の可変な posed RGB ビュー集合を固定サイズの潜在シーントークンにマップする統一シーントークンインタフェースを学習。 - 展開時、軽量な空間エンコーダがこれらのコンパクトなシーントークンを事前学習済みベース VLA に補助視覚条件として注入。 - 明示的な 3D センシングや新規ビューレンダリングは不要。

2. 先行研究と比べてどこがすごい?

- 従来の VLA は訓練時の固定カメラ構成に依存し、展開時のカメラ数や姿勢の変化に脆弱。 - VersaCamVLA はカメラ構成可能なフレームワークで、カメラセット表現と行動学習を分離。 - 任意の可変な posed RGB ビュー集合を固定サイズの潜在シーントークンにマップする統一シーントークンインタフェースを学習。 - 展開時、軽量な空間エンコーダがシーントークンを事前学習済みベース VLA に補助視覚条件として注入。 - 明示的な 3D センシングや新規ビューレンダリングは不要。 - 実験で prior VLA 手法や直接的なマルチビューベースラインを一貫して上回り、カメラ数や未見のカメラ姿勢に対して堅牢な性能を維持。

3. 技術・手法の肝は?

- カメラセット表現と行動学習を分離するカメラ構成可能なフレームワーク。 - 任意の可変な posed RGB ビュー集合を固定サイズの潜在シーントークンにマップする統一シーントークンインタフェースを学習。 - マルチシグナルターゲットビュー予測と Wrist-Augmented Pose Sampling (WAPS) を採用。 - WAPS は自然な wrist-camera の動きを活用して無償で姿勢の多様性を得る。 - 展開時、軽量な空間エンコーダがコンパクトなシーントークンを事前学習済みベース VLA に補助視覚条件として注入。 - 明示的な 3D センシングや新規ビューレンダリングは不要。

4. どうやって有効だと検証した?

- RoboTwin、LIBERO、実機ロボットプラットフォームでの実験。 - VersaCamVLA は prior VLA 手法や直接的なマルチビューベースラインを一貫して上回る。 - カメラ数や未見のカメラ姿勢に対して堅牢な性能を維持。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究: prior VLA 手法、直接的なマルチビューベースライン。 - 関連手法: Vision-Language-Action (VLA) モデル、RoboTwin、LIBERO。 - 同分野の定番: 明示的な 3D センシング、新規ビューレンダリング。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Boyao Han, Chen Shi, Jingjing Qian, ZhuoTan Tian, Li Jiang

分類: cs.CV, cs.RO

原文アブストラクト

Vision-Language-Action (VLA) models have emerged as powerful foundations for robotic manipulation, but their reliance on fixed camera configurations during training makes them brittle to changes in camera count or pose during deployment. To overcome these limitations, we propose VersaCamVLA, a camera-configurable framework that decouples camera-set representation from action learning. VersaCamVLA learns a unified scene-token interface that maps an arbitrary, variable set of posed RGB views into fixed-size latent scene tokens. This is achieved via multi-signal target-view prediction and Wrist-Augmented Pose Sampling (WAPS), which leverages natural wrist-camera motion for free pose diversity. At deployment, a lightweight spatial encoder injects these compact scene tokens into a pretrained base VLA as a supplementary visual condition, requiring no explicit 3D sensing or novel-view rendering. Experiments on RoboTwin, LIBERO, and a real-robot platform demonstrate that VersaCamVLA consistently outperforms prior VLA methods and direct multi-view baselines, maintaining robust performance across varying camera counts and unseen camera poses.

関連論文

PR本紙発行元 EmplifAI