日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
視触覚表現学習arXiv:2608.21290

VT-MUSE: 操作のためのマルチモーダル統合シーケンシャル視触覚表現学習

VT-MUSE: Multimodal Unified Sequential Visuotactile Representation Learning for Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

視覚と触覚の時系列情報を統合する表現学習フレームワークを提案し、シミュレーションと実世界で操作タスクの成功率を大幅に向上させた。

詳しい要約

1. どんなもの?

VT-MUSEは、視覚と触覚のマルチモーダル情報を統合的に表現学習するためのフレームワークである。操作タスクにおいて、視覚と触覚の観測を独立に符号化してから融合する従来手法の問題を解決するため、時系列的な接触の進化を捉えることを目指す。2段階の表現学習フレームワークを提案し、学習された表現を軽量なTransformerポリシーに統合する。

2. 先行研究と比べてどこがすごい?

従来手法は視覚と触覚の観測を独立に符号化してから融合するため、細かいクロスモーダル依存関係を捉えることができなかった。また、多くの手法は現在のタイムステップの観測に焦点を当て、接触の時間的進化を見落としていた。VT-MUSEは、クロスモーダルな時間的アライメントとマスクビュー一貫性を用いてモダリティ固有のエンコーダを共同適応させ、さらに条件付き変分潜在モデルを用いて視覚シーケンスと触覚履歴を処理することで、これらの限界を同時に解決する。

3. 技術・手法の肝は?

手法の肝は2段階の表現学習フレームワークである。Stage Iでは、モダリティ固有のエンコーダをクロスモーダルな時間的アライメントとマスクビュー一貫性を用いて共同適応させる。Stage IIでは、条件付き変分潜在モデルがマスクされた視覚シーケンスと完全な触覚履歴を処理する。補助デコーダがマスクされた最近の視覚観測を再構成し、触覚の深さ変化を予測することで、潜在表現がグローバルな視覚的文脈と局所的な接触ダイナミクスの両方を保持するように促す。学習された表現は、ゲート付きクロスアテンションを介して軽量なTransformerポリシーに統合される。

4. どうやって有効だと検証した?

シミュレーションベンチマークにおいて、VT-MUSEは全タスクで最強のベースラインを11パーセントポイント上回った。また、実世界の実験でも大幅な改善を達成した。

5. 議論はある?

要旨からは、提案手法の限界や潜在的な欠点についての議論は不明である。また、シミュレーションと実世界のギャップや、計算コスト、汎化性能などについての詳細な議論も要旨には含まれていない。

6. 次に読むべき論文は?

要旨で参照されている関連手法は明示されていないが、視覚と触覚の融合、表現学習、Transformerポリシーに関する研究が関連する。具体的には、マルチモーダル表現学習、視触覚操作、変分オートエンコーダ、Transformerベースのポリシー学習などの分野の論文が次に読むべき候補となる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Congsheng Xu, Qiaochu Yang, Fangyuan Shi, Yifan Han, Baijun Chen, Yiming Wang, Haonan Zhao, Daolin Ma, Xiaokang Yang, Hesheng Wang

分類: cs.RO, cs.CV

原文アブストラクト

We propose VT-MUSE, a Multimodal Unified SEquential representation learning framework for visuotactilemanipulation. Existing approaches often encode visual and tactile observations independently before fusion, limiting their ability to capture fine-grained cross-modal dependencies. Moreover, most methods focus on observations at the current time step and overlook the temporal evolution of contact. VT-MUSE addresses both limitations through a two-stage representation learning framework. In Stage I, modality specific encoders are jointly adapted via cross-modal temporal alignment and masked-view consistency. In Stage II, a conditional variational latent model processes masked visual sequences together with full tactile histories. Auxiliary decoders reconstruct the masked recent visual observations and predict tactile depth changes, encouraging the latent representation to retain both global visual context and local contact dynamics. The learned representation is subsequently integrated into a lightweight Transformer policy through gated cross-attention. On the simulation benchmark, VT-MUSE outperforms the strongest baseline evaluated on all tasks by 11 percentage points and also achieves substantial improvements in real-world experiments.