日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
巧みな操作/VLA/触覚arXiv:2609.09119

DeCAL: 接触認識型潜在共想像による物理基盤の巧みな視覚-言語-行動モデル

DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination

シェア:XThreadsFacebookLINEはてブBluesky

接触の多い巧みな操作のための、触覚を適応的に統合し視覚と触覚のダイナミクスを共同で想像する新しいVLAモデルを提案し、高い成功率と汎化性能を達成した。

詳しい要約

1. どんなもの?

DeCALは、接触の多い器用な操作のための物理に基づくdexterous vision-language-action (VLA)モデルである。視覚と言語の理解、想像、行動生成を統合し、触覚情報を適応的に統合する。Mixture-of-Transformers (MoT)アーキテクチャ上に構築され、各能力に特化した専門家(expert)を持ち、それらの間の効率的な情報フローを可能にする。Adaptive Visuo-Tactile FusionとVisuo-Tactile Latent Co-Imaginationを導入し、物理的世界の暗黙の知識をポリシーに与える。

2. 先行研究と比べてどこがすごい?

既存のVLAモデルは、視覚的な遮蔽や複雑な接触ダイナミクスにより、器用な操作に課題があった。また、最近の触覚センシングを組み込んだ研究も、均質なマルチモーダル融合に依存し、適応的な触覚統合や物理ダイナミクスの明示的モデリングが欠けていた。DeCALは、接触認識ゲーティング戦略による適応的触覚融合と、視覚・触覚の潜在共想像による物理ダイナミクスのモデリングを導入し、これらの限界を克服している。

3. 技術・手法の肝は?

手法の肝は、Mixture-of-Transformers (MoT)アーキテクチャに基づき、理解・想像・行動生成の各機能に特化した専門家(expert)を用意し、それらの間の情報フローを効率的にすること。さらに、Adaptive Visuo-Tactile Fusionでは、接触認識ゲーティング戦略により触覚情報の相互作用を動的に調整する。Visuo-Tactile Latent Co-Imaginationでは、視覚と触覚のダイナミクスを共同でモデル化し、ポリシーに物理世界の暗黙の知識を与える。

4. どうやって有効だと検証した?

実験では、全タスクで一貫して最先端の性能を達成し、平均成功率71%、進捗成功率83.4%を記録した。また、未見のシナリオへの強い一般化も示した。具体的なタスクや比較ベースラインは要旨からは不明だが、ウェブサイトで詳細が公開されている。

5. 議論はある?

要旨からは、提案手法の限界や議論点は明示されていない。ただし、触覚情報の適応的統合と物理ダイナミクスのモデリングが有効であることが示唆されるが、計算コストや実世界での適用可能性などは要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されている関連研究は明示されていないが、同分野の定番として、既存のVLAモデルや触覚センシングを統合したロボット操作の研究が挙げられる。具体的には、Vision-Language-ActionモデルやTactile Sensingを用いた操作学習の論文を読むとよい。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

分類: cs.RO, cs.AI

原文アブストラクト

Dexterous manipulation involves contact-rich and fine-grained interactions with the physical world, posing significant challenges for existing vision-language-action (VLA) models due to severe visual occlusions and complex contact dynamics. While recent works have incorporated tactile sensing into robotic manipulation, most approaches still rely on homogeneous multimodal fusion, lacking adaptive tactile integration and explicit modeling of physical dynamics. In this work, we present DeCAL, a physically-grounded dexterous vision-language-action model that unifies understanding, imagination and action generation for contact-rich dexterous manipulation. Built upon a Mixture-of-Transformers (MoT) architecture, DeCAL leverages specialized experts for each capability while enabling efficient information flow among them. To effectively leverage tactile information, we introduce Adaptive Visuo-Tactile Fusion that dynamically regulates tactile interactions via a contact-aware gating strategy. Furthermore, we propose Visuo-Tactile Latent Co-Imagination to jointly model visual and tactile dynamics, equipping the policy with implicit physical world knowledge. Experimental results show that DeCAL consistently achieves state-of-the-art performance across all tasks, attaining a 71% average success rate and an 83.4% progress success rate, while also demonstrating strong generalization to unseen scenarios. The website is available at https://aureleopku.github.io/DeCAL.