何が起きたか

arXivで2026-09-08に公開された論文「DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination」は、接触を伴う器用な操作向けの視覚・言語・行動モデル「DeCAL」を提案した。モデルは、既存のVLAモデルが苦手とする視覚的な遮蔽と複雑な接触動力学への対応を狙うものである。評価結果として、全タスクで平均成功率71%、progress success rate 83.4%を達成したとしている。

詳細

DeCALはMixture-of-Transformers(MoT)アーキテクチャを基盤とし、機能ごとに専門のエキスパートを置きながら情報の流れを確保する設計である。触覚情報については、contact-aware gating strategyを用いるAdaptive Visuo-Tactile Fusionを導入し、視覚と触覚の動態を共同でモデル化するVisuo-Tactile Latent Co-Imaginationも提案している。 論文は、これにより物理世界に関する暗黙の知識を政策に与えるとしており、未見シナリオへの強い一般化も示したとしている。

Key Facts

論文「DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination」は2026-09-08にarXivで公開された。[1]
DeCALは接触を伴う器用な操作向けの物理基盤型VLAモデルとして提案された。[1]
基盤にはMixture-of-Transformers(MoT)アーキテクチャを採用した。[1]
触覚統合のためにAdaptive Visuo-Tactile FusionとVisuo-Tactile Latent Co-Imaginationを導入した。[1]
評価では平均成功率71%とprogress success rate 83.4%を達成したとしている。[1]

本紙の見方

DeCALの新しさは、器用な操作を単なるマルチモーダル融合としてではなく、接触状態を前提にした推論・想像・行動生成の一体設計として扱った点にある。既存のVLAモデルが抱える遮蔽と接触動力学の難しさに対し、MoTで能力を分け、Adaptive Visuo-Tactile Fusionで触覚の入れ方を動的に制御し、さらにLatent Co-Imaginationで視覚と触覚の動態を結び付けた構成は、モデル内部の役割分担を明示した点が特徴である。 本紙の観点では、これは「触覚を足したロボットモデル」という一般的な話ではなく、接触の有無や強さに応じて触覚の寄与を切り替える設計に焦点がある。つまり、入力としての触覚センサーを追加する段階から、接触を検知して推論経路を変える段階へ進んでいるとみられる。ただし、論文が示したのは主に研究評価であり、実機展開や量産を示す情報ではない。71%の平均成功率と83.4%のprogress success rateが、どのベースラインやどの難度帯での改善なのかは、本文の条件を追う必要がある。 業界構造への含意としては、接触豊富な操作では視覚だけでなく触覚データとその利用方法が性能差を生みやすく、学習データの収集方法、接触ラベルの作り方、実機への移植性が競争点になる可能性がある。MoTのように機能別の専門家を置く設計は、汎用VLAの一枚岩型よりも、どの能力をどこに持たせるかを検証しやすい。一方で、論文だけではロボット本体、触覚ハード、データ収集手順、未見シナリオの範囲が十分に分からず、次に確認すべき論点はそこにある。

なぜ重要か

接触を伴う操作では、視覚のみでは見えない状態変化をどう扱うかが課題になる。DeCALは、触覚を動的に統合しつつ視覚・触覚の共同モデル化を行う設計を示しており、器用作業向けロボットの研究でどの情報をどの段階で使うかを具体化した事例である。

日本への影響

日本のロボット研究にとっては、視覚中心のモデルに触覚をどう組み込むか、そして接触データをどう蓄積するかが論点になる。特に組立、把持、挿入のような接触を伴う作業では、センサー統合と学習データ設計が性能に直結するため、論文のような接触-aware設計の検証が参考になりうる。