何が起きたか

DexTacWAMは2026年9月21日、視覚中心だった世界行動モデル(WAM)に触覚を組み込み、巧緻操作向けの視覚・触覚統合モデルを提示した。22自由度の両腕プラットフォーム上で、接触を伴う6つの巧緻操作課題を評価し、平均スコア70.6を記録した。これは最強ベースラインの38.0を上回ったとしている。

詳細

このモデルは、各指先を個別に符号化し、その特徴をfinger- and pose-aware tactile compressorで統合したうえで、触覚潜在表現をvideo diffusion world modelに注入する構成である。著者らは、接触の進展を予測対象の世界状態の一部として扱う点が重要だとしており、触覚条件付けだけを残すのではなく接触の世界モデルを行う設計が性能向上に寄与したと報告した。 アブレーションでは、同じ触覚特徴とaction expertを保ったまま触覚世界モデルを外すと、4課題平均は74.7から26.6へ低下した。さらに、凍結した事前学習済みvision VAEと4時間のtactile-encoder adaptationを用いるcontinual vision-to-touch learningにより、タッチ用の中間学習なしで、各課題およそ100件のデモンストレーションから視覚モデルを触覚へ拡張できたとしている。視覚予測品質はvision-only版から0.5 dB以内に保たれ、compressorは接触再現率の89.4%を維持しつつ、学習を2.26倍、推論を1.29倍高速化した。

Key Facts

DexTacWAMは、視覚と触覚を統合するvisuo-tactile WAMである。[1]
評価は22-DoF bimanual platform上の6つの接触豊富な巧緻操作課題で行われた。[1]
平均スコアは70.6で、最強ベースラインの38.0を上回った。[1]
触覚世界モデルを外すと、4課題平均は74.7から26.6へ低下した。[1]
compressorは接触再現率の89.4%を維持しつつ、学習を2.26倍、推論を1.29倍高速化した。[1]

本紙の見方

DexTacWAMの新規性は、触覚を単なる補助信号として加えるのでなく、接触の進展そのものを世界状態の予測に含めた点にある。これは、視覚だけでは見えにくい接触ダイナミクスを扱うというWAMの弱点に対し、モデル内部の表現設計で応答した構成であり、既存のvideo diffusion world modelを土台にしつつ、触覚潜在を差し込むという延長線上の発想でもある。したがって、完全な新アーキテクチャというより、事前学習済み視覚モデルを触覚へ拡張する実装上の工夫が主眼とみられる。 本紙の関連記事はないため、過去報道との直接比較はできない。ただし、今回の結果は「触覚を入れれば良い」という話ではなく、接触の変化をどの状態変数として保持するかが性能差を生むことを示している。4課題平均が74.7から26.6へ落ちたというアブレーションは、触覚特徴の有無ではなく、世界モデルとしての表現が重要だったことを示唆する。一方で、評価は22-DoFの両腕プラットフォームと6課題に限られており、実環境での汎化や物体・接触条件の多様性にどこまで耐えるかはなお確認が必要である。 業界構造への含意は、巧緻操作ロボットの学習が、視覚データ中心から、触覚を含むマルチモーダルなデータ設計へ移る可能性にある。特に、各指先を独立に扱う点と、学習・推論の高速化が同時に示された点は、計算資源とデモ数の制約が強い研究・開発現場にとって重要である。ただし、論文が示すのは研究段階の性能であり、量産機への移植、センサー構成、タクトタイム、異なるハンド形状への適用条件はまだ不明である。次に確認すべき論点は、触覚エンコーダの学習をどの程度少数デモで安定化できるか、接触再現率89.4%が実タスク成功率にどう対応するか、そして22-DoF以外のロボットでも同じ設計が成立するかである。

なぜ重要か

触覚を世界状態の一部として扱う設計は、接触を伴う巧緻操作で視覚中心モデルが苦手とする領域に直接関係する。論文では、4時間の適応と各課題およそ100件のデモンストレーションで視覚モデルを触覚へ拡張できたとしており、少量データでの拡張可能性が研究開発の条件として示された。

日本への影響

日本のロボット研究や部品産業にとっては、視覚だけでなく触覚を前提にした学習基盤が必要になる可能性がある。特に、指先ごとの触覚計測や22-DoF級の両腕構成を前提とするなら、センサー、制御、学習データの設計を個別に詰める必要がある。