何が起きたか
arxiv.orgは2026-09-18、ME-Dex-1.0(MachEmbodied-Dex-1.0)を公開した。触覚を映像と同様に将来の観測として扱い、映像・触覚・行動を一体で学習するWorld Action Tactile Modelである。実験では、グリッパーと多指ハンドの両方について、触覚を備えた操作性能の改善を示したとしている。
詳細
ME-Dex-1.0は、Video Expert、Tactile Expert、Action ExpertからなるMixture-of-Transformersアーキテクチャを採用し、各Expertはflow matchingで学習される。中間層にはshared attentionが置かれ、視覚と触覚の動的表現を行動生成に利用する設計である。 異なる身体構成やセンサー配置の触覚入力に対応するため、Canonical Hand ModelとUnified Tactile Autoencoderを導入し、触覚観測を共通の空間・潜在空間に写像する。また、限られた視覚・触覚・行動のペアデータに対応するため、Agentic Tactile Data Engineを開発し、シミュレーションでのtrajectory replay中に力覚センサーから直接記録した触覚データをRoboTwinとDexJoCoに補完している。検証はRoboTwin、DexJoCo、ManiFeelの各シミュレーション基盤と実機評価で行われた。
Key Facts
| ME-Dex-1.0(MachEmbodied-Dex-1.0)は、映像・触覚・行動を統合するWorld Action Tactile Modelである。 | [1] |
| アーキテクチャはVideo Expert、Tactile Expert、Action ExpertからなるMixture-of-Transformersで、flow matchingで学習する。 | [1] |
| 中間層にshared attentionを設け、視覚・触覚の動的表現を行動生成に使う。 | [1] |
| Canonical Hand ModelとUnified Tactile Autoencoderで、異なる身体構成の触覚入力を共通空間に写像する。 | [1] |
| Agentic Tactile Data Engineは、シミュレーションのtrajectory replay中に力覚センサーから触覚データを記録し、RoboTwinとDexJoCoを補完する。 | [1] |
本紙の見方
ME-Dex-1.0の新規性は、触覚を映像の補助入力としてではなく、将来の世界状態を表す観測として扱い、映像・触覚・行動を同列に学習対象へ置いた点にある。ここは既存の「視覚中心の行動生成」をそのまま拡張したものではなく、触覚信号を予測対象に含めている点が構造的に異なる。一方で、実装面ではMixture-of-Transformers、shared attention、flow matchingという既存の機械学習要素を組み合わせており、手法の新規性は要素技術の寄せ集めではなく、身体性のある入力の統合の仕方にあるとみられる。 この論文は、単に触覚センサーを追加した報告ではない。Canonical Hand ModelとUnified Tactile Autoencoderにより、異なるロボット形態やセンシング配置のデータを共通表現へ寄せる設計が前面に出ているため、ボトルネックはモデル容量よりも、身体差をまたぐ表現整合とデータ整備にあることが読み取れる。また、Agentic Tactile Data Engineを掲げ、シミュレーションのtrajectory replay中に力覚センサー由来の触覚を補う構成は、視覚・触覚・行動の三者をそろえた学習データが希少であるという前提への応答である。したがって焦点は、モデルの推論性能だけでなく、データ生成パイプラインがどこまで汎用に働くかに移る。 業界構造への含意としては、触覚付きマニピュレーションの競争軸が、単一のハンド設計やセンサー精度だけでなく、異なる機体・センサー・シミュレータ間の表現互換性に広がる点が重要である。RoboTwin、DexJoCo、ManiFeelという複数基盤での評価を並べていることからも、ベンチマーク単位での比較より、データ取得から学習、実機評価までの接続が論点になっていると読める。未確定なのは、実機での改善幅、どの程度のデータ規模で成立するのか、また触覚センサー種別やハンド形態をまたいだ汎化がどこまで可能かである。
なぜ重要か
触覚を未来観測として扱う設計は、接触を伴う把持や操作で、映像だけでは見えない滑りや接触変化をモデルに組み込みたい研究者に関係する。論文が示したのは、モデル構造だけでなく、RoboTwinやDexJoCoに触覚データを補うデータ生成系まで含めて学習基盤を組む必要があるという点である。
日本への影響
日本で関連がありうるのは、触覚センサー、ロボットハンド、実機検証基盤を持つ研究開発である。異なる身体構成の触覚を共通表現に写像するという前提は、ハンドやセンサーを個別最適で作るだけでは不十分になりうることを示しており、部品単体ではなくデータ整備まで含めた設計が論点になる。