何が起きたか
2026年8月16日にarXivに公開された論文(識別子: 2608.15816v1)で、ViTaR(Visuo-Tactile Residual Adaptation)が提案された。ViTaRは、視覚言語行動(VLA)モデルの接触リッチ操作における盲点を補う手法で、凍結したVLAに触覚フィードバックを実行変調器として組み合わせる。UniVTACベンチマークの7つの接触リッチタスクで平均成功率61.3%を達成し、凍結VLAベースから30.6パーセントポイントの改善を示した。
詳細
VLAモデルは視覚意味的先行知識を符号化する一方、局所的な接触イベントに気づかず、接触が確立・喪失・不安定化しても同一の行動を生成する問題がある。既存の対策はVLA内部を変更して破滅的忘却のリスクを負うか、失敗に近い接触条件下でのオンライン強化学習を要求する。ViTaRは触覚を行動生成の知覚入力ではなく、凍結VLAの上で有界な残差補正を選択・スケーリングする実行変調器として再構成し、事前学習能力を構造的に保持する。 ViTaRは2段階の適応に分解される。Effect-Guided Modelingは結果に基づく選好証拠を用いて局所的な補正の要否と種類を判断し、Residual Action Modulationは実時間の視触覚観測から連続的にスケーリングされたゲインで残差選択に変換する。物理ロボット実験では、有界な触覚変調が実センサノイズとダイナミクスに転移することが確認された。
Key Facts
| ViTaRは2026年8月16日にarXivで公開された(識別子: 2608.15816v1) | 出典一覧 |
| ViTaRは凍結VLAに触覚フィードバックを実行変調器として組み合わせる | 出典一覧 |
| UniVTACベンチマークの7つの接触リッチタスクで平均成功率61.3%を達成 | 出典一覧 |
| 凍結VLAベースから30.6パーセントポイントの改善 | 出典一覧 |
| 既存の対策はVLA内部の変更(破滅的忘却のリスク)またはオンライン強化学習を要求 | 出典一覧 |
| ViTaRはEffect-Guided ModelingとResidual Action Modulationの2段階で構成 | 出典一覧 |
| 物理ロボット実験で有界な触覚変調が実センサノイズとダイナミクスに転移 | 出典一覧 |
なぜ重要か
ViTaRは、VLAの汎用性を保ちながら接触リッチ操作の性能を向上させる手法として、ロボット操作の実用化に寄与する可能性がある。触覚を行動生成ではなく実行変調に用いるアプローチは、既存のVLAを活用しつつ接触感度を高める新たな枠組みを示す。