何が起きたか
arXivは2026-09-22、論文「VisForce: Visual Grounding of Current and Desired Forces for Goal-Conditioned Dexterous Manipulation」を掲載した。論文は、Vision-Language-Action(VLA)モデルを前提に、現在の力と目標の力をそれぞれ指先位置に対応付けて視覚化し、力を意識した行動生成に使う方式を提案している。実機評価はUR10ロボットとRH56F1器用ハンドで行われ、力条件付き把持と3種類の多段階操作タスクが検証された。
詳細
VisForceは、現在の手首画像とタスク固有の目標画像の上に、現在の力と望ましい力の視覚的な手掛かりを描画し、goal-conditioned cross-attentionで統合して force-aware actions を生成する設計である。論文は、VLAベースの器用手操作において、力情報を視覚上の対応位置に結び付けることが有効になりうると位置づけている。 実験では、力条件付き把持に加え、cup insertion/bottle pouring、tong-assisted bread transfer、slip-modulated peg-in-hole の3つの多段階タスクを評価した。結果として、卵と歯磨きチューブの把持・持ち上げ成功率はそれぞれ70%、80%で、最終成功率は cup insertion/bottle pouring が70%、tong-assisted bread transfer が55%、slip-modulated peg-in-hole が40%だった。
Key Facts
| arXivは2026-09-22に「VisForce: Visual Grounding of Current and Desired Forces for Goal-Conditioned Dexterous Manipulation」を掲載した。 | [1] |
| VisForceは、現在の力と望ましい力を指先位置に視覚的に対応付ける設計を提案した。 | [1] |
| 論文はVision-Language-Action(VLA)モデルを前提に、goal-conditioned cross-attentionで力情報を統合するとしている。 | [1] |
| 実機評価にはUR10ロボットとRH56F1器用ハンドが使われた。 | [1] |
| 把持・持ち上げ成功率は卵で70%、歯磨きチューブで80%、最終成功率は cup insertion/bottle pouring で70%、tong-assisted bread transfer で55%、slip-modulated peg-in-hole で40%だった。 | [1] |
本紙の見方
VisForceの新しさは、器用手操作でしばしば状態量や別表現として扱われる力情報を、指先位置に対応した視覚要素として埋め込んだ点にある。単に力覚を追加するのではなく、現在画像と目標画像の双方に視覚的な力の手掛かりを置き、cross-attentionで行動へつなぐ構造を採っているため、入力→対応付け→行動生成という流れが明確だ。ここは、VLAをロボット制御へ当てる既定路線の延長でありつつ、力の表現方法を視覚側に寄せた点が論文の主軸である。 本紙の関連記事はないため、公開された一次情報だけで位置づけると、今回の焦点はモデルの一般論ではなく、力を「どこで」「どの程度」見せるかにある。現在の力と望ましい力を別々に表現し、しかも手首画像とタスク固有の目標画像の両方に重ねる設計は、同じ器用手操作でも接触局面の読み替えを可能にする狙いとみられる。一方で、実験はUR10とRH56F1という特定の構成に基づくため、他のハンド形状や別の視覚系にそのまま移るかは未確定である。 成否の数字は、提案手法が単一の把持だけでなく、多段階操作でも一定の性能を示したことを示すが、40%や55%のタスクが残る以上、接触の不安定さやタスク間の頑健性が次の論点になる。特に、どの力表現がどの工程で効いたのか、学習データの構成、力の視覚化の粒度、失敗時の挙動が未整理である。今後は、より多様な対象物、ハンド、接触条件で同じ表現が再現するかが確認点になる。
なぜ重要か
論文は、力を視覚に接地させてVLAに組み込むことで、器用手操作の条件付けを具体的に示した。UR10とRH56F1の実機で、卵や歯磨きチューブの把持・持ち上げ、および3種類の多段階タスクで結果を示した点は、力情報の扱いが性能に直結することを裏づける。
日本への影響
日本向けに直接の取引や導入先は示されていないため限定的である。ただし、器用ハンドとロボット制御を組み合わせる研究では、力覚センサー、手先機構、実機評価環境の整備が重要になるため、日本のロボットハンド部品や制御研究には接点があるとみられる。