何が起きたか
arxiv.orgは2026-09-21、JAMB(Joint Action-Motion Diffusion for Bimanual Manipulation)を掲載した。両腕操作で、行動だけでなく将来の3D点群軌跡も同時にデノイズする拡散方策である。著者らは、共有Transformerの中で行動仮説と軌跡仮説を一緒に進化させ、両者が相互に修正し合う設計だとしている。
詳細
JAMBは、両腕の動きが共有3D空間を変え、もう一方の腕に影響する点を明示的に扱う。多モーダル表現は共有の時空間座標系に基づいて整合され、幾何を意識した相互作用を共同デノイズ中に行えるようにしている。 評価はRoboTwin 2.0上の16シミュレーション課題と、実世界の3課題で行われた。16課題では平均成功率83.4%で、最強の基準手法を23.9ポイント上回った。実機では、行動のみの方策に対して50.0ポイント、補助的な幾何予測法に対して21.2ポイント上回ったとしている。
Key Facts
| JAMBは、両腕操作向けの拡散方策で、行動と将来の3D点群軌跡を共同でデノイズする設計である。 | [1] |
| 共有Transformerの中で、行動仮説と軌跡仮説を同時に更新し、相互に情報を与えるとしている。 | [1] |
| RoboTwin 2.0の16シミュレーション課題で、平均成功率83.4%を達成したとしている。 | [1] |
| 最強の基準手法に対する差は23.9ポイントだとしている。 | [1] |
| 実世界の3課題では、行動のみの方策に対して50.0ポイント、補助的な幾何予測法に対して21.2ポイント上回ったとしている。 | [1] |
本紙の見方
JAMBの新規性は、両腕の動作生成を「行動」だけで閉じず、将来の3D点群軌跡まで同時に拡散過程へ入れた点にある。従来の拡散方策が未来状態を補助監督や固定条件として扱っていたのに対し、本手法は行動と軌跡を共有Transformerで同時に更新するため、幾何の変化をその場で反映しやすい設計だと読める。ここで重要なのは、単に予測を足したのではなく、両腕が同じ3D場面を共有するという問題設定に合わせて、相互干渉を表現の中心に置いたことである。 本紙の過去報道はないため、既報との連続性は置けないが、今回の論文は「行動中心の拡散方策」に対して「行動と運動軌跡の共同生成」を対置している。RoboTwin 2.0の16課題で83.4%、最強基準より23.9ポイント高いという結果は、少なくともこのベンチマーク群では、幾何を後付けで扱うよりも共同最適化のほうが有利である可能性を示す。ただし、比較対象は行動のみの方策と、状態表現や学習目的が異なる未来予測法であり、どの要素が効いたのかはまだ切り分けが必要だ。 業界構造としては、両腕マニピュレーションの実装が、制御政策そのものだけでなく、空間表現の設計に強く依存することを示す。共有時空間座標系を使う以上、センサーで取った点群、学習時の軌跡表現、実機での座標整合がずれると性能は崩れやすいとみられる。実機3課題で行動のみ方策や幾何予測法を上回った点は、シミュレーション上の改善が現実のロボットでも一定程度再現されることを示すが、汎化の限界はなお残る。特に、16課題と3課題でのタスク構成、失敗モード、データ量、学習コストが開示されていないため、次に確認すべきなのは、どの作業で優位が出やすいのか、混雑した場面や外れ値背景への強さが実機でも維持されるのか、そして座標系の設計変更に対して性能がどれだけ敏感かである。
なぜ重要か
両腕で物体を扱う工程では、片腕の動きがもう片腕の作業空間を変えるため、行動だけでは不足する場面がある。JAMBは、発表元のarxiv.org掲載文によれば、行動と将来の3D点群軌跡を同時に扱うことで、その不足を埋めようとする点に特徴がある。