何が起きたか
DexJoCo-Xは2026-10-02に公開された論文で、7種類の代表的な器用手、6件の単腕・両腕タスク、2,100件の均衡デモンストレーションを対象に、マルチハンドの行動表現を比較するベンチマークとツールキットを示した。論文は、共通のシーン、成功基準、実行インターフェースをそろえたマルチハンド・マルチタスクのプロトコルを設計したとしている。
詳細
DexJoCo-Xは、手の形状差、タスク差、データセット差、制御インターフェース差の影響を切り分けるため、共通シーンと共通の成功基準、共通の実行インターフェースを持つ比較環境を用意した。さらに、見直し済みデモンストレーションをランダム化されたシーンへ自動展開するパイプラインも備えるとしている。 評価では、$π_{0.5}$を80次元の両腕出力へ拡張すると成功率がほぼゼロになり、Ego-Piは事前学習済みのアクションヘッドを交互予測で保ったまま手ごとのマルチタスク学習には対応したが、7種類の手をまとめた学習ではうまくいかなかった。一方、Being-H0.5はクロスエンボディメント事前学習、統一アクション空間、エンボディメント認識の専門家を組み合わせ、1つの方策で7種類すべての手を制御できたとしている。
Key Facts
| DexJoCo-Xは7種類の代表的な器用手を対象にしている。 | [1] |
| DexJoCo-Xは6件の単腕・両腕タスクを含む。 | [1] |
| DexJoCo-Xは2,100件の均衡デモンストレーションを用いる。 | [1] |
| Being-H0.5では、機能に対応づけたアクションスロットが平均成功率47.7%で、native coordinatesの47.0%、DexLatentの33.1%を上回った。 | [1] |
| $π_{0.5}$を80次元の両腕出力へ拡張すると、成功率はほぼゼロだった。 | [1] |
本紙の見方
DexJoCo-Xの新しさは、単に器用手向けのデータを集めた点ではなく、7種類の手、6件のタスク、2,100件の均衡デモンストレーションを同一条件で比べられるようにした点にある。論文が狙うのは、手の形状やタスクの違いが混ざったままでは見えにくい「表現そのもの」の差を、共通シーンと共通インターフェースで切り分けることだと読める。ここでの焦点は、個別のロボットハンドに閉じた制御ではなく、異なる身体をまたいで共有できる操作構造をどう抽出するかに移っている。 本紙の関連記事はないが、今回の結果は「表現がよければ移植できる」という単純な見方を否定している。$π_{0.5}$の80次元両腕出力がほぼゼロだった事実は、出力空間を広げるだけでは足りないことを示す。Ego-Piが手ごとのマルチタスクには対応しても7手同時学習で失敗した点は、事前学習済みのヘッドを保つ設計だけでも不十分だと示す。対してBeing-H0.5は、クロスエンボディメント事前学習、統一アクション空間、エンボディメント認識の専門家を同時に組み合わせて7手を1方策で扱えた。つまり、この論文の主題は「共通表現」単体ではなく、表現・事前学習・アーキテクチャの結合条件にある。 業界構造への含意としては、器用手の研究開発が個別機種の最適化から、比較可能な基準づくりへ移りつつある点が大きい。7種類の手をまたぐ評価軸ができると、データ収集や学習法の優劣を機体ごとの差から切り離して議論しやすくなる。反面、成功率47.7%という結果は、統一方策が成立しても性能が十分に高いとは限らないことを示すため、今後はどの手の形状やどのタスクで崩れるか、どの程度までデモンストレーションを増やせば改善するかが確認点になる。とくに、80次元出力や7手同時学習が難しい以上、スケールだけでなく、アクション座標・共有表現・専門家設計のどこが律速かを見極める必要がある。
なぜ重要か
DexJoCo-Xは、7種類の器用手を同一の枠組みで比べるための条件をそろえた点で、研究者が機体差をまたいで学習法を評価する際の基準になりうる。論文が示した47.7%、47.0%、33.1%という差は、制御座標の設計が性能に直結することを示している。