何が起きたか

掲載日2026-09-08のarXiv論文「TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model」は、散らかった室内環境を移動するヒューマノイド向けに、言語条件付きの全身ナビゲーション枠組み「TANGO」を提案した。自然言語指示と一人称RGB観測を入力に、29自由度の関節空間アクションを直接出力する。研究チームはこれをシミュレーションのみで学習させ、Unitree G1ヒューマノイドにゼロショットで展開した。

詳細

論文は、従来の2次元経路計画ではなく、腕の配置、胴体の調整、歩容の変化を含む全身の幾何学的適応が必要だと位置づけている。学習パイプラインは、グローバル経路計画、運動学ベースの全身動作生成、障害物を考慮した動作編集、RLベースの追従から成る。これにより、衝突回避可能で動的に実行可能なアクション教師を合成したとしている。

Key Facts

arXiv論文「TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model」は、言語条件付きのヒューマノイド全身ナビゲーション枠組み「TANGO」を提案した。[1]
入力は自然言語指示と一人称RGB観測で、出力は29自由度の関節空間アクションである。[1]
学習はシミュレーションのみで行い、グローバル経路計画、運動学ベースの全身動作生成、障害物を考慮した動作編集、RLベースの追従を組み合わせた。[1]
論文はシミュレーション実験でstate-of-the-art性能を示したとしている。[1]
Unitree G1ヒューマノイドへのゼロショット実証で、実世界の散らかった場面でも訓練なしに言語誘導移動を確認したとしている。[1]

本紙の見方

TANGOの新しさは、ヒューマノイドの移動を「2次元の経路」ではなく、腕・胴体・歩容を同時に扱う全身制御問題として定式化した点にある。29自由度の関節空間アクションを直接予測するため、出力は経路点ではなく実際の身体動作に近い。一方で、学習自体はシミュレーションのみで完結しており、実機側はUnitree G1へのゼロショット展開で確かめた構図である。ここから読み取れるのは、知覚と言語理解だけでなく、実行可能な全身動作へ変換する中間層が焦点になっていることである。 本紙の関連記事である 王興興氏、具身知能の到達条件を数値で示す では、宇樹科技の王興興氏が「80%の未知環境で80%の課題をこなす」基準を示していた。今回のTANGOは、そのような能力目標を支える技術要素の一つとして、言語指示に応じた全身ナビゲーションを具体化したものと読める。ただし、論文が示したのはあくまでナビゲーションであり、把持・操作や長時間の自律行動までを同じ水準で示したわけではない。過去記事が描いた「自進化」や高い汎用性の議論に対し、今回はまず障害物が多い屋内での移動という限定課題に落として検証している点が重要である。 業界構造の観点では、論文が示した入力はRGB観測と自然言語であり、出力は29自由度制御であるため、必要になるのは大規模言語モデル単体ではなく、実機の関節制御、全身運動生成、障害物回避の各層をつなぐ統合設計である。Unitree G1へのゼロショット実証は、実機側のハードウェア特性と学習済み方策の接続可能性が研究競争の前提になっていることを示す。今後の確認点は、実機での成功率、適用できる障害物密度、学習に使ったシミュレーション条件と実環境の差、そして同方式が他のヒューマノイド機体にどこまで移植できるかである。

なぜ重要か

論文が示したのは、自然言語から29自由度の全身動作へつなぐ経路であり、ヒューマノイドを移動主体として使う際の制御設計に直接関わる。Unitree G1へのゼロショット実証があるため、機上のナビゲーション研究ではなく、実機適用を前提にした評価として読む必要がある。

日本への影響

日本のヒューマノイド開発では、関節制御、全身運動生成、実機検証の統合が論点になる。今回のようにシミュレーション学習を前提とする方式は、実機データの確保や機体差の吸収方法が競争条件になる可能性がある。