日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLA/ナビゲーションarXiv:2608.12860v1

HumanoidVLN: 多様な人型ロボットのための物理基盤シミュレータと視覚言語ナビゲーションベンチマーク

HumanoidVLN: A Physics-Grounded Simulator and Benchmark for Vision-Language Navigation Across Diverse Humanoid Embodiments

シェア:XThreadsFacebookLINEはてブBluesky

二足歩行の物理制約と多様な人型ロボット形態を考慮した、視覚言語ナビゲーションのための物理シミュレータとベンチマークを構築した。

詳しい要約

1. どんなもの?

HumanoidVLNは、多様なヒューマノイド形態のVLNのための物理基盤シミュレータとベンチマークである。NVIDIA Isaac Sim上に構築され、Unitree G1、Unitree H1、Internal-A、Internal-Bの4つのロボットをサポートし、10〜12の下肢DoFと1.17mから1.80mの身長をカバーする。階層型制御スタック(RL locomotion policyとPDまたはMPC path tracker)を備え、NaVILA、DualVLN、StreamVLN、JanusVLNなどのVLNモデルと互換性がある。環境はアーティストデザインのシーンと3D Gaussian Splatting再構成から構築され、ナビゲーション可能面積が100平方メートルを超えるものにフィルタリングされる。命令はデュアル生成器・レビューア・パラフレーザのマルチエージェントパイプラインと人間の検証により生成され、933の衝突回避参照エピソードと、各エピソードに1つの詳細命令と3つの文体バリアント(フォーマル、ナチュラル、カジュアル)が含まれる。

2. 先行研究と比べてどこがすごい?

既存のVLNベンチマークは、車輪型エージェントを想定しており、二足歩行による物理的制約、ヒューマノイドの形態的多様性、歩行によるカメラダイナミクスで歪む自己中心視点を考慮していない。HumanoidVLNは、物理基盤シミュレータ上でこれらの課題を直接扱い、複数のヒューマノイド形態と制御スタックを統合し、物理実行下でのVLNモデルとロボットの相互作用を評価できる点が新しい。

3. 技術・手法の肝は?

手法の肝は、階層型制御スタックとモジュール化された統合にある。RL locomotion policyが歩行を生成し、PDまたはMPC path trackerが経路追従を行う。新しいロボットやVLNモデルは最小限の労力で統合できる。また、命令生成はマルチエージェントパイプライン(生成器、レビューア、パラフレーザ)と人間の検証により、高品質で多様な命令を生成する。環境はナビゲーション可能面積でフィルタリングされ、衝突回避エピソードを提供する。

4. どうやって有効だと検証した?

4つのVLNモデル(NaVILA、DualVLN、StreamVLN、JanusVLN)と4つのヒューマノイド形態で評価し、JanusVLNが最高の平均成功率43.55%とnDTW 48.38を達成した。さらに、DualVLNとUnitree G1を用いた20エピソードのsim-to-realパイロット実験で、ナビゲーションエラーの相関が強く(r=0.935)、平均絶対差0.68m、平均軌道類似度0.782(±0.188)nDTWを示した。

5. 議論はある?

要旨からは、議論の詳細は不明だが、結果はVLNモデル、コントローラ、ヒューマノイド形態の物理実行下での相互作用を強調している。sim-to-realのパイロットでは相関が強いが、軌道類似度のばらつき(±0.188)があり、実環境での性能差が示唆される。また、ベンチマークの規模や多様性、命令生成の品質に関する議論は要旨に含まれていない。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、NaVILA、DualVLN、StreamVLN、JanusVLNが挙げられる。また、VLNの定番手法として、Vision-Language Navigationの既存ベンチマーク(例:R2R、RxR)や、ヒューマノイド制御のためのRL locomotion policyに関する研究が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Quan-Dung Pham, Anh Dao, The-Anh Nguyen, Minh Nguyen-Dinh, Phuong Nam Dang, Tri Pham, Hung Tran, Bach Dao, Tuyen P. Le, Truong Nguyen, Quan Nguyen

分類: cs.RO

原文アブストラクト

Vision-Language Navigation (VLN) for humanoid robots poses challenges existing benchmarks fail to address: bipedal locomotion imposes physical constraints absent from wheeled agents, humanoid morphologies vary across platforms, and egocentric observations are distorted by locomotion-induced camera dynamics. We present HumanoidVLN, a physics-grounded simulator and benchmark for VLN across diverse humanoid embodiments. Built on NVIDIA Isaac Sim, our platform supports an extensible set of humanoid configurations, demonstrated on four robots (Unitree G1, Unitree H1, Internal-A, Internal-B) spanning 10-12 lower-body DoF and heights from 1.17m to 1.80m, via a hierarchical control stack combining a reinforcement learning locomotion policy with interchangeable PD or MPC path trackers. New robots and VLN models integrate with minimal effort; we demonstrate compatibility with NaVILA, DualVLN, StreamVLN, and JanusVLN. Environments are drawn from artist-designed scenes and 3D Gaussian Splatting reconstructions, filtered for navigable areas exceeding 100 square meters. Instructions are generated by a dual generator-reviewer plus paraphraser multi-agent pipeline with human-in-the-loop verification, yielding 933 collision-aware reference episodes, each paired with one fine-grained instruction and three coarse-grained stylistic variants (formal, natural, casual). Across four models and four embodiments, JanusVLN achieves the highest mean success rate of 43.55% and nDTW of 48.38. In a 20-episode sim-to-real pilot with DualVLN and the Unitree G1, navigation errors correlate strongly (r=0.935), with a mean absolute difference of 0.68m and mean trajectory similarity of 0.782 (+/-0.188) nDTW. These results highlight the interaction between VLN models, controllers, and humanoid embodiments under physical execution. Code, benchmark, and data will be released upon acceptance at https://humanoid-vln.github.io/.