何が起きたか

arXiv掲載の論文PASSAGEは、2026-09-16に、障害物の多い環境でヒューマノイドがまたぐ・すり抜ける・くぐる動作を選択し組み合わせるための知覚条件付き計画・追従枠組みを公表した。VRと慣性モーションキャプチャで100時間、1,500の混雑シーンに対応する人間の動作を収集し、オンボード知覚から traversal を実行する構成を示している。評価では、データ量の拡大とシーン拡張の有効性が、未見シーンでの接触なし成功率に反映された。

詳細

論文は、短期参照を生成する conditional flow-matching planner、これを実行する perceptive whole-body tracker、リアルタイム chunking による chunk 間整合性、さらに凍結した tracker の下で行う planner-side RL post-training を組み合わせた。トラッカーは50 Hzで動作し、計画は6.25 Hzで実行される。 完全オンボード構成として、egocentric 3D LiDAR perception、online occupancy mapping、Jetson AGX Orin 上での6.25 Hz planning と50 Hz control を統合した。論文は、50の未見の物理レイアウトで、事前に構築した地図やオフボード計算なしに traversal を行ったと述べている。

Key Facts

PASSAGEは、perception-conditioned planner-tracker framework としてヒューマノイドの traversal を扱う論文である[1]
VRと慣性モーションキャプチャで、100 hの scene-aligned human motion を1,500の cluttered scenes から収集した[1]
conditional flow-matching planner は short-horizon references を motion history、local destination、robot-centric multi-layer elevation map から生成する[1]
perceptive whole-body tracker は50 Hzで実行される[1]
データ量を6 hから100 hへ増やすと、未見シーンでの mean contact-free success は48.1%から68.9%に上昇し、validated scene augmentation を含む最終モデルは70.3%を示した[1]

本紙の見方

本件の新規性は、ヒューマノイドの横断動作を単一の技能ポリシーで切り出すのではなく、知覚条件付きの planner-tracker でまたぐ・すり抜ける・くぐるを一つの枠組みに束ねた点にある。しかも学習資源は、技能注釈つきのライブラリではなく、VRと慣性モーションキャプチャで集めた100時間・1,500シーンのシーン整合モーションである。ここからは、行動の種類よりも、環境形状に対してどの参照軌道を短時間で生成し、身体全体で追従できるかが焦点だと読める。 構成を見ると、入力は egocentric 3D LiDAR と online occupancy mapping、処理は 6.25 Hz の計画、実体の出力は 50 Hz の全身制御であり、データ→地形表現→短期参照→全身追従という連結になっている。さらに planner-side RL post-training を frozen tracker の下で行っており、学習済み追従器を固定したまま計画側だけを調整する設計である。これは、ハードウェア実装で破綻しやすいのが計画そのものだけでなく、計画と身体動作の整合であることを示す構造ともいえる。 本紙の見方では、重要なのは成功率の絶対値より、6時間から100時間への増量で未見シーンの接触なし成功率が48.1%から68.9%に上がった点である。データ拡大と scene augmentation が効いているなら、論点はモデルの巧拙だけでなく、どの形状の現場データをどう集めるかに移る。一方で、論文が示すのは50の未見レイアウトでの実験までで、実運用での頑健性、計画頻度と制御頻度のトレードオフ、学習に使った100時間の内訳、そして歩容別・障害物別の失敗モードはなお確認が必要である。

なぜ重要か

論文が示すのは、障害物環境でのヒューマノイド移動を、地図済み環境やオフボード計算に依存せずにオンボードで回す構成である。したがって、実世界での巡回・点検・搬送のように環境形状が変わる用途では、6.25 Hz計画と50 Hz制御の組み合わせがどこまで維持できるかが実装上の論点になる。

日本への影響

日本のロボット開発では、全身制御やLiDAR知覚だけでなく、混雑環境の実走行データをどう集めて学習に戻すかが課題になるとみられる。論文が示した100時間・1,500シーンという構成は、ハードウェア単体ではなくデータ収集と地形表現を含む開発体制が競争力になることを示している。