何が起きたか
掲載日2026-09-18のarXiv論文「FootQuery: Future-Touchdown-Guided Retrieval from Depth History for Perceptive Humanoid Locomotion」は、人型ロボットが次の着地点を予測し、その着地点に対応する深度履歴を参照して制御する枠組みを示した。実機評価ではUnitree G1を用い、屋外階段と、階段の上り下り・プラットフォーム・段差・隙間を組み合わせた屋内経路で連続走行を示した。
詳細
論文は、各脚の次回接地点の予測と不確実性を固有受容感覚から推定し、その分布と脚ごとの特徴量を使って、疎にサンプリングした過去の深度フレームを検索する方式を採る。学習時には、実際の接触位置を過去画像へ投影して、接触が見えていた領域で検索を監督する。 取り出した脚別特徴は全体の視覚記憶と融合されて制御行動を生成する。展開には固有受容感覚と搭載深度画像のみを要するとしている。シミュレーションでは、提示された最も難しい階段、隙間、プラットフォームの条件で、各構成要素を除いた比較より良い結果を示した。
Key Facts
| FootQueryは、次の着地点を手がかりに深度履歴を検索する人型ロボット向け移動制御枠組みである。 | [1] |
| 展開時に必要なのは固有受容感覚と搭載深度画像のみである。 | [1] |
| 実機評価はUnitree G1で行われた。 | [1] |
| 実機では屋外階段、および階段の上り下り・プラットフォーム・段差・隙間を含む屋内経路で連続走行を示した。 | [1] |
| 学習時には、実際の接触位置を過去画像へ投影して検索を監督した。 | [1] |
本紙の見方
FootQueryの新しさは、単に深度画像を時系列で使うのではなく、「次にどこへ足を置くか」という接地点予測を起点に履歴を引く点にある。視界が足先で隠れたり、着地時には目標地点が見えなくなったりする状況を前提に、過去の深度情報を接触予定地点に結びつける構成であるため、従来の前方視認ベースの足場認識とは設計思想が異なる。一方で、推論に必要なのが固有受容感覚と搭載深度画像に限られる点は、既存の機体に後付けしやすい実装路線とも読める。 本紙の関連記事であるUnitreeがG1+と新基盤モデルを発表(2026-09-19)では、Unitreeが人型ロボットG1+と基盤モデルUnifoLM-WLA-1.0を公表したとされていた。そこでは機体側の感知・運動更新と、モデル側の汎用化が主題だったが、今回の論文はその下で動く移動制御の中身に焦点を当てている。つまり、機体、基盤モデル、歩行制御という三層のうち、今回は最下層の「足場をどう読むか」が問われている。 この構図は、人型ロボットの競争軸がデモ映像だけでなく、段差・階段・隙間のような不整地での連続性に移っていることを示す。特に、深度履歴を検索対象にする発想は、リアルタイムの視野に入らない地形情報をどう保持し、いつ呼び出すかというデータ設計の問題に直結する。シミュレーションでの優位は示されたが、実環境ではUnitree G1で限定的な経路を通した段階であり、学習に使う接触投影の一般化、深度センサーの条件、経路の難度がどこまで拡張できるかはなお確認が必要である。
なぜ重要か
Unitree G1で屋外階段や段差、隙間を含む連続走行が示されたことで、歩行制御を「視野内の地形認識」から「接地点を軸にした履歴参照」へ寄せる設計が、実機で検証対象になった。人型ロボットの移動性能を評価する際、見える範囲の認識だけでなく、見えなくなる直前の深度情報をどう使うかが重要な論点になる。