日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ヒューマノイド/動作計画arXiv:2608.10220v1

自己衝突回避を考慮した狭所移動ヒューマノイドの全身動作計画

Whole-Body Planning for Humanoids Navigating Confined Spaces via Self-Collision Avoidance References

シェア:XThreadsFacebookLINEはてブBluesky

狭い環境でのヒューマノイド移動のため、到達可能な剛体ボリューム上で経路計画を行い、衝突回避を組み込んだ3段階の全身計画フレームワークを提案。生成した計画を残差強化学習で追従し、Unitree G1で検証した。

詳しい要約

1. どんなもの?

本論文は、狭所環境でのヒューマノイドの全身動作計画を扱う。環境障害物と自己衝突の複雑な制約を考慮しつつ、多接触動的実現性を維持する必要がある。提案する3段階の全身計画フレームワークは、運動学的に到達可能な剛体ボリューム上で直接、経路計画を定式化する。微分可能な衝突回避を到達可能性制約付きの定式化に統合し、長い時間軸にわたって全次数軌道最適化を確実に導くボリューム情報に基づくガイドを生成する。さらに、最適化された計画を高品質な参照として、残差強化学習ポリシーを訓練し、ロバストなオンライン実行を実現する。Unitree G1ヒューマノイドを用いて、NIST緊急対応基準を超える3つのベンチマークで検証し、制限された閉じ込め比($C_r < 1.5$)を達成した。

2. 先行研究と比べてどこがすごい?

従来の軌道最適化手法は、粒子抽象化上のスプラインを用いるため、大きな衝突空間を扱う際に不十分であり、局所最適解に陥りやすい。本手法は、運動学的に到達可能な剛体ボリューム上で直接経路計画を行うことで、この問題を回避し、標準的なベースラインが失敗する複雑な足と手の接触を伴う12〜18秒のタスクで実行可能な軌道を生成できる点が優れている。また、計画を参照として残差強化学習ポリシーを訓練することで、オンライン実行のロバスト性を向上させている。

3. 技術・手法の肝は?

手法の核は、3段階のフレームワークである。第一段階では、運動学的に到達可能な剛体ボリューム上で経路計画を定式化し、微分可能な衝突回避を組み込む。第二段階では、ボリューム情報に基づくガイドを生成し、全次数軌道最適化を長い時間軸にわたって導く。第三段階では、最適化された計画を参照として残差強化学習ポリシーを訓練する。これにより、環境障害物と自己衝突の複雑な制約を扱いながら、多接触動的実現性を維持する。

4. どうやって有効だと検証した?

Unitree G1ヒューマノイドを用いて、NIST緊急対応基準を超える3つのベンチマークテストベッドで検証した。制限された閉じ込め比($C_r < 1.5$)を達成し、標準的なベースラインが失敗する複雑な足と手の接触を伴う12〜18秒のタスクで実行可能な軌道を生成できることを示した。また、学習されたポリシーが、物理シミュレーションにおける広範なドメインランダム化の下でこれらの計画を追跡できることを確認した。

5. 議論はある?

要旨からは、議論の余地や限界についての詳細は不明である。ただし、提案手法はシミュレーションでの検証に留まっており、実機での検証が今後の課題となる可能性がある。また、残差強化学習ポリシーの訓練には計算コストがかかる可能性があり、実時間性能に関する議論が必要かもしれない。

6. 次に読むべき論文は?

要旨で参照されている関連研究としては、従来の軌道最適化手法(spline-based trajectory optimization)や、ヒューマノイドの多接触計画(multi-contact planning)、強化学習を用いたロコモーション制御(RL-based locomotion control)などが挙げられる。具体的には、NIST緊急対応基準に関連する研究や、Unitree G1に関する研究が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Carlos Gonzalez, Luis Sentis

分類: cs.RO

原文アブストラクト

Humanoid locomotion in highly confined environments requires navigating dense environmental obstacles and complex self-collision bounds while maintaining multi-contact dynamic feasibility. Traditional trajectory optimizers frequently struggle in these restricted spaces, as navigating the large collision space with splines on particle abstractions is insufficient and leads to poor local minima. To address this, we propose a three-stage whole-body planning framework that formulates kinematic path planning directly over kinematically reachable rigid-body volumes. By integrating differentiable collision avoidance into a reachability-constrained formulation, our framework synthesizes volume-informed guides that reliably guide a full-order trajectory optimizer over long horizons. We show that these optimized plans serve as high-quality references to train a residual reinforcement learning policy for robust online execution. We validate our approach on the Unitree G1 humanoid across three benchmark testbeds exceeding NIST emergency response standards, achieving restricted confinement ratios ($C_r < 1.5$). Our framework generates feasible trajectories across 12-to-18-second tasks with complex foot and hand contacts where standard baselines fail, while the learned policy successfully tracks these plans under extensive domain randomization in physics simulation.