日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ヒューマノイド制御arXiv:2609.09918

ViBe: 知覚型ヒューマノイド全身制御のための視覚行動適応

ViBe: Visual Behavior Adaptation for Perceptive Humanoid Whole-Body Control

シェア:XThreadsFacebookLINEはてブBluesky

事前学習済み視覚エンコーダと低ランクアダプタを用いて、運動追跡型ヒューマノイド制御器を知覚型タスクに効率的に適応させ、シミュレーションから実機へのゼロショット転移を実現した。

詳しい要約

1. どんなもの?

- 人間型ロボットの全身制御のための視覚適応フレームワークViBeを提案。 - 運動追従型のtrackerを知覚制御タスクに適応させるpost-training手法。 - 事前学習済み視覚エンコーダとmulti-query extractorでタスク関連の知覚フィードバックを学習。 - low-rank adaptersでtrackerの入力に接続し、パラメータ効率の良いfine-tuningを実現。 - 4つのタスク(curbs/parkour歩行、Repose Cube、omni-object loco-manipulation、dodgeball)でzero-shot sim-to-real転移を達成。

2. 先行研究と比べてどこがすごい?

- 従来のtrackerはexteroceptive feedbackがなく、高レベルプランナに依存。 - 既存の知覚コントローラはgeometry-onlyエンコーダをゼロから学習し、意味情報を犠牲にしていた。 - またteacher-student distillationに依存するのが一般的。 - ViBeは事前学習済み視覚エンコーダを活用し、意味情報を保持しつつ低ランク適応で効率的にfine-tuning。 - 直接ポリシー最適化により、タスク報酬と参照データセットから適応可能。

3. 技術・手法の肝は?

- 事前学習済み視覚エンコーダとmulti-query extractorモジュールを組み合わせ、タスク関連の知覚特徴を抽出。 - この特徴をlow-rank adaptersを介してtrackerの入力にグラフト。 - パラメータ効率の良いfine-tuningを実現。 - タスク報酬と参照データセットを与え、ポリシー最適化で直接適応。 - モジュラーなコントローラとして設計。

4. どうやって有効だと検証した?

- 4つのタスクで評価:curbsとparkourでの知覚歩行、Repose Cube、omni-object loco-manipulation、dodgeball。 - zero-shot sim-to-real転移を実証。 - 屋外、低照度、RGB distractor条件下で視覚的にロバストな性能を確認。 - さらに、意図的に単純なプランナで目標指向のRepose Cubeタスクを解決し、知覚コントローラの有効性を示した。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究:motion tracking、teacher-student distillation、geometry-only encoders。 - 関連手法:pre-trained visual encoders、low-rank adapters、policy optimization。 - 同分野の定番:humanoid whole-body control、sim-to-real transfer、perceptive control。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Lokesh Krishna, Sarvesh Venkatesan, An Zhang, Quan Nguyen

分類: cs.RO

原文アブストラクト

Motion tracking provides a scalable recipe for humanoid whole-body control. By design, the resulting trackers lack exteroceptive feedback hence reacting to the environment remains the responsibility of a higher-level planner. Existing perceptive controllers train geometry-only encoders from scratch, trading semantics for sim-to-real ease, and typically rely on teacher-student distillation for a task of interest. We present ViBe, a post-training framework for adapting motion trackers to perceptive control tasks. We leverage pre-trained visual encoders with a multi-query extractor module to learn task-relevant perceptive feedback. This feedback is grafted onto the tracker's input via low-rank adapters, enabling parameter-efficient fine-tuning. Given a task reward and a reference dataset, this modular controller can be adapted directly via policy optimization. Across four tasks, ViBe shows zero-shot sim-to-real transfer spanning perceptive walking on curbs and parkour, Repose Cube, omni-object loco-manipulation, and dodgeball, with visually robust performance across outdoor, low-light, and RGB distractor conditions. Finally, we solve a goal-oriented Repose Cube task with a deliberately simple planner, demonstrating the efficacy of perceptive controllers, adapted by our approach.

関連論文