日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
ヒューマノイド/VLA/強化学習arXiv:2608.16837v1

HAF: 階層的アクションフローとスペクトル潜在RLによる汎用VLAのヒューマノイド全身移動操作への適応

HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL

シェア:XThreadsFacebookLINEはてブBluesky

汎用VLA基盤モデルをヒューマノイドの全身移動操作に適応させるための2部構成フレームワークHAFを提案。階層的なアクション生成とオンラインRLによるポリシー改善を実現する。

詳しい要約

1. どんなもの?

HAF (Humanoid Adaptation Framework) は、既製の汎用VLA (Vision-Language-Action) 基盤モデルをヒューマノイド全身移動操作タスクに適応させるための2部構成のフレームワークである。HAF-VLAとHAF-Steerからなり、HAF-VLAは階層的なアクションフロー生成器で、全身動作のデノイジングを3段階に分割し、ステージ埋め込みとクロスステージKVキャッシュを用いて運動学的依存関係を保持する。HAF-Steerは、凍結されたHAF-VLA上で動作する潜在オフラインからオンラインへのRLパイプラインであり、フローマッチングの可逆性とDCTベースの次元削減を利用して、RL最適化をコンパクトなノイズ部分空間に制限し、正則化されたSACポリシーを訓練する。これにより、大規模なVLAバックボーンの更新を回避し、効率的な実世界ポリシー改良を可能にする。

2. 先行研究と比べてどこがすごい?

従来の単一ステージVLAアーキテクチャは、ヒューマノイドの高次元で相互依存する動作(移動、腰の姿勢、両腕操作)を調整するのが困難であり、オフラインの行動クローニングで訓練されたポリシーは実世界展開で最適ではない可能性がある。また、オンラインRLで大規模VLAバックボーンを直接微調整することは計算コストが高く、実ロボット探索中の安全リスクがある。HAFは、階層的なアクションフロー生成により全身動作の一貫性を向上させ、潜在空間でのRLによりバックボーンを凍結したまま効率的なオンライン改良を実現する点で優れている。

3. 技術・手法の肝は?

HAF-VLAは、事前学習済みのフローマッチングVLA上に構築された階層的アクションフロー生成器であり、全身動作のデノイジングを3つの連続ステージに分割し、ステージ埋め込みとクロスステージKVキャッシュを使用して運動学的依存関係を保持する。HAF-Steerは、フローマッチングの可逆性とDCTベースの次元削減を利用して、RL最適化をコンパクトなノイズ部分空間に制限し、正則化されたSACポリシーを訓練する。これにより、大規模なVLAバックボーンの更新を回避する。

4. どうやって有効だと検証した?

7つの実世界ヒューマノイド移動操作タスクで評価され、バニラの単一ステージVLAベースラインと比較して、全身協調とタスクパフォーマンスが向上したことが示された。

5. 議論はある?

要旨からは、HAFの限界や潜在的な欠点についての議論は不明である。ただし、オンラインRLの安全性や計算効率に関する懸念に対処しているが、実世界での探索の安全性や一般化の限界については言及されていない。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、フローマッチングVLA、SAC (Soft Actor-Critic)、DCT (Discrete Cosine Transform) ベースの次元削減、およびオフラインからオンラインへのRLパイプラインが挙げられる。次に読むべき論文としては、これらの基礎となる研究や、ヒューマノイドの全身制御に関する最近の研究が考えられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Langzhe Gu, Chengkai Hou, Meng Li, Xinhua Wang, Jiaming Liu, Xinyuan Lv, Bowei Zhang, Shuanghao Bai, Guangrun Li, Jingyang He, Gaole Dai, Ziluo Ding, Zhiyuan Xu, Kuan Cheng, Jian Tang, Zhengping Che, Shanghang Zhang

分類: cs.RO, cs.AI

原文アブストラクト

Humanoid robots hold great promise as general-purpose agents in human-centered environments, yet generalist vision-language-action (VLA) foundation models are not readily applicable to humanoid whole-body loco-manipulation. The high dimensionality and interdependence of humanoid motions make it challenging for conventional single-stage VLA architectures to coordinate locomotion, waist posture, and dual-arm manipulation effectively. Moreover, policies trained through offline behavior cloning can remain suboptimal during real-world deployment. Although online reinforcement learning can refine policies through real-world interaction, directly tuning large VLA backbones demands excessive computation and may introduce safety risks during real-robot exploration. To address these bottlenecks, we introduce HAF (Humanoid Adaptation Framework), a two-part framework consisting of HAF-VLA and HAF-Steer that transfers off-the-shelf generalist VLA foundation models to humanoid whole-body loco-manipulation. HAF-VLA is a hierarchical action-flow generator built on a pretrained flow-matching VLA. It splits full-body action denoising into three sequential stages with stage embeddings and cross-stage KV caches that retain kinematic dependencies, avoiding incoherent whole-body actions from one-shot generation. On top of the frozen HAF-VLA, HAF-Steer is a latent offline-to-online RL pipeline that leverages flow-matching invertibility and DCT-based dimensionality reduction to restrict RL optimization to a compact noise subspace and train a regularized SAC policy. This avoids updating the large VLA backbone and enables efficient real-world policy refinement. Evaluated on seven real-world humanoid loco-manipulation tasks, HAF surpasses vanilla single-stage VLA baselines and improves whole-body coordination and task performance. Project website: https://grange007.github.io/HAF .