Tonghe Zhang
収録論文 6本 ・ フィジカルAI/ロボット学習
VLAヒューマノイド制御強化学習歩行
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 模倣を超えて:VLAモデルのための強化学習ベースのSim-Real協調学習VLA2026/2/1
実機とシミュレーションのデモでSFT後、シミュレーションで強化学習しつつ実機データの補助損失で忘却を防ぐ協調学習フレームワークを提案し、実機卓上操作タスクで成功率と汎化性能を向上させた。
- BFM-Zero: 教師なし強化学習によるヒューマノイド制御のためのプロンプト可能な行動基盤モデルヒューマノイド制御2025/11/1
教師なし強化学習とForward-Backward表現を用いて、運動・目標・報酬を共通の潜在空間に埋め込み、再学習なしに多様な全身タスクを実行できるヒューマノイド制御の基盤モデルを提案し、実機Unitree G1でゼロショット運動追従や目標到達を実現した。
- π_RL: フローベース視覚言語行動モデルのオンライン強化学習ファインチューニングVLA2025/10/29
フローマッチングに基づく大規模VLAモデルに強化学習を適用するため、Flow-NoiseとFlow-SDEの2手法を提案し、分布内外で性能を向上させた。
- SAC Flow: 速度再パラメータ化逐次モデリングによるフローベース方策のサンプル効率の良い強化学習強化学習2025/9/1
フローベース方策のオフポリシー強化学習における不安定性を、速度ネットワークの再パラメータ化とゲート機構で解決し、SACベースの実用的アルゴリズムを提案した。連続制御とロボットマニピュレーションで最先端性能を達成。
- ReinFlow: フローマッチング方策をオンライン強化学習で微調整強化学習2025/5/1
フローマッチング方策に学習可能なノイズを注入して離散マルコフ過程に変換し、オンライン強化学習で微調整する手法を提案。歩行・操作タスクで大幅な性能向上と計算時間削減を実現。
- 変化する指令に応じて人間らしい歩容をシームレスに遷移させる手法歩行2025/2/1
人間らしい動作の模倣学習にWGAN-divやHybrid Internal Model、好奇心ボーナスを組み合わせ、速度指令の変化に応じて滑らかに歩容を切り替え、未知の動作や実機・異なる地形へゼロショット転移できるヒューマノイド制御を実現した。