Hongyin Zhang
Alibaba Group
収録論文 17本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RynnValue: 時間的距離によるロボット価値基盤モデルのスケーリング価値基盤モデル2026/8/1
ロボット操作のための価値基盤モデルRynnValueを提案。時間的距離を報酬ラベルとして用いることで、大規模データから好みラベルなしで学習し、実世界の成功率を向上させた。
- 世界-価値-行動モデル:視覚言語行動システムのための暗黙的プランニングVLA2026/4/1
視覚言語行動(VLA)モデルに、将来の軌跡の潜在表現を学習し、価値関数で評価することで暗黙的プランニングを可能にする統一フレームワークを提案した。
- MMaDA-VLA:マルチモーダル指示と生成を統合した大規模拡散視覚-言語-行動モデルVLA2026/3/1
離散拡散を用いて将来の目標観察と行動チャンクを同一トークン空間で同時にデノイズするVLAモデルを提案し、LIBEROで98.0%の成功率を達成した。
- CMR: 収縮写像埋め込みによる不整地でのロバストなヒューマノイド歩行歩行2026/2/1
観測ノイズに強い潜在表現を学習する収縮写像埋め込み(CMR)を提案し、不整地でのヒューマノイド歩行をロバスト化した研究。
- CRL-VLA:継続的視覚-言語-行動学習VLA2026/2/1
VLAモデルの継続的な強化学習微調整において、安定性と可塑性のトレードオフを非対称な制御と二重クリティック構造で解決するフレームワークを提案。
- RobustVLA: 視覚言語行動モデルのためのロバスト性を考慮した強化学習ポストトレーニングVLA2025/11/1
事前学習済みVLAモデルに対し、ヤコビアン正則化と平滑化正則化を組み込んだオンライン強化学習ポストトレーニングを行い、観測ノイズや行動摂動に対するロバスト性を高める手法を提案した。
- VLA-RFT: 世界シミュレータにおける検証済み報酬を用いた視覚-言語-行動モデルの強化学習ファインチューニングVLA2025/10/1
実データから学習した世界モデルをシミュレータとして使い、VLAモデルを強化学習でファインチューニングする手法を提案。400ステップ未満で教師あり学習を上回り、外乱下でも安定したタスク実行を実現した。
- 信号と分散のバランス:VLAフローモデルのための適応的オフラインRLポストトレーニングVLA2025/9/1
フローマッチングベースのVLAモデルに対し、バイアスと分散のトレードオフを適応的に制御するオフラインRL微調整法ARFMを提案し、実世界タスクでの性能向上を実現した。
- スキルグラフによるマルチタスク・マルチエージェント強化学習マルチエージェント強化学習2025/7/1
無関係なタスクを含むマルチタスク・マルチエージェント強化学習に対し、上位層にスキルグラフ、下位層に標準MARLを用いる階層的手法を提案し、知識転移能力を高めた。
- ReinboT: 強化学習でロボットの視覚言語マニピュレーションを強化VLA2025/5/1
模倣学習ベースの視覚言語行動モデルに強化学習の累積報酬最大化を取り入れ、高密度リターン予測で混合品質データから頑健な操作方策を学習する手法を提案。
- GEVRM: 目標表現型ビデオ生成モデルによるロバストな視覚マニピュレーションVLA2025/2/1
内部モデル制御の原理を取り入れ、テキスト誘導のビデオ生成で将来の視覚的目標を生成しつつ、摂動を内部埋め込みとして推定することで、外乱に強い閉ループVLAを実現した研究。
- TDMPBC:自己模倣強化学習によるヒューマノイドロボット制御強化学習2025/2/1
強化学習において、タスクに関連する可能性のある軌道を自己模倣することで、ヒューマノイドロボットの制御性能を大幅に向上させるフレームワークSIRLを提案した。
- QUART-Online: 四足歩行ロボット学習のための遅延フリー大規模マルチモーダル言語モデルVLA2024/12/1
四足歩行ロボットの視覚-言語-行動タスクにおいて、推論遅延を解消するために行動チャンク離散化を導入し、言語基盤モデルの性能を落とさずにリアルタイム推論を実現した研究。
- A dynamical clipping approach with task feedback for Proximal Policy Optimization2023/12/12
- Unlock Reliable Skill Inference for Quadruped Adaptive Behavior by Skill Graph2023/11/1
- A Real-World Quadrupedal Locomotion Benchmark for Offline Reinforcement Learning2023/9/1
- Imitation and Adaptation Based on Consistency: A Quadruped Robot Imitates Animals from Videos Using Deep Reinforcement Learning2022/3/1