Zefang Huang
収録論文 4本 ・ フィジカルAI/ロボット学習
ロボット学習実世界オンライン学習/システムVLA強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- STEAM: 実世界ロボット学習のための自己教師あり時間アンサンブル優位性モデリングロボット学習2026/6/1
専門家のデモからフレーム間の時間オフセットを自己教師ありで学習し、ロールアウトデータの各フレームの優位性を評価する手法を提案。混合品質データの保守的なスコアリングにより、ポリシー学習の成功率を向上させた。
- USER: 実世界オンライン方策学習のための統合拡張可能システム実世界オンライン学習/システム2026/2/1
実世界のロボット群をGPUと同様に扱うハードウェア抽象化と非同期学習基盤を提供し、オンライン模倣・強化学習やVLAモデルを長期実験で効率的に訓練できるシステムを構築した。
- WoVR: 幻覚を制御してVLAポリシーを強化学習で事後学習する信頼可能なワールドモデルシミュレータVLA2026/2/1
不完全な学習済みワールドモデルをシミュレータとして使い、キーフレーム初期化ロールアウトとモデル・ポリシー共進化で幻覚の影響を抑え、VLAポリシーを強化学習で安定に事後学習する手法を提案。
- リカレント強化学習の安定化のための文脈エンコーダ専用学習率強化学習2024/5/24
部分観測マルコフ決定過程(POMDP)向けのリカレント強化学習において、文脈エンコーダに他層より低い学習率を設定することで訓練の安定性を高める手法RESeLを提案し、18のPOMDPタスクと5つのMDPタスクで有効性を示した。