Zhichao Wu
収録論文 5本 ・ フィジカルAI/ロボット学習
VLA強化学習操作/オフラインRL
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 政策不確実性を活用した効率的なワールドモデルベースVLA政策最適化のための優先ロールアウトVLA2026/9/19
VLA政策の強化学習において、政策の不確実性が高い状態に優先的にモデルロールアウトを割り当てる軽量サンプリング層U-GROWを提案し、シミュレーションと実機のマニピュレーションタスクで効率と有効性を示した。
- VINE: 強化学習のための生成制御ポリシーの調整強化学習2026/7/1
フローマッチングポリシーを強化学習で安定して学習するための新しいサンプリング手法VINEを提案。各デノイズステップで補間状態を再構築し、価値勾配の伝播を安定化させる。
- スピードアップパッチ:身体操作を加速するプラグアンドプレイ方策の学習操作/オフラインRL2026/3/1
既存の身体操作ポリシーの実行速度が遅い問題に対し、オフラインデータのみで使える軽量な外部スケジューラを導入し、行動チャンクを適応的に間引いて実行を高速化するフレームワークを提案した。
- 視覚言語行動モデルのための実用的な世界モデルベース強化学習に向けてVLA2026/3/1
VLAモデルの強化学習を実世界ではなく世界モデル内で行う枠組みVLA-MBPOを提案し、マルチビュー整合性と誤差蓄積を抑える設計で性能とサンプル効率を改善した。
- ALOE: 視覚言語行動モデルの事後学習のための行動レベルオフポリシー評価VLA2026/2/1
実世界の人間参加型強化学習でVLAモデルを改善するため、現在のポリシーを直接評価するオフポリシー評価フレームワークALOEを提案し、4つの実世界マニピュレーションタスクで検証した。