Wei Shan
収録論文 4本 ・ フィジカルAI/ロボット学習
VLA継続学習強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- BEE: 視覚言語行動モデルを用いた介入適応型実世界強化学習VLA2026/9/23
凍結したVLAモデルに対し、人間の修正を行動次元ごとの信頼度に応じた制約として扱うことで、実機でのオンライン強化学習を効率化する手法を提案。
- CIDER: 身体化強化学習のための継続的対話蒸留継続学習2026/8/22
実世界の継続的強化学習において、過去のポリシーを教師として凍結し、蒸留による保持とタスク学習を交互に行うことで、破滅的忘却を防ぎながら新しいスキルを獲得するフレームワークを提案した。
- VINE: 強化学習のための生成制御ポリシーの調整強化学習2026/7/1
フローマッチングポリシーを強化学習で安定して学習するための新しいサンプリング手法VINEを提案。各デノイズステップで補間状態を再構築し、価値勾配の伝播を安定化させる。
- ALOE: 視覚言語行動モデルの事後学習のための行動レベルオフポリシー評価VLA2026/2/1
実世界の人間参加型強化学習でVLAモデルを改善するため、現在のポリシーを直接評価するオフポリシー評価フレームワークALOEを提案し、4つの実世界マニピュレーションタスクで検証した。