Guangrun Wang
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RePO-VLA: 回復駆動型ポリシー最適化による視覚言語行動モデルVLA2026/5/1
成功軌跡のみの模倣学習では実行時のずれに対処できないため、失敗軌跡を活用して回復行動を学習するフレームワークを提案。成功・回復・失敗の軌跡に役割を割り当て、価値関数で進捗を評価し、ポリシーを改善する。
- ロボット操作は視覚から幾何への写像である:言語・ビデオモデルを超えた視覚幾何バックボーンマニピュレーション2026/4/1
ロボット操作を視覚から3次元幾何への写像と捉え、言語やビデオのバックボーンではなく事前学習済み3次元表現を用いたVGAモデルを提案し、シミュレーションと実機で優れた性能を示した。
- 事前学習済みビデオモデルから物理を学ぶ:ロボット操作のためのマルチモーダル連続・逐次世界相互作用モデル操作2026/3/1
ロボットデータ不足を補うため、事前学習済みビデオ生成モデルを物理シミュレータとして活用し、ビデオと行動を共通の物理トークンで表現することで、操作タスクを解く枠組みPhysGenを提案した。
- TAG: 物体中心推論のためのターゲット非依存ガイダンスによるVLAポリシーの安定化VLA2026/3/1
VLAポリシーが散らかった環境で誤った物体や位置を掴む問題を、物体を消した観察との差分を利用した推論時ガイダンスで改善する手法を提案。
- OOWM: オブジェクト指向プログラムによる世界モデリングで身体性推論と計画を構造化VLA2026/2/25
LLMの身体性タスク推論を、UMLのクラス図とアクティビティ図を用いたオブジェクト指向の世界モデルとして明示的に構造化し、SFTとGRPOで訓練する枠組みを提案。
- RADAR: 実世界ダイナミクス・空間物理知能・自律評価による視覚言語行動モデルの汎化ベンチマークVLA2026/2/1
VLAモデルの実世界汎化を評価するため、物理ダイナミクス・空間推論タスク・3D指標による完全自律評価を統合したベンチマークRADARを提案し、既存モデルを監査した。
- 視覚言語行動モデルのための安定した言語ガイダンスVLA2026/1/1
VLAモデルが言語の言い回しの変化に弱い「モダリティ崩壊」を解決するため、意味意図と視覚的アフォーダンスを分離する確率的フレームワークRSSを提案し、敵対的な言語摂動下でも頑健な操作性能を実現した。
- VLAモデルは思われているよりずっと汎化する:物理・空間モデリングの再検討VLA2025/12/1
VLAモデルの視点変化への脆弱性は空間モデリングのずれが主因だと示し、4Kパラメータの特徴トークン変調で視点精度を48.5%から87.1%へ改善、低ランク適応で90.8%を達成した。
- E0: Tweedie離散拡散によるVLAモデルの汎化性と細粒度制御の向上VLA2025/11/1
量子化された行動トークン上でTweedie離散拡散を行うVLAフレームワークE0を提案し、視点摂動拡張と合わせて多様な環境での汎化と細かい制御を実現した。
- Reward-Adaptive Reinforcement Learning: Dynamic Policy Gradient Optimization for Bipedal Locomotion2021/7/1