Xudong Wang
収録論文 9本 ・ フィジカルAI/ロボット学習
VLA模倣学習/メタ学習/ロボット操作マニピュレーションナビゲーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 履歴行動軌跡からのスキル学習:世界行動モデルのための行動経験辞書VLA2026/9/30
過去の行動軌跡を共有埋め込みとして辞書化し、操作タスク間でスキルを再利用できるようにした世界行動モデルを提案。
- LEEVLA: 潜在環境進化における重要情報の認識による視覚言語行動モデルVLA2026/7/9
視覚言語行動モデルが動的環境でタスクに重要な視覚情報を強調し、潜在世界表現の構造的進化を保つための新しいアーキテクチャを提案。ドリフト誘導型動的優先化と構造的特徴フロー生成により、タスク認識の「どこで・どのように」学習を実現し、ベンチマークで優れた性能を示した。
- 動力学を考慮したメタ模倣学習による未知ロボット操作への汎化模倣学習/メタ学習/ロボット操作2026/7/1
メタ学習と動力学情報を統合した模倣学習フレームワークDAMIを提案し、未知タスクへの迅速な適応と汎化を実現した。
- 生涯にわたる言語条件付きロボット操作学習マニピュレーション2026/3/1
本論文では、ロボットが複数の操作スキルを継続的に学習しつつ、古いスキルの忘却を防ぐフレームワーク「SkillsCrafter」を提案する。
- ReMem-VLA: 二重レベル再帰クエリによる記憶を備えた視覚言語行動モデルVLA2026/3/1
視覚言語行動モデルに、フレーム単位とチャンク単位の再帰クエリを導入し、短期・長期記憶を実現。過去の観測予測を補助タスクとして追加し、記憶依存タスクで既存モデルを大幅に上回る性能を達成した。
- MMaDA-VLA:マルチモーダル指示と生成を統合した大規模拡散視覚-言語-行動モデルVLA2026/3/1
離散拡散を用いて将来の目標観察と行動チャンクを同一トークン空間で同時にデノイズするVLAモデルを提案し、LIBEROで98.0%の成功率を達成した。
- 生涯学習型身体化ナビゲーション学習ナビゲーション2026/3/1
大規模言語モデルを用いた身体化ナビゲーションエージェントが、複数のタスクを連続的に学習しながらも過去の知識を保持できる生涯学習フレームワークUni-Walkerを提案した。
- SeqWalker: 階層的計画による逐次視野言語ナビゲーションVLA2026/1/1
長期的な多タスク指示を階層的計画で分割し、視覚観察に基づくサブ指示選択と探索検証で軌道誤りを修正する視野言語ナビゲーションモデルを提案。
- Unsupervised Visual Attention and Invariance for Reinforcement Learning2021/4/1