Fan Xu
USTC
収録論文 6本 ・ フィジカルAI/ロボット学習
世界モデルVLAビデオ世界モデルモデルベース強化学習触覚sim2real
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FutureWorlds: 代替未来からロボット世界モデルを学習する世界モデル2026/10/1
マルチモーダル離散自己回帰モデルと多様性ビーム探索、候補ごとの記憶保持、MemSPO最適化を組み合わせ、ロボットの行動条件付き未来予測を高精度化する枠組みを提案。
- Spotter: 身体性モデルを主導させ、VLMに内省させるVLA2026/9/29
身体性モデルが連続実行を主導し、VLMが並行して監視・エラー検出時のみ介入して内省・修正する枠組みを提案し、RoboCasaやRoboTwin 2.0で成功率を改善した。
- RoboAlign-R1: ロボットビデオ世界モデルのための蒸留型マルチモーダル報酬アライメントビデオ世界モデル2026/5/1
ロボットビデオ世界モデルの訓練を、再構成損失などの低レベル目的ではなく、指示追従や操作成功などの意思決定に重要な能力に合わせるため、報酬アライメントと長期推論安定化を組み合わせたフレームワークを提案した。
- 計画としての時空間予測:生成的世界モデルを用いたモデルベース強化学習アプローチモデルベース強化学習2025/10/5
時空間予測をモデルベース強化学習の問題として捉え、生成的世界モデルとビーム探索による計画で非微分な評価指標を報酬として活用し、極端事象の捕捉精度を高める手法を提案した。
- 単眼画像に基づくケーブル駆動ソフトロボットの三次元力推定手法触覚2024/9/1
単眼画像と駆動情報を融合したエンドツーエンドネットワークにより、ソフトロボットの3次元接触力を高精度に推定する手法を提案した。
- RL-GSBridge: 3Dガウシアンスプラッティングによるロボットマニピュレーション学習のためのReal2Sim2Real手法sim2real2024/9/1
3Dガウシアンスプラッティングを強化学習シミュレーションに組み込み、メッシュベースの編集と物理シミュレータ同期により、視覚ベースの深層強化学習でゼロショットのsim-to-real転移を実現した。