Xiaoquan Sun
収録論文 8本 ・ フィジカルAI/ロボット学習
VLAVLA/操作操作継続学習/VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- AtomEgo: 一人称視点ロボット統合による身体性基盤モデル事前学習の探求VLA2026/9/18
約2,659時間の一人称視点人間データとロボットデータを組み合わせ、身体性基盤モデルの事前学習における効果的な統合手法を体系的に検討した研究。
- FAN: 視覚-言語-行動モデルの継続適応のための先見的行動正規化VLA2026/9/18
VLAモデルの継続学習において、行動の正規化統計を較正セットから一度だけ推定して固定するFANを提案し、単腕・両腕操作の実タスクで高い性能と安定性を示した。
- SAM3Dガイドによる物体中心表現アライメントを用いた視覚言語行動モデルVLA/操作2026/7/1
VLAモデルにSAM3Dを教師として物体中心の3D表現を学習させ、推論時はRGBのみで高精度な操作を実現する手法を提案。
- HiMem-WAM: ロボット操作のための階層的メモリゲート型ワールドアクションモデル操作2026/6/1
長期的なロボット操作タスクにおける記憶保持の問題を解決するため、階層的な潜在アクションと境界トリガー型メモリ更新を統合したワールドアクションモデルを提案した。
- 視覚言語行動モデルは実世界データから忘れずに継続学習できるか?継続学習/VLA2026/5/1
実世界のロボット連続操作タスクでVLAモデルの継続学習を検証し、経験再生が破滅的忘却を防ぎ、ジョイント訓練と同等以上の性能を達成することを示した。
- AtomVLA: 予測的潜在世界モデルによるロボット操作のためのスケーラブルなポストトレーニングVLA/操作2026/3/1
VLAモデルの長期的なタスク実行における指示の粒度不足による誤差蓄積を解決するため、大規模言語モデルでタスクを細分化し、予測的世界モデルで潜在空間内のサブタスク達成度を評価する新しいフレームワークを提案した。
- Vision-language-actionモデルの実用性を再考する:包括的ベンチマークと改良ベースラインVLA2026/2/1
VLAモデルの実用性を評価する新ベンチマークCEBenchを提案し、その知見に基づき軽量で実用的なLLaVA-VLAを開発した。
- RoboTidy:3Dガウススプラッティングによる家庭内片付けの身体性ナビゲーション・行動ベンチマークVLA2025/11/1
言語指示に基づく家庭内片付けタスクのための、3Dガウススプラッティングで構築した500シーンのフォトリアルなベンチマークを提案し、VLA・VLNの学習と評価を可能にした。