Chengxuan Li
収録論文 2本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- マスク世界モデル:ロバストなロボット政策学習のための重要要素予測VLA2026/4/1
動画生成事前学習に基づく世界モデルがロボット政策学習に有望だが、RGB予測は背景や照明などの無関係な要素に過適合しがち。本論文では、ピクセルではなくセマンティックマスクの進化を予測するマスク世界モデル(MWM)を提案し、幾何学的情報ボトルネックにより物理ダイナミクスと接触関係を捉えつつ視覚ノイズを除去。拡散ベースの政策ヘッドと統合し、LIBEROやRLBenchでSOTAを達成し、実世界実験でもロバスト性を示した。
- TTF-VLA: 視覚言語行動モデルのためのピクセル注意統合による時間トークン融合VLA2025/8/1
VLAモデルが各時刻で独立に視覚入力を処理し時間情報を捨てている問題に対し、履歴と現在の視覚表現を選択的に融合する学習不要の手法を提案し、操作タスクの成功率を向上させた。