Xiaobo Wang
Shenzhen University of Advanced Technology
収録論文 6本 ・ フィジカルAI/ロボット学習
VLAVLA/世界モデルVLA/ロボット操作
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- AR-WAM: 視覚条件付きエージェント対応ワールドアクションモデルによるロボットマニピュレーションVLA2026/9/20
言語指示の代わりにバウンディングボックスと操作トークンで条件付けする0.5Bパラメータの世界行動モデルを提案し、エージェント駆動のロボット制御を実現した。
- ゲートはキャッシュではない:ゲートの由来が訓練不要のVLAトークンスキップの閉ループ信頼性を決めるVLA2026/8/1
VLAモデルのトークンスキップ高速化において、前ステップの加速された順伝播からゲートを取るとスキップが累積して性能が崩壊することを示し、ロボット実行中に密な順伝播を1回行う「アクチュエーションスラックリフレッシュ」を提案して性能を回復させた。
- JEPA-WAM: 共同埋め込み世界モデリングによる視覚-言語-行動ポリシーの学習VLA/世界モデル2026/8/1
事前学習済みV-JEPA空間に基づく潜在世界モデルを構築し、遷移予測と行動生成を共有予測器で結合することで、効率的かつ高精度なロボット制御を実現した。
- LiLa-WAM: ロボット操作のための軽量潜在推論ワールドアクションモデルVLA2026/8/1
将来の状態をコンパクトな潜在空間で推論する軽量なワールドアクションモデルを提案し、単一GPUで学習可能にした。視覚遷移トークンという言語不要のタスク表現も導入し、シミュレーションと実機で高い成功率を達成した。
- AC-VLA: 構成学習によるロバストな分布外行動実行VLA/ロボット操作2026/7/1
VLAモデルの分布外汎化を改善するため、LLMによるタスク分解と非対称マスキングを組み合わせた構成学習フレームワークAC-VLAを提案した。
- 推論時適応アクションチャンキングによる視覚言語行動モデルの性能向上VLA2026/4/1
VLAモデルにおいて、アクションのチャンクサイズを予測のエントロピーに基づいて適応的に決定する戦略を提案し、シミュレーションと実世界の操作タスクで性能を向上させた。