Wang Xu
収録論文 6本 ・ フィジカルAI/ロボット学習
VLAUAVナビゲーションロボット知覚ベンチマーク身体性計画3D再構成
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SimpleMemVLA: 視覚言語行動モデルのためのシンプルかつ効果的なネイティブビデオメモリVLA2026/9/2
専用メモリモジュールを使わず、過去の観察をタイムスタンプ付きビデオとしてそのままバックボーンに渡すことで、長時間の操作タスクで高い性能を達成するVLAを提案した。
- DynFly: 都市環境におけるUAV視覚言語ナビゲーションのための動的認識連続軌道生成UAVナビゲーション2026/6/1
UAVの視覚言語ナビゲーションにおいて、高レベルの推論と実行可能な連続軌道の間のギャップを埋めるため、Bスプラインとフローマッチングを用いた動的認識軌道生成フレームワークDynFlyを提案した。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- DeepThinkVLA:視覚言語行動モデルの推論能力を高めるVLA2025/11/1
CoTがVLAモデルに有効となる2つの条件(デコーディング整合性と因果整合性)を特定し、それに基づくハイブリッドアテンションとSFT→RLパイプラインでLIBEROやRoboTwinでの成功率を大幅に向上させた論文。
- CookBench: 複雑な料理シナリオにおける長期的身体性計画ベンチマーク身体性計画2025/8/1
高忠実度Unityシミュレータ上で、ユーザ意図の認識と長期的・細粒度の身体動作による料理遂行を評価するベンチマークを提案。
- 自動運転における学習ベース3D再構成:包括的サーベイ3D再構成2025/3/1
自動運転向けの学習ベース3D再構成技術について、基礎から最先端手法、応用、課題、今後の方向性までを体系的にまとめたサーベイ論文。