Wenxuan Song
The Hong Kong University of Science and Technology (Guangzhou)
収録論文 40本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- UniWAM:統合された世界行動モデルVLA2026/10/1
物理推論・映像生成・行動予測を統合したモデルで、人間の一人称視点データとロボットデータを活用し、複数の評価でSOTAを達成した。
- GroundingPI:視覚プリミティブで物理知能に挑むグラウンディング基盤モデルVLA2026/9/30
点やボックスを量子化座標として生成する4Bのグラウンディング基盤モデルを提案し、ロボット操作や自動運転の視覚バックボーンとして性能を向上させた。
- TacDyn-WAM: 異種視触覚ワールドアクションモデルにおける暗黙的触覚ダイナミクスの学習触覚2026/9/30
触覚の未来画像を再構成する代わりに、触覚ダイナミクスを表現空間で予測する視触覚ワールドアクションモデルを提案し、UniVTACで81.5%の成功率を達成した。
- GroundAnything: 並列デコーディングと高精度視覚グラウンディングをフラッシュ速度で両立視覚グラウンディング2026/9/30
拡散モデルによる並列デコーディングで視覚グラウンディングを高速化し、4Bモデルで同規模の最先端性能を達成した研究。
- 離散フォーシング:連続デノイジングに離散ガイダンスを注入する少数ステップ行動エキスパートVLA2026/9/30
VLAモデルにおいて、離散行動トークンで粗い行動構造を予測し、それを連続行動の精緻化のガイダンスとして用いるフローマッチング手法を提案。パラメータ数を抑えつつ高精度・高速推論を実現した。
- ActiveScale:モデル・データ・ハードウェアを横断したロボットの能動的知覚のスケーリングVLA2026/9/16
視点変更を伴う操作タスクのための能動的知覚フレームワークを提案し、カメラ姿勢を考慮したVLAモデル、1000時間の一人称視点データによる中間学習、単一操作者で遠隔操作可能な移動マニピュレーションプラットフォームを統合した。
- MobileWAM: 世界行動モデルをチェーン・オブ・フォーサイトで移動操作に橋渡しする移動操作2026/8/5
移動操作のための世界行動モデルを提案し、事前学習済みのビデオ拡散トランスフォーマーと軽量な行動エキスパートを融合させ、移動と操作の異種ダイナミクスを扱う。また、中間表現が未来の潜在チャンクを逐次予測するCoFを導入し、実機でも高い性能を示した。
- DreamTrajectory: ワールドモデル整合による軌道誘導型行動生成による移動操作移動操作/VLA2026/8/1
移動操作ロボットのための軌道誘導型フレームワークを提案し、意図レベルの軌道予測と全身行動生成を統合、テスト時探索で計画軌道との整合性を高め成功率を向上させた。
- Robust-WAM:生成事前学習と意味的先見を橋渡しするワールドアクションモデルVLA2026/8/1
ビデオ生成モデルの事前学習を活かしつつ、意味的潜在空間での先見アライメントを追加することで、見た目の変化に頑健なロボット制御を実現するポストトレーニング手法を提案した。
- 前方予測だけで十分か?JEPAワールドモデルのための物理状態接地ワールドモデル2026/8/1
JEPAベースのワールドモデルに、ロボットの自己受容状態と関節角変化を接地する2つの目的を追加し、潜在表現の識別性と下流タスク性能を向上させる手法を提案した。
- 4D-WAM: 軌跡フィールドによる世界行動モデルへの時空間認識の注入VLA2026/8/1
ロボットの行動生成と動画予測を統合する世界行動モデルに対し、3D軌跡フィールドからの時空間知識を表現整合で注入する訓練戦略を提案し、空間理解と実行精度を向上させた。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステムロボットポリシー評価2026/8/1
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減した。
- Xiaomi-Robotics-1: 10万時間以上の実世界軌道データによる視覚言語行動モデルのスケーリングVLA2026/7/1
10万時間以上の実世界の操作軌跡データを用いて、汎用的な視覚言語行動(VLA)モデルを事前学習し、未見環境での指示追従や少量データでの適応を可能にする基盤モデルを構築した。
- 汎用ロボット操作のための身体化チェーン・オブ・ソートの再考VLA2026/6/1
大規模な身体化CoTデータセットを構築し、VLAモデルにおける効果的なCoTの形式と統合方法を検証。推論をテスト時に使わず表現整形の教師信号として用いるERVLAを提案し、高い汎化性能を達成した。
- CapVector: パラメトリック空間における転移可能な能力ベクトルの学習による視覚言語行動モデルの強化VLA2026/5/1
事前学習済みVLAモデルの標準的な教師あり微調整では性能向上が限定的である問題に対し、補助目的の効果をパラメータ差分として抽出し、軽量な正則化で統合する能力ベクトル手法を提案した。
- SEDualVLN: 空間強化デュアルシステムによる視覚言語ナビゲーション視覚言語ナビゲーション2026/5/1
視覚言語ナビゲーションの性能を高めるため、空間認識を強化した2つのシステム(VLMとMLLM)を組み合わせたフレームワークを提案し、VLN-CEベンチマークで最高性能を達成した。
- RoboMemArena:ロボット記憶のための包括的で挑戦的なベンチマークベンチマーク/VLA/記憶2026/5/1
ロボットの長期タスクにおける記憶能力を評価するため、26タスク・平均1000ステップ超の大規模ベンチマークRoboMemArenaを構築し、VLMによるサブタスク生成と実世界評価を備えた。さらに、記憶管理と予測符号化を統合したVLAモデルPrediMemを提案し、既存手法を上回る性能を示した。
- VAMPO: ビデオ行動モデルの視覚ダイナミクスを改善するポリシー最適化VLA2026/3/1
ビデオ行動モデルのノイズ除去を逐次決定過程とみなし、専門家の視覚ダイナミクスに基づく報酬でポリシー最適化を行うことで、操作に重要な視覚ダイナミクスを直接改善するフレームワークを提案。
- MMaDA-VLA:マルチモーダル指示と生成を統合した大規模拡散視覚-言語-行動モデルVLA2026/3/1
離散拡散を用いて将来の目標観察と行動チャンクを同一トークン空間で同時にデノイズするVLAモデルを提案し、LIBEROで98.0%の成功率を達成した。
- Fast-dVLA: 離散拡散VLAを実時間性能へ高速化VLA/拡散モデル/ファインチューニング2026/3/1
事前学習済みVLAモデルの性能向上と適応コスト削減を両立するため、補助タスクの能力ベクトルをパラメータ空間で分離・統合する手法を提案し、軽量な正則化で標準SFTと同等の性能を低計算コストで実現した。
- DFM-VLA: 離散フローマッチングによる反復的な行動洗練でロボットマニピュレーションを実現VLA2026/3/1
行動トークンを反復的に洗練する離散フローマッチング型VLAを提案し、初期のトークン誤りを後から修正できるようにしてマニピュレーション精度を向上させた。
- S-VAM: 幾何学的・意味的先読みの自己蒸留によるショートカット動画行動モデルロボット学習/VLA2026/3/1
動画行動モデル(VAM)の推論速度と先読み精度のトレードオフを解決するため、単一パスで幾何・意味表現を予測するショートカットモデルS-VAMを提案。多段階拡散の生成事前知識を一段階推論に凝縮する自己蒸留戦略を導入し、シミュレーションと実世界で高性能を実証した。
- FRAPPE: 複数未来表現アラインメントによる汎用ロボット方策への世界モデリングの注入VLA2026/2/1
未来の観測の潜在表現を予測し、複数の視覚基盤モデルと並列にアラインメントすることで、汎用ロボット方策に世界認識を効率的に組み込む手法を提案。
- Vision-language-actionモデルの実用性を再考する:包括的ベンチマークと改良ベースラインVLA2026/2/1
VLAモデルの実用性を評価する新ベンチマークCEBenchを提案し、その知見に基づき軽量で実用的なLLaVA-VLAを開発した。
- HiF-VLA: 運動表現による視覚-言語-行動モデルのための後知恵・洞察・先見VLA2025/12/1
ロボット操作のためのVLAモデルに、過去・現在・未来の運動情報を統合する世界モデルを組み込み、長期的なタスクの一貫性を向上させた研究。
- 基盤モデル時代の身体性ロボットマニピュレーション:計画と学習の視点マニピュレーション2025/12/1
ロボットマニピュレーションの学習ベース手法を、高レベル計画と低レベル制御の統一的な枠組みで整理したサーベイ。言語・コード・動作・アフォーダンス・3D表現の推論や、入力モデリング・潜在表現学習・方策学習の分類を提示し、課題と展望を論じる。
- 統合拡散VLA:離散デノイジング拡散プロセスによる視覚・言語・行動モデルVLA2025/11/1
視覚・言語・行動を単一の離散デノイジング拡散過程で統合し、画像生成と行動予測を同時に最適化するVLAモデルを提案。CALVINやLIBEROなどで最高性能を達成。
- VLA^2: エージェントフレームワークで視覚言語行動モデルを強化し未知の概念操作を実現VLA2025/10/1
OpenVLAを実行基盤とし、Web検索や物体検出などの外部モジュールを活用して未知物体の視覚・言語知識を補完するエージェントフレームワークを提案。LIBERO環境での新ベンチマークで、ハードレベル成功率を44.2%向上させた。
- ロボットマニピュレーションの統合的理解に向けて:包括的サーベイマニピュレーション2025/10/1
ロボットマニピュレーション研究を、タスク別ベンチマーク・データセット・手法の統一的分類・ボトルネック・実応用まで幅広く整理した包括的サーベイ。
- Spatial Forcing:視覚-言語-行動モデルのための暗黙的な空間表現アラインメントVLA2025/10/1
3D入力や深度推定器に頼らず、VLAモデルの中間視覚埋め込みを事前学習済み3D基盤モデルの幾何表現に揃えることで、空間理解を暗黙的に獲得させ、行動精度と学習効率を向上させる手法を提案。
- VLA-Adapter:小型Vision-Language-Actionモデルのための効果的なパラダイムVLA2025/9/1
大規模VLMへの依存を減らし、0.5Bパラメータのバックボーンと軽量なPolicyモジュールでロボットデータの事前学習なしに高性能なVLAモデルを実現した研究。
- ReconVLA:再構成型視覚-言語-行動モデルによる効果的なロボット知覚VLA2025/8/1
視覚的注意を対象領域に正しく向けるため、注視領域を再構成する拡散トランスフォーマを組み込んだVLAモデルを提案し、精密操作と汎化性能を実証した。
- FlowVLA: 視覚的思考連鎖による動作推論を用いた視覚-言語-行動モデルVLA2025/8/1
未来フレーム予測の前にオプティカルフローで動作を推論するVisual CoTを導入し、物理的に妥当な予測と高効率なロボット操作を実現した。
- RationalVLA:デュアルシステムを備えた合理的視覚言語行動モデルVLA2025/6/1
曖昧・不可能な指示を拒否しつつ、実行可能な指示に基づくロボットアーム操作を行う二重システムの視覚言語行動モデルを提案し、新ベンチマークRAMAで評価した。
- CEED-VLA: 早期終了デコーディングを備えた一貫性視覚-言語-行動モデルVLA2025/6/1
視覚-言語-行動モデルの推論を高速化するため、一貫性蒸留と早期終了デコーディングを導入し、4倍以上の加速を実現した。
- OpenHelix: ロボットマニピュレーションのためのデュアルシステムVLAモデルの短いサーベイ、実証分析、オープンソース化VLA2025/5/1
既存のデュアルシステムVLAアーキテクチャを整理・比較し、設計要素を実証評価した上で、低コストなオープンソースモデルを提供するプロジェクト。
- MoRE: 四足歩行ロボットの視覚-言語-行動モデルにおける強化学習のスケーラビリティを解き放つVLA2025/3/1
四足歩行ロボット向けに、複数の低ランク適応モジュールを専門家として組み込んだスパース活性化の混合エキスパート型VLAモデルを提案し、強化学習で混合品質データから効率的に学習することで多様なタスク性能と汎化性を実現した。
- PD-VLA: 並列デコーディングによるアクションチャンキング統合VLAモデルの高速化VLA2025/3/1
アクションチャンキングを統合したVLAモデルの推論を並列固定点反復で高速化するPD-VLAを提案し、成功率を維持しつつ実行周波数を2.52倍に向上させた。
- GeRM: 四足歩行ロボットのためのMixture-of-Expertsを用いた汎用ロボットモデルVLA2024/3/1
オフライン強化学習とTransformerベースのVLAネットワーク、Mixture-of-Experts構造を組み合わせ、四足歩行ロボットのマルチタスク学習を効率化する汎用モデルGeRMを提案。自動収集データセットQUARD-Autoも公開。
- QUAR-VLA: Vision-Language-Action Model for Quadruped Robots2023/12/1