Wei Xue
収録論文 7本 ・ フィジカルAI/ロボット学習
移動操作世界モデルマニピュレーション敵対的攻撃/VLMVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- UniWAM:混合ストリーム世界行動モデルと操作アンカーポーズ監督による統合移動操作移動操作2026/9/30
移動と操作を別々の行動エンコーダと出力ヘッドで扱う統合世界行動モデルUniWAMを提案し、大規模3Dシーンから自動生成した操作アンカーポーズ監督データで学習することで、移動操作タスクの精度を大幅に向上させた。
- 潜在世界モデルにおける予測可能性の制御理論世界モデル2026/7/11
潜在世界モデルの予測誤差と制御性能の関係を理論的に分析し、データ平均誤差では制御性能を保証できないことを示し、計画コストの乖離に基づく新たな目的関数を提案した。
- Zero2Skill: 自律データ収集・訓練・展開によるロボットスキルのブートストラップマニピュレーション2026/7/1
人間の介入を減らしつつロボット操作スキルを自律的に学習するシステムを提案。修正を記憶して再利用することで、人間の作業時間を大幅に削減し、成功率を向上させた。
- 注意ハイジャック:視覚言語モデルにおけるクエリ横断的な応答操作敵対的攻撃/VLM2026/5/17
視覚言語モデルに対する敵対的攻撃で、単一の摂動が多様なユーザークエリに対して効果を維持する「クロスクエリ応答操作」を実現する手法を提案。内部の注意分布を画像優位なパターンに固定することで、クエリの文言への依存を減らし、転移性を向上させる。
- ProFocus: 視覚と言語によるナビゲーションにおける能動的知覚と焦点化推論VLA2026/3/1
VLNエージェントの非効率な視覚処理と無差別な履歴利用を改善するため、LLMとVLMの協調による訓練不要のフレームワークProFocusを提案。能動的知覚で必要な視覚情報を特定し、BD-MCTSで高価値な経路点に焦点を当てた推論を行う。
- WoW: 身体性インタラクションを通じた世界全知モデルへの挑戦世界モデル2025/9/1
200万件のロボット操作軌道で学習した140億パラメータの生成的世界モデルを構築し、物理的因果推論を評価する新ベンチマークWoWBenchを提案した論文。
- EVA: 未来映像予測のための身体性世界モデル世界モデル2024/10/1
視覚言語モデルと映像生成モデルを組み合わせ、身体性シナリオでの多段階未来予測を可能にする世界モデルEVAとその評価ベンチマークEVA-Benchを提案した。