Zuxuan Wu
Fudan University
収録論文 32本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Ego4WAM:ロボット学習のための自己中心的人間データのスケーリングで重要な要素は何か?VLA2026/9/30
自己中心的人間データをロボット学習に活用する際、人間とロボットのアライメント、タスク多様性、行動監督、利用戦略が下流性能に与える影響を体系的に分析し、データ設計の指針を示した。
- LIBERO-Agent:汎用エージェントによる実機マニピュレーションの評価ベンチマークマニピュレーション2026/9/30
汎用AIエージェントがロボット操作タスクを直接実行できるかを評価する200タスクの対話型ベンチマークLIBERO-Agentを提案し、知覚は得意だが長期的・難しい操作では信頼性が大きく低下することを示した。
- 探索・実行・進化:身体性エージェントのためのスキル獲得と再利用ループVLA2026/9/29
視覚と言語に触覚を組み合わせ、スキルライブラリを進化的に更新しながら再利用する枠組みRoboSkillを提案し、ロボットタスクの成功率向上と実行時間短縮を実現した。
- Bench2Dex: 多様な器用ハンドにおける視触覚両手マニピュレーションのベンチマークマニピュレーション2026/9/14
12種類の器用ハンドに対応した共通の触覚インターフェースを備えるシミュレーションベンチマークを構築し、26の両手操作タスクと約1.3Kのテレオペデモを提供して視触覚マニピュレーションを評価可能にした。
- 大規模離散方策:確率的反復スコアリングによる明示的行動モデリングの進展行動生成2026/9/7
行動方策を離散的な候補選択としてモデル化し、確率的な反復スコアリングで表現力を高める新しいフレームワークを提案。自動運転やロボット操作で連続生成モデルに匹敵する性能を示した。
- HandEdit: 身体性を考慮した人間からロボットへの器用な手の画像編集のための統一ベンチマーク画像編集/ロボティクス2026/8/1
人間の手の画像を様々なロボットハンドに変換する大規模な画像編集データセットとベンチマークを構築し、既存の編集モデルの評価と身体性を考慮した編集モデルの発展を目指した。
- SegDiff: セグメント化軌道拡散による一貫性と適応性を備えたロボット操作マニピュレーション2026/7/1
模倣学習において、連続予測とキーポーズ予測の利点を統合し、キーポーズ間の軌道を拡散モデルで予測する閉ループ視覚運動ポリシーを提案。動的環境への適応性と制御安定性を向上させた。
- EgoRecovery: 人間の回復デモンストレーションから失敗回復能力を獲得するロボット学習2026/7/1
ロボットの失敗回復行動を学習するために、人間の自己中心視点の回復デモを活用し、ロボットデータと共有する意図空間を介して少数のロボットデモで実行可能な行動に結びつける共学習フレームワークを提案した。
- RepWAM: 表現型ビジュアル・アクショントークナイザによるワールドアクションモデリングVLA2026/6/11
再構成ではなく意味的な視覚・行動の潜在空間を用いたワールドアクションモデルを提案し、実ロボット操作とシミュレーションで有効性を示した。
- ActiveMimic: 能動的知覚を備えた自己中心視点ビデオ事前学習VLA2026/6/4
自己中心視点の人間ビデオから能動的知覚(カメラ動作)を活用してロボット操作を事前学習するフレームワークを提案し、ロボットデータ事前学習と同等の性能を実現した。
- EvoMemNav: ゼロショット具現化ナビゲーションのための自己進化型高精細メモリナビゲーション2026/6/2
観測を細粒度で保持する視覚意味メモリグラフを構築し、予算制約付き粗密探索とサブタスク後のリフレクションによるメモリ更新で、ゼロショットの具現化ナビゲーション性能を向上させた。
- ThinkingVLA: ロボット操作のための視覚と言語の推論を交互に行う手法VLA2026/6/1
ロボット操作タスクにおいて、視覚と言語の推論を交互に行う統一アーキテクチャを提案し、長期的な操作タスクでの性能を向上させた。
- 動きから触覚を見る:触覚運動相関を用いた統一モダリティ認識視触覚ポリシーマニピュレーション2026/6/1
接触を伴う操作において、触覚センサの画像から過渡的運動と累積運動の相関を利用して細かい接触状態を識別する新しい触覚表現を提案し、視覚と触覚の効果的な融合を実現するポリシーを開発した。
- Bench2Drive-Robust:展開時の摂動下でのクローズドループ自動運転のベンチマーク自動運転2026/5/1
実環境展開で生じるシステムレベルの摂動(カメラストリーム障害、自己位置推定誤差、計算遅延)がクローズドループのエンドツーエンド自動運転性能に与える影響を評価する、初のデバイス中心のロバストネスベンチマークを提案した。
- GuidedVLA: プラグアンドプレイの行動注意特化によるタスク関連因子の指定VLA2026/5/1
VLAモデルの行動デコーダを機能部品として捉え、個々の注意ヘッドに明示的な補助信号でタスク関連因子(物体接地、空間幾何、時間的スキル論理)を学習させるフレームワークを提案し、シミュレーションと実機で汎化性能を向上させた。
- VLA-Pro: 視覚言語行動モデルのためのクロスタスク手続き記憶転送VLA/汎化2026/5/1
タスク固有のLoRAアダプタを手続き記憶として保存し、推論時に現在のマルチモーダル文脈に基づいて関連記憶を検索・融合することで、未見タスクへの汎化を向上させるプラグアンドプレイフレームワークを提案した。
- 身体性AIにおける安全性:リスク、攻撃、防御のサーベイ安全性2026/5/1
身体性AIの安全性に関する研究を、知覚から計画、行動、相互作用までのパイプライン全体にわたって体系的にレビューし、攻撃と防御の多層的な分類法を提案した論文。
- HAD: 階層拡散とメトリック分離型強化学習を組み合わせたエンドツーエンド運転自動運転2026/4/1
自動運転のエンドツーエンド計画において、粗密の階層拡散ポリシーと複数運転目標を分離して最適化する強化学習手法を提案し、NAVSIMとHUGSIMで大幅な性能向上を達成した。
- HazardArena: 視覚言語行動モデルにおける意味的安全性の評価VLA/安全性評価2026/4/1
視覚言語行動モデル(VLA)の安全性を評価するベンチマークを構築し、安全/危険の双子シナリオで意味的文脈による不安全行動を検出。訓練不要のSafety Option Layerで不安全行動を低減する手法も提案。
- FRoM-W1: 言語指示による汎用人型全身制御フレームワークVLA2026/1/1
自然言語から人型ロボットの全身動作を生成・実行する2段階フレームワークを提案し、Unitree H1/G1で動作追従精度の向上を実証した。
- HiMoE-VLA:汎用視覚言語行動ポリシーのための階層的Mixture-of-ExpertsVLA2025/12/1
異なるロボットの実演データを混ぜて学習する際の負の転移を防ぐため、行動空間ごとに特化する階層的MoE行動モジュールを提案し、CALVINやLIBERO、実機タスクで高い性能を達成した。
- カメラ座標系でロボット動作を統一するクロスエンボディメント学習2025/11/1
カメラ外部パラメータを用いて異なるロボットの動作をカメラ座標系で統一し、訓練不要でカメラ外部パラメータを推定するCalibAllを提案。16データセットで約97Kエピソードを校正し、クロスエンボディメント事前学習で最先端性能を達成。
- RoboOmni: 全モーダル文脈における能動的ロボットマニピュレーションVLA2025/10/1
音声対話・環境音・視覚情報からユーザ意図を能動的に推論し、確認と動作実行までを統合した全モーダルLLMフレームワークRoboOmniを提案し、大規模データセットOmniActionで訓練して実機・シミュレーションで有効性を示した。
- 人間のデモンストレーション不要の軌道スコアラーによるエンドツーエンド自動運転自動運転/強化学習2025/10/1
人間のデモンストレーションを一切使わず、実世界画像とルールベース報酬のみで学習する強化学習ベースのエンドツーエンド自動運転計画手法ZTRSを提案し、長尾シナリオで模倣学習を上回る性能を示した。
- Ask-to-Clarify: マルチターン対話による指示の曖昧性解消VLA2025/9/1
VLAモデルに対話による曖昧性解消と視覚運動制御を統合したフレームワークを提案し、実世界11タスクで有効性を示した。
- 汎化軌道スコアリングによるエンドツーエンドマルチモーダル計画自動運転計画2025/6/1
自動運転のマルチモーダル計画において、粗い軌道評価と細かい軌道評価を統合したGTRSを提案し、拡散モデルによる軌道生成と語彙汎化技術で高い汎化性能を実現した。
- DriveSuprim: エンドツーエンド計画のための精密な軌道選択に向けて自動運転計画2025/6/1
自動運転の軌道選択を粗から細への段階的フィルタリング、回転ベースの拡張、自己蒸留で改善し、NAVSIMやBench2Driveで最高性能を達成した。
- Hydra-NeXt: 開ループ学習による堅牢な閉ループ自動運転自動運転2025/3/1
軌道予測・制御予測・軌道精緻化を1つのモデルに統合したマルチブランチ計画フレームワークを提案し、開ループ学習と閉ループ運転のギャップを埋めてBench2Driveで大幅な性能向上を達成した。
- Human2Robot: 人間とロボットのペア動画からロボット動作を学習模倣学習2025/2/1
人間とロボットの同期動画ペアを条件付き動画生成問題として扱い、人間の動画からロボットの動画を生成して動作を学習する枠組みを提案。新規データセットH&Rも構築し、未知のタスクへのワンショット汎化を実現した。
- VLABench: 長期的推論を伴う言語条件付きロボット操作のための大規模ベンチマークVLA2024/12/1
視覚言語行動モデル(VLA)向けに、世界知識や意図理解、多段階推論を要する100カテゴリ・2000以上の物体からなる言語条件付き操作タスクのベンチマークを構築した。
- The Regretful Agent: Heuristic-Aided Navigation through Progress Estimation2019/3/1
- Self-Monitoring Navigation Agent via Auxiliary Progress Estimation2019/1/1