Xiuwei Xu
Tsinghua University
収録論文 20本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SkillMemo: 専門家ガイドによるスキル記憶フレームワークを用いた構成的手操作操作2026/8/1
長期的なデモンストレーションを潜在的な原子スキルに分解し、動的エピソード記憶バンクに統合することで、構成的一般化を向上させるフレームワークを提案。
- GigaWorld-Policy-0.5: AutoResearchによる高速・高精度なWAMの実現VLA2026/7/1
将来の視覚予測を訓練時のみに用い、推論時は行動生成のみで高速化した行動中心のWorld Action Modelを提案し、AutoResearchで最適設定を探索して性能を向上させた。
- GigaWorld-1: ロボットポリシー評価のためのワールドモデル構築ロードマップワールドモデル2026/7/1
ロボットポリシーの評価を効率化するため、ワールドモデルの信頼性を体系的に研究し、ベンチマークWMBenchを構築して、7つのビデオワールドモデルと4つの行動表現を比較した。
- R2RDreamer: 空間的に汎化する2次元操作ポリシーのための3次元認識データ拡張操作学習2026/6/15
実デモから3D編集と2Dビデオ補完を組み合わせて、物体位置や視点が変わっても動作する操作ポリシーを学習するためのデータ拡張手法を提案した。
- iMaC: 動作と接触画像への変換による具現化ワールドモデルVLA2026/6/8
ロボット操作のための新しい制御パラダイムを提案し、画像をアクション表現として用いることで、従来のベクトルベースのアクションよりも表現力と汎化性を向上させる。
- AwareVLN: 自己認識による視覚言語ナビゲーションの推論VLA2026/5/1
視覚と言語によるナビゲーションにおいて、エージェントの状態とタスクの進捗を理解する自己認識推論機構を導入し、エンドツーエンドで高性能なナビゲーションを実現した。
- ShapeGen: カテゴリレベル操作のためのロボットデータ生成データ生成2026/4/1
形状多様な操作データをシミュレータなしで3D的に生成する手法を提案し、実世界でカテゴリ内の形状一般化性能を向上させることを示した。
- F2F-AP: フローから未来への非同期ポリシーによるリアルタイム動的マニピュレーションマニピュレーション2026/4/1
非同期推論の遅延問題を解決するため、物体のフロー予測を用いて未来の観測を合成し、視覚特徴を整合させることで、動的環境での操作を先読みして実行するフレームワークを提案した。
- CMP: 能力多様体投影による移動操作の堅牢な全身追従移動操作2026/4/1
脚式移動マニピュレータの全身制御において、センサノイズや非現実的なユーザーコマンドによる分布外入力への堅牢性を高めるため、能力多様体投影(CMP)を提案した。
- R2RGEN: 空間的に汎化されたマニピュレーションのための実世界間3Dデータ生成マニピュレーション2025/10/1
点群の観測と行動のペアを直接拡張し、シミュレータやレンダリングを使わずに実世界データを生成するフレームワークを提案。空間的に多様なデータを効率的に生成し、模倣学習による汎化性能を高める。
- MoTo: 汎用モバイルマニピュレーションのためのゼロショット・プラグイン型インタラクション認識ナビゲーションモバイルマニピュレーション2025/9/1
固定ベースのマニピュレーション基盤モデルにプラグインするだけで、VLMと軌道最適化によりゼロショットで移動マニピュレーションを実現する手法を提案。
- GC-VLN: グラフ制約としての指示による学習不要の視覚言語ナビゲーションVLA2025/9/1
人間の指示を空間制約の有向非巡回グラフに分解し、制約ソルバで経路を解くことで、学習なしに連続環境でロボットをナビゲートするフレームワークを提案した。
- IGL-Nav: 画像ゴールナビゲーションのためのインクリメンタル3Dガウシアンローカリゼーションナビゲーション2025/8/1
3Dガウシアンスプラッティングを用いて、探索中に逐次更新されるシーン表現からゴール画像の位置を粗く特定し、近づくと微分可能レンダリングで精密化する画像ゴールナビゲーション手法を提案。
- UniGoal: 汎用的なゼロショット目標指向ナビゲーションに向けてナビゲーション2025/3/1
異なる種類の目標を統一的なグラフ表現で扱い、LLMによるグラフ推論でゼロショット目標指向ナビゲーションを実現するフレームワークを提案。
- MoManipVLA:視覚言語行動モデルを汎用モバイルマニピュレーションへ転移VLA2025/3/1
固定ベース操作用に事前学習されたVLAモデルを活用し、二段階最適化で台車移動とアーム軌道を計画することで、モバイルマニピュレーションをゼロショットで汎化させるフレームワークを提案。
- SG-Nav: 3Dシーングラフを用いたLLMベースのゼロショット物体ナビゲーションナビゲーション2024/10/1
観測した環境を3Dシーングラフで表現し、LLMに階層的な思考プロンプトを与えることで、ゼロショット物体ナビゲーションを高精度かつ説明可能に実現した研究。
- EmbodiedSAM: 実時間で任意の3D物体をオンラインセグメンテーション3D知覚2024/8/1
SAMを活用し、RGB-Dストリームからオンラインでリアルタイムに3Dインスタンスセグメンテーションを行う手法を提案。
- 未知環境における身体性指示追従VLA2024/6/1
マルチモーダル大規模言語モデルを用いた階層的フレームワークにより、未知環境を探索しながら複雑な人間の指示を実行する身体性エージェントを実現した。
- Anyview: Generalizable Indoor 3D Object Detection with Variable Frames2023/10/1
- Embodied Task Planning with Large Language Models2023/7/1