Rongtao Xu
収録論文 20本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ロボット操作のための一段フローマッチング用可逆ニューラルネットワークアダプタマニピュレーション2026/6/1
視覚・言語・固有受容などのマルチモーダル観測から高次元の操作行動を一段のノイズ除去で生成する可逆ニューラルネットワークアダプタを提案し、推論コストを削減しつつ精度を維持する。
- SurveilNav: ロボットと監視システムの協調による物体目標ナビゲーションナビゲーション2026/6/1
監視カメラとロボットを協調させ、大規模環境での物体探索ナビゲーションを効率化するフレームワークを提案した論文。
- VGP-Nav:ロボットナビゲーションのためのメトリック対応視覚幾何知覚ナビゲーション2026/6/1
単眼RGBカメラのみを用いて、メートル単位の正確な自己位置推定と障害物知覚を同時に実現する統合フレームワークを提案した。
- DexJoCo: MuJoCo上でのタスク指向巧みな操作のためのベンチマークとツールキット巧みな操作2026/5/1
巧みなロボットハンドの操作能力を評価するための、11の機能ベースのタスクとデータ収集システムを含むベンチマークとツールキットを提案し、現代のモデルの性能を分析した。
- RePO-VLA: 回復駆動型ポリシー最適化による視覚言語行動モデルVLA2026/5/1
成功軌跡のみの模倣学習では実行時のずれに対処できないため、失敗軌跡を活用して回復行動を学習するフレームワークを提案。成功・回復・失敗の軌跡に役割を割り当て、価値関数で進捗を評価し、ポリシーを改善する。
- AnySlot: ゼロショットのスロット配置のための目標条件付き視覚言語行動ポリシーVLA/マニピュレーション2026/4/1
言語指示による精密な物体配置を実現するため、言語を視覚的な目標マーカーに変換し、目標条件付きVLAポリシーで実行する階層的フレームワークを提案。また、スロット配置の評価用ベンチマークSlotBenchも導入。
- A1: 完全透過型オープンソースの適応的かつ効率的なトランケート型視覚言語行動モデルVLA2026/4/1
低コストで高スループットな推論を実現するため、事前学習済みVLMと適応的早期終了・層間トランケートフローマッチングを導入したVLAモデルA1を提案し、シミュレーションと実機でSOTA性能と推論コスト削減を達成した。
- ManipArena:推論指向の汎用ロボットマニピュレーションの実世界包括評価マニピュレーション2026/3/1
実機ロボットでのマニピュレーション汎化を公平に評価するため、20タスク・1万超の専門家軌道・約188時間分のデータを備えた標準化ベンチマークを構築し、VLAやワールドアクションモデルなど7構成を比較した。
- HMR-1: 視覚言語モデルを用いた階層型マッサージロボットによる身体性ヘルスケアVLA2026/3/1
マッサージ用のマルチモーダルデータセットMedMassage-12Kを構築し、視覚言語モデルでツボを認識する高レベルモジュールと軌道計画を行う低レベル制御モジュールからなる階層型マッサージロボットを提案した論文。
- GLaD: 視覚言語行動モデルのための幾何潜在蒸留VLA2025/12/1
3D幾何情報を知識蒸留でVLAモデルに組み込み、深度センサーや3D注釈なしで空間推論と操作性能を向上させた手法。
- ActiveVLN: マルチターン強化学習による能動的探索を実現する視覚言語ナビゲーションVLA2025/9/1
視覚言語ナビゲーションにおいて、少数の模倣学習で初期化した後、マルチターン強化学習とGRPOで能動的に探索し、効率的に性能を向上させるフレームワークを提案。
- P³: 汎用性の高い身体性エージェントに向けてVLA2025/8/1
リアルタイム知覚と動的スケジューリングを統合し、ツールのフィードバックに依存せず多タスクを計画・実行する身体性エージェントの枠組みを提案し、能動的知覚のベンチマークATPを構築した。
- PhyBlock: 3Dブロック組み立てによる物理理解と計画の段階的ベンチマークベンチマーク/VLA2025/6/1
視覚言語モデルの物理理解と計画能力を評価するため、4段階の認知階層を持つ3Dブロック組み立てタスクとVQAを組み合わせたベンチマークを提案し、21モデルを評価した。
- RoBridge:汎用ロボット操作のための認知と実行を橋渡しする階層型アーキテクチャマニピュレーション2025/5/1
大規模視覚言語モデルによる高レベル認知プランナと強化学習による汎用身体エージェントを、不変操作表現を介して階層的に統合し、認知と実行のギャップを埋めるロボット操作手法を提案。
- マルチモーダル融合と視覚言語モデル:ロボットビジョンのサーベイVLA2025/4/1
ロボットビジョンにおけるマルチモーダル融合手法と視覚言語モデルの応用をタスク指向で体系的にレビューし、課題と将来方向を整理したサーベイ。
- A0: 汎用ロボットマニピュレーションのためのアフォーダンス認識階層モデルマニピュレーション2025/4/1
物体との接触点と接触後軌道を予測するアフォーダンス表現を用い、高レベルな空間理解と低レベル行動実行を階層的に分けた拡散モデルを提案。複数ロボットで汎用性と実世界性能を示した。
- 連続環境における制約認識型ゼロショット視覚言語ナビゲーションVLA2024/12/1
ゼロショットVLN-CEを制約認識型のサブ命令完了プロセスとして再構成し、CSMとCVMの2モジュールでナビゲーション計画を逐次生成するCA-Navを提案、ベンチマークで最高性能を達成した。
- InfiniteWorld: 汎用視覚言語ロボットインタラクションのための統合スケーラブルシミュレーションフレームワークsim2real2024/12/1
Nvidia Isaac Sim上に構築された、汎用視覚言語ロボットインタラクション向けの統合スケーラブルなシミュレータを提案し、3Dアセット構築やReal2Sim、自動注釈などの機能と4つの新しいベンチマークを提供する。
- InstruGen: 大規模マルチモーダルモデルによる視覚言語ナビゲーション向け指示文の自動生成VLA2024/11/1
YouTubeの住宅ツアー動画を実環境に近いナビゲーション場面として使い、大規模マルチモーダルモデルで多様で高品質な経路と指示文のペアを自動生成する手法を提案し、未見環境での性能を向上させた。
- NaVid: ビデオベースVLMが視覚言語ナビゲーションの次の一歩を計画するVLA2024/2/1
単眼RGBカメラの動画ストリームのみから次の行動を出力するビデオベース大規模視覚言語モデルNaVidを提案し、地図・オドメトリ・深度なしでシミュレーションと実世界の両方で最先端のナビゲーション性能を達成した。