Ran Xu
収録論文 7本 ・ フィジカルAI/ロボット学習
マニピュレーションVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GeoProp: ロボット状態を視覚に接地する汎用操作のための手法マニピュレーション2026/7/1
ロボットの状態と視覚特徴を幾何学的に整合させる軽量アダプタを提案し、操作ポリシーの性能を向上させた。
- 固定カメラから自由カメラへ:キャリブレーション不要の視点ロバストな視覚言語行動モデルVLA2026/7/1
カメラの位置が変わっても、その位置情報を明示的に与えずにロボットが自分で視点を推定して操作できる新しいVLAモデルを提案した。カメラ中心の動作予測と手と目の関係行列の予測を組み合わせ、単眼RGB画像だけで多様な視点で成功率を向上させる。
- 動作画像拡散との共同学習によるロボットVLAの性能向上VLA2025/12/1
VLAモデルに将来の動きを予測する動作ヘッドを追加し、動作ヘッドと共同学習することで、推論速度を保ちながら動作推論能力と実環境性能を大幅に向上させた。
- GP3: マルチビュー画像を用いた3D幾何認識ロボットマニピュレーションポリシーマニピュレーション2025/9/1
マルチビューRGB画像から深度とカメラパラメータを推定し、3Dシーン表現を構築して言語指示に基づく操作を実現するポリシーGP3を提案。シミュレーションで高性能を示し、実機にも少ない微調整で転移可能。
- 汎化可能な両腕マニピュレーションのベンチマーク:CVPR 2025 MEISワークショップにおけるRoboTwin両腕協調チャレンジマニピュレーション2025/6/1
RoboTwinシミュレーションと実機ロボットを用いた両腕マニピュレーションの国際コンペを開催し、17タスクで64チームが競い、汎化可能な協調方策の知見をまとめた。
- NaturalVLM: 細粒度自然言語を用いたアフォーダンス誘導型視覚マニピュレーションマニピュレーション2024/3/1
家庭用ロボット向けに、細かい自然言語指示を段階的に解釈して物体操作を行う学習フレームワークと、15タスク・4500エピソード超のベンチマークNrVLMを提案した論文。
- MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language Navigation2024/1/1