Tianli Ding
収録論文 12本 ・ フィジカルAI/ロボット学習
VLAマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Vesta: 汎用身体化推論モデルVLA2026/6/1
ロボットのための単一の基盤モデルで、位置推定・空間推論・ナビゲーション・長期計画を統合し、専門モデル群を上回る性能を示した。
- Gemini Robotics 1.5:高度な身体性推論・思考・動作転移で汎用ロボットの最前線を押し広げるVLA2025/10/1
異種ロボットデータから学ぶ動作転移機構と自然言語での多段階推論を組み合わせたVLAモデルと、身体性推論に特化したモデルを発表し、複雑な多段階タスクの実行と解釈性を向上させた。
- Gemini Robotics:AIを物理世界へVLA2025/3/1
Gemini 2.0を基盤に、ロボットを直接制御できる汎用VLAモデル「Gemini Robotics」と、空間・時間理解を強化した推論モデル「Gemini Robotics-ER」を提案した論文。
- RoPEを超えて:STRINGによる2D・3D位置エンコーディングの改善VLA2025/2/1
大規模言語モデルで広く使われるRotary Position Encodingsを統一的な理論枠組みで拡張し、任意次元のトークン座標に対して厳密な並進不変性を保ちつつ低計算コストで2D・3D位置エンコーディングを実現するSTRINGを提案。Vision Transformerに統合し、オープンボキャブラリ物体検出やロボティクス制御で性能向上を示した。
- RT-Affordance: ロボットマニピュレーションのための汎用中間表現としてのアフォーダンスマニピュレーション2024/11/1
タスクの要所でのロボット姿勢を表すアフォーダンスを中間表現として用い、言語指示からアフォーダンス計画を生成して操作方策を条件付ける階層モデルを提案し、新規タスクで既存手法を50%以上上回る性能を示した。
- RT-H: 言語による行動階層VLA2024/3/1
低レベル動作を「腕を前に動かす」のような言語フレーズで表現し、タスクと行動の間に言語動作を介在させることで、多様なタスク間でデータを共有し、人間の言語介入による修正も可能にする模倣学習手法を提案。
- RoboVQA: Multimodal Long-Horizon Reasoning for Robotics2023/11/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Robotic Table Tennis: A Case Study into a High Speed Learning System2023/9/1
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control2023/7/1
- GoalsEye: Learning High Speed Precision Table Tennis on a Physical Robot2022/10/1
- Interactive Language: Talking to Robots in Real Time2022/10/1