Ted Xiao
収録論文 39本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VeoワールドシミュレータによるGeminiロボティクスポリシーの評価sim2real2025/12/1
最先端の動画生成モデルVeoを基盤とした生成評価システムを構築し、ロボットポリシーの通常性能から分布外汎化、物理・意味的安全性までをシミュレーションで評価できることを示した。
- Gemini Robotics 1.5:高度な身体性推論・思考・動作転移で汎用ロボットの最前線を押し広げるVLA2025/10/1
異種ロボットデータから学ぶ動作転移機構と自然言語での多段階推論を組み合わせたVLAモデルと、身体性推論に特化したモデルを発表し、複雑な多段階タスクの実行と解釈性を向上させた。
- Robo-DM: 大規模ロボットデータセットのためのデータ管理データ管理2025/5/1
ロボット軌道データをEBML形式で効率的に圧縮・管理し、学習時の読み込みを高速化するオープンソースのクラウド型データ管理ツールキットを提案。
- Gemini Robotics:AIを物理世界へVLA2025/3/1
Gemini 2.0を基盤に、ロボットを直接制御できる汎用VLAモデル「Gemini Robotics」と、空間・時間理解を強化した推論モデル「Gemini Robotics-ER」を提案した論文。
- STEER: 密な言語グラウンディングによる柔軟なロボットマニピュレーションマニピュレーション2024/11/1
自然言語で表現された基本的な操作スキルを密なアノテーションで学習し、それらを組み合わせて未見の状況や新規タスクに適応できるロボット学習フレームワークSTEERを提案。
- 視覚言語モデルは文脈内価値学習器であるVLA2024/11/1
視覚言語モデルにシャッフルした動画フレームの時系列順序を予測させることで、ロボットやタスク固有の訓練なしに300以上の実世界タスクの進捗を推定できる汎用価値関数を実現した。
- RT-Affordance: ロボットマニピュレーションのための汎用中間表現としてのアフォーダンスマニピュレーション2024/11/1
タスクの要所でのロボット姿勢を表すアフォーダンスを中間表現として用い、言語指示からアフォーダンス計画を生成して操作方策を条件付ける階層モデルを提案し、新規タスクで既存手法を50%以上上回る性能を示した。
- Gen2Act: 人間動画生成を活用した汎用ロボットマニピュレーションマニピュレーション2024/9/1
ウェブデータで学習した人間動画生成モデルを使い、生成された動画を条件にロボット方策を学習することで、未見物体や新規動作への汎化を実現した。
- OpenVLA: オープンソースの視覚-言語-行動モデルVLA2024/6/1
97万件の実機ロボット実演で学習した7BパラメータのオープンソースVLAモデルを提案し、閉源モデルRT-2-Xを上回る汎用マニピュレーション性能と効率的なファインチューニングを実現した。
- Octo: オープンソースの汎用ロボットポリシーVLA2024/5/1
80万件の軌道データで学習したTransformerベースの汎用ロボットマニピュレーションポリシーを提案し、言語や目標画像で指示でき、新しいセンサーや行動空間にも短時間でファインチューニング可能であることを示した。
- 実世界ロボットマニピュレーションポリシーのシミュレーション評価sim2real2024/5/1
実環境とシミュレーションの制御・視覚ギャップを緩和し、実機セットアップに対応した評価環境SIMPLERを構築。実機とシミュレーションの性能が強く相関することを示した。
- RT-Sketch: 手描きスケッチによる目標条件付き模倣学習模倣学習2024/3/1
手描きスケッチを目標指定に用いる操作ポリシーを提案し、言語や画像条件よりも曖昧さや視覚的妨害に頑健であることを示した。
- 合成的一般化を活用したロボットマニピュレーションの効率的データ収集マニピュレーション2024/3/1
視覚模倣学習ポリシーが環境要因を合成できることを実証し、その合成能力を活かした効率的なデータ収集戦略を提案。実機で77.5%の成功率を達成。
- DROID: 大規模実環境ロボットマニピュレーションデータセットマニピュレーション2024/3/1
北米・アジア・欧州の50名が12ヶ月かけて564シーン・84タスクで収集した76k軌道・350時間のロボット操作データセットを構築し、学習ポリシーの性能と汎化性能が向上することを示した。
- RT-H: 言語による行動階層VLA2024/3/1
低レベル動作を「腕を前に動かす」のような言語フレーズで表現し、タスクと行動の間に言語動作を介在させることで、多様なタスク間でデータを共有し、人間の言語介入による修正も可能にする模倣学習手法を提案。
- PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs2024/2/1
- Learning to Learn Faster from Human Feedback with Language Model Predictive Control2024/2/1
- AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents2024/1/1
- Bridging Language and Action: A Survey of Language-Conditioned Robot Manipulation2023/12/1
- RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches2023/11/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Physically Grounded Vision-Language Models for Robotic Manipulation2023/9/1
- Decomposing the Generalization Gap in Imitation Learning for Visual Robotic Manipulation2023/7/1
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control2023/7/1
- Language to Rewards for Robotic Skill Synthesis2023/6/1
- Deep RL at Scale: Sorting Waste in Office Buildings with a Fleet of Mobile Manipulators2023/5/1
- Open-World Object Manipulation using Pre-trained Vision-Language Models2023/3/1
- Scaling Robot Learning with Semantically Imagined Experience2023/2/1
- RT-1: Robotics Transformer for Real-World Control at Scale2022/12/1
- Robotic Skill Acquisition via Instruction Augmentation with Vision-Language Models2022/11/1
- Token Turing Machines2022/11/1
- PI-QT-Opt: Predictive Information Improves Multi-Task Robotic Reinforcement Learning at Scale2022/10/1
- Inner Monologue: Embodied Reasoning through Planning with Language Models2022/7/1
- Do As I Can, Not As I Say: Grounding Language in Robotic Affordances2022/4/1
- Value Function Spaces: Skill-Centric State Abstractions for Long-Horizon Reasoning2021/11/1
- AW-Opt: Learning Robotic Skills with Imitation and Reinforcement at Scale2021/11/1
- Actionable Models: Unsupervised Offline Reinforcement Learning of Robotic Skills2021/4/1
- Thinking While Moving: Deep Reinforcement Learning with Concurrent Control2020/4/1
- Learning Latent Plans from Play2019/3/1