Sean Kirmani
収録論文 20本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VeoワールドシミュレータによるGeminiロボティクスポリシーの評価sim2real2025/12/1
最先端の動画生成モデルVeoを基盤とした生成評価システムを構築し、ロボットポリシーの通常性能から分布外汎化、物理・意味的安全性までをシミュレーションで評価できることを示した。
- Gemini Robotics 1.5:高度な身体性推論・思考・動作転移で汎用ロボットの最前線を押し広げるVLA2025/10/1
異種ロボットデータから学ぶ動作転移機構と自然言語での多段階推論を組み合わせたVLAモデルと、身体性推論に特化したモデルを発表し、複雑な多段階タスクの実行と解釈性を向上させた。
- Gemini Robotics:AIを物理世界へVLA2025/3/1
Gemini 2.0を基盤に、ロボットを直接制御できる汎用VLAモデル「Gemini Robotics」と、空間・時間理解を強化した推論モデル「Gemini Robotics-ER」を提案した論文。
- STEER: 密な言語グラウンディングによる柔軟なロボットマニピュレーションマニピュレーション2024/11/1
自然言語で表現された基本的な操作スキルを密なアノテーションで学習し、それらを組み合わせて未見の状況や新規タスクに適応できるロボット学習フレームワークSTEERを提案。
- 視覚言語モデルは文脈内価値学習器であるVLA2024/11/1
視覚言語モデルにシャッフルした動画フレームの時系列順序を予測させることで、ロボットやタスク固有の訓練なしに300以上の実世界タスクの進捗を推定できる汎用価値関数を実現した。
- RT-Affordance: ロボットマニピュレーションのための汎用中間表現としてのアフォーダンスマニピュレーション2024/11/1
タスクの要所でのロボット姿勢を表すアフォーダンスを中間表現として用い、言語指示からアフォーダンス計画を生成して操作方策を条件付ける階層モデルを提案し、新規タスクで既存手法を50%以上上回る性能を示した。
- Gen2Act: 人間動画生成を活用した汎用ロボットマニピュレーションマニピュレーション2024/9/1
ウェブデータで学習した人間動画生成モデルを使い、生成された動画を条件にロボット方策を学習することで、未見物体や新規動作への汎化を実現した。
- Mobility VLA:長文脈VLMとトポロジカルグラフによるマルチモーダル指示ナビゲーションナビゲーション/VLA2024/7/1
デモ動画と自然言語・画像の指示を入力とし、長文脈VLMで目標フレームを特定、トポロジカルグラフに基づく低レベル方策で実環境をナビゲートする階層型VLAを提案した。
- 実世界ロボットマニピュレーションポリシーのシミュレーション評価sim2real2024/5/1
実環境とシミュレーションの制御・視覚ギャップを緩和し、実機セットアップに対応した評価環境SIMPLERを構築。実機とシミュレーションの性能が強く相関することを示した。
- RT-Sketch: 手描きスケッチによる目標条件付き模倣学習模倣学習2024/3/1
手描きスケッチを目標指定に用いる操作ポリシーを提案し、言語や画像条件よりも曖昧さや視覚的妨害に頑健であることを示した。
- 言語モデル予測制御による人間フィードバックからの高速学習VLA2024/2/1
人間との対話履歴を遷移モデルとしてLLMに微調整し、モデル予測制御と組み合わせることで、ロボットの教示効率と成功率を向上させるフレームワークLMPCを提案。
- PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs2024/2/1
- SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities2024/1/1
- AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents2024/1/1
- RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches2023/11/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Language to Rewards for Robotic Skill Synthesis2023/6/1
- Deep RL at Scale: Sorting Waste in Office Buildings with a Fleet of Mobile Manipulators2023/5/1
- Open-World Object Manipulation using Pre-trained Vision-Language Models2023/3/1
- Practical Imitation Learning in the Real World via Task Consistency Loss2022/2/1