Mohit Shridhar
収録論文 16本 ・ フィジカルAI/ロボット学習
VLA/強化学習VLA/階層制御VLAマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EXIMO: VLMによるVLAポリシー探索のガイドVLA/強化学習2026/8/20
VLAポリシーの効率的なファインチューニング手法EXIMOを提案。VLMをプランナーとして使い、長期的なタスクを分解してデータ収集し、模倣学習とオフポリシーRLで最適化する。
- ロボットポリシー編成における重要要素:階層型VLAエージェントの体系的研究VLA/階層制御2026/6/9
階層型VLAシステムの設計原則を体系的に研究し、プランナーとコントローラの選択や接続方法などが性能に与える影響を分析。導出した原則に基づくシステムが、フラットなVLAや素朴な階層構造より優れることをシミュレーションと実機で示した。
- Gemini Robotics 1.5:高度な身体性推論・思考・動作転移で汎用ロボットの最前線を押し広げるVLA2025/10/1
異種ロボットデータから学ぶ動作転移機構と自然言語での多段階推論を組み合わせたVLAモデルと、身体性推論に特化したモデルを発表し、複雑な多段階タスクの実行と解釈性を向上させた。
- ExoStart: センサ付き外骨格による巧みな操作の効率的学習マニピュレーション2025/6/1
低コストのウェアラブル外骨格で人間の手の動きを収集し、シミュレーションで動力学フィルタリングして強化学習の初期化に用いることで、ロボットハンドの巧みな操作を実機にゼロショット転移させる学習フレームワークを提案。
- PerAct2: 両腕ロボットマニピュレーションのベンチマークと学習マニピュレーション2024/7/1
RLBenchを両腕タスクに拡張し、13タスク・23バリエーションのベンチマークを構築するとともに、言語条件付き行動クローニングエージェントPerAct2を提案した。
- 画像生成モデルを行動モデルとして活用するGENIMAマニピュレーション2024/7/1
Stable Diffusionを微調整し、RGB画像上に目標関節動作を描画させる行動クローニングエージェントを提案。RLBenchと実世界の操作タスクで、シーン変化への頑健性や新規物体への汎化性能が向上することを示した。
- Bridging Language and Action: A Survey of Language-Conditioned Robot Manipulation2023/12/1
- GenSim: Generating Robotic Simulation Tasks via Large Language Models2023/10/1
- AR2-D2:Training a Robot Without a Robot2023/6/1
- Perceiver-Actor: A Multi-Task Transformer for Robotic Manipulation2022/9/1
- CLIPort: What and Where Pathways for Robotic Manipulation2021/9/1
- Language Grounding with 3D Objects2021/7/1
- ALFWorld: Aligning Text and Embodied Environments for Interactive Learning2020/10/1
- ALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday Tasks2019/12/1
- Interactive Visual Grounding of Referring Expressions for Human-Robot Interaction2018/6/1
- Grounding Spatio-Semantic Referring Expressions for Human-Robot Interaction2017/7/1