Osbert Bastani
収録論文 14本 ・ フィジカルAI/ロボット学習
模倣学習VLAsim2realマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Tether: 対応関係駆動の軌道ワーピングによる自律的機能プレイ模倣学習2026/3/1
少数のデモから意味的キーポイント対応を用いてアクションをワープするオープンループポリシーを提案し、それを用いて実世界で自律的にマルチタスクのプレイデータを収集・改善する手法を紹介する。
- 視覚言語モデルは文脈内価値学習器であるVLA2024/11/1
視覚言語モデルにシャッフルした動画フレームの時系列順序を予測させることで、ロボットやタスク固有の訓練なしに300以上の実世界タスクの進捗を推定できる汎用価値関数を実現した。
- Eurekaverse:大規模言語モデルによる環境カリキュラム生成sim2real2024/11/1
大規模言語モデルを用いて、四足ロボットのパルクール学習のための難易度が漸進的に上がる環境を自動生成する手法を提案し、実世界への転移に成功した。
- DrEureka: 言語モデルが導くSim-to-Real転送sim2real2024/6/1
大規模言語モデルを活用し、報酬関数とドメインランダム化を自動設計することで、四足歩行や器用な操作のシミュレーションから実機への転送を人手を介さず実現した研究。
- DROID: 大規模実環境ロボットマニピュレーションデータセットマニピュレーション2024/3/1
北米・アジア・欧州の50名が12ヶ月かけて564シーン・84タスクで収集した76k軌道・350時間のロボット操作データセットを構築し、学習ポリシーの性能と汎化性能が向上することを示した。
- Universal Visual Decomposer: Long-Horizon Manipulation Made Easy2023/10/1
- Eureka: Human-Level Reward Design via Coding Large Language Models2023/10/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- LIV: Language-Image Representations and Rewards for Robotic Control2023/6/1
- VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training2022/10/1
- Safe Human-Interactive Control via Shielding2021/10/1
- Robust Model Predictive Shielding for Safe Reinforcement Learning with Stochastic Dynamics2019/10/1
- MAMPS: Safe Multi-Agent Reinforcement Learning via Model Predictive Shielding2019/10/1
- Learning Safe Unlabeled Multi-Robot Planning with Motion Constraints2019/7/1