Suraj Nair
収録論文 30本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- π0.7: 操縦可能な汎用ロボット基盤モデルと創発的能力VLA2026/4/1
多様なコンテキスト条件付けを用いて、未見環境での言語指示追従やゼロショットの身体汎化を実現するロボット基盤モデルπ0.7を提案した。
- MEM: 視覚言語行動モデルのためのマルチスケール具現化メモリVLA2026/3/1
ロボットの長期タスク遂行のために、ビデオベースの短期記憶とテキストベースの長期記憶を組み合わせたマルチスケールメモリアーキテクチャを提案し、15分に及ぶ複雑なタスクを可能にした。
- 視覚-言語-行動モデルにおける人間からロボットへの転移の創発VLA2025/12/1
多様なロボットデータで事前学習したVLAモデルに人間の動画を共訓練すると、人間からロボットへのスキル転移が自然に生じることを示し、その要因が身体非依存の表現獲得にあると分析した。
- π*0.6:経験から学ぶVLAVLA2025/11/1
実世界での経験と人間の修正を活用した強化学習手法RECAPにより、洗濯物畳みや箱組み立て、エスプレッソ抽出などのタスクを高成功率で実行できる汎用VLAモデルπ*0.6を開発した。
- π0.5: オープンワールド汎化を実現する視覚-言語-行動モデルVLA2025/4/1
異種タスクの共同学習により、未知の家庭環境でもキッチンや寝室の掃除などの長期的で器用な操作を実行できるVLAモデルπ0.5を提案した。
- FAST: 視覚言語行動モデルのための効率的な行動トークン化VLA2025/1/1
離散コサイン変換に基づく新しい行動トークン化手法FASTを提案し、高頻度で器用なロボットタスクにおける自己回帰型VLAの学習を可能にした。
- GHIL-Glue: フィルタリングされたサブゴール画像による階層制御VLA2024/10/1
生成モデルが作るサブゴール画像をフィルタリングし、下位方策と効果的に繋ぐことで、言語条件付きロボット操作の汎化性能を向上させた研究。
- π0: 汎用ロボット制御のための視覚-言語-行動フローモデルVLA2024/10/1
事前学習済み視覚言語モデルにフローマッチングを組み合わせ、多様なロボットの大規模データで訓練することで、洗濯物畳みや箱組み立てなどの器用なタスクをゼロショットや言語指示で実行できる汎用ロボット基盤モデルを提案した。
- OpenVLA: オープンソースの視覚-言語-行動モデルVLA2024/6/1
97万件の実機ロボット実演で学習した7BパラメータのオープンソースVLAモデルを提案し、閉源モデルRT-2-Xを上回る汎用マニピュレーション性能と効率的なファインチューニングを実現した。
- DROID: 大規模実環境ロボットマニピュレーションデータセットマニピュレーション2024/3/1
北米・アジア・欧州の50名が12ヶ月かけて564シーン・84タスクで収集した76k軌道・350時間のロボット操作データセットを構築し、学習ポリシーの性能と汎化性能が向上することを示した。
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- From Propeller Damage Estimation and Adaptation to Fault Tolerant Control: Enhancing Quadrotor Resilience2023/10/1
- Behavior Retrieval: Few-Shot Imitation Learning by Querying Unlabeled Datasets2023/4/1
- Language-Driven Representation Learning for Robotics2023/2/1
- Play it by Ear: Learning Skills amidst Occlusion through Audio-Visual Imitation Learning2022/5/1
- R3M: A Universal Visual Representation for Robot Manipulation2022/3/1
- MESA: Offline Meta-RL for Safe Adaptation and Fault Tolerance2021/12/1
- Learning Language-Conditioned Robot Behavior from Offline Data and Crowd-Sourced Annotation2021/9/1
- Example-Driven Model-Based Reinforcement Learning for Solving Long-Horizon Visuomotor Tasks2021/9/1
- Learning Generalizable Robotic Reward Functions from "In-The-Wild" Human Videos2021/3/1
- Greedy Hierarchical Variational Autoencoders for Large-Scale Video Prediction2021/3/1
- Model-Based Visual Planning with Self-Supervised Functional Distances2020/12/1
- Recovery RL: Safe Reinforcement Learning with Learned Recovery Zones2020/10/1
- Batch Exploration with Examples for Scalable Robotic Reinforcement Learning2020/10/1
- Goal-Aware Prediction: Learning to Model What Matters2020/7/1
- RoboNet: Large-Scale Multi-Robot Learning2019/10/1
- Hierarchical Foresight: Self-Supervised Learning of Long-Horizon Tasks via Visual Subgoal Generation2019/9/1
- Time Reversal as Self-Supervision2018/10/1
- Neural Task Graphs: Generalizing to Unseen Tasks from a Single Video Demonstration2018/7/1
- Neural Task Programming: Learning to Generalize Across Hierarchical Tasks2017/10/1