Mohit Sharma
収録論文 17本 ・ フィジカルAI/ロボット学習
VLA運動計画sim2real
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Gemini Robotics 1.5:高度な身体性推論・思考・動作転移で汎用ロボットの最前線を押し広げるVLA2025/10/1
異種ロボットデータから学ぶ動作転移機構と自然言語での多段階推論を組み合わせたVLAモデルと、身体性推論に特化したモデルを発表し、複雑な多段階タスクの実行と解釈性を向上させた。
- ニューラル運動計画のためのカスケード拡散モデル運動計画2025/5/1
拡散ポリシーを用いて複雑な環境での衝突のない大域的な運動計画を学習するカスケード階層モデルを提案し、ナビゲーションやマニピュレーションで既存手法を約5%上回る性能を示した。
- Gemini Robotics:AIを物理世界へVLA2025/3/1
Gemini 2.0を基盤に、ロボットを直接制御できる汎用VLAモデル「Gemini Robotics」と、空間・時間理解を強化した推論モデル「Gemini Robotics-ER」を提案した論文。
- RoPEを超えて:STRINGによる2D・3D位置エンコーディングの改善VLA2025/2/1
大規模言語モデルで広く使われるRotary Position Encodingsを統一的な理論枠組みで拡張し、任意次元のトークン座標に対して厳密な並進不変性を保ちつつ低計算コストで2D・3D位置エンコーディングを実現するSTRINGを提案。Vision Transformerに統合し、オープンボキャブラリ物体検出やロボティクス制御で性能向上を示した。
- 予測的レッドチーミング:ロボットを壊さずにポリシーを破るsim2real2025/2/1
生成画像編集とポリシー固有の異常検知器を用いて、視覚運動ポリシーの環境要因に対する脆弱性をハードウェア評価なしで予測するRoboARTを提案し、予測精度と的を絞ったデータ収集による性能向上を実証した。
- 意味的に制御可能な拡張による汎化可能なロボット学習sim2real2024/9/1
画像テキスト生成モデルをデータ拡張に活用し、ロボット操作データを多様化することで、未見の実環境への汎化を可能にする学習フレームワークを提案した。
- MResT: Multi-Resolution Sensing for Real-Time Control with Vision-Language Models2024/1/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- RoboAgent: Generalization and Efficiency in Robot Manipulation via Semantic Augmentations and Action Chunking2023/9/1
- Lossless Adaptation of Pretrained Vision Models For Robotic Manipulation2023/4/1
- Search-Based Task Planning with Learned Skill Effect Models for Lifelong Robotic Manipulation2021/9/1
- Generalizing Object-Centric Task-Axes Controllers using Keypoints2021/3/1
- Relational Learning for Skill Preconditions2020/12/1
- A Modular Robotic Arm Control Stack for Research: Franka-Interface and FrankaPy2020/11/1
- Learning to Compose Hierarchical Object-Centric Controllers for Robotic Manipulation2020/11/1
- Leveraging Multimodal Haptic Sensory Data for Robust Cutting2019/9/1
- Learning Semantic Embedding Spaces for Slicing Vegetables2019/4/1