Jonathan Tompson
収録論文 26本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Gemini Robotics 1.5:高度な身体性推論・思考・動作転移で汎用ロボットの最前線を押し広げるVLA2025/10/1
異種ロボットデータから学ぶ動作転移機構と自然言語での多段階推論を組み合わせたVLAモデルと、身体性推論に特化したモデルを発表し、複雑な多段階タスクの実行と解釈性を向上させた。
- 自己改善する身体性基盤モデルVLA2025/9/1
ロボット基盤モデルの事後学習を2段階(行動クローン+残りステップ予測のSFT、その後自己改善)で行い、人手を最小限に自律的なスキル獲得と高い成功率を実現した研究。
- Gemini Robotics:AIを物理世界へVLA2025/3/1
Gemini 2.0を基盤に、ロボットを直接制御できる汎用VLAモデル「Gemini Robotics」と、空間・時間理解を強化した推論モデル「Gemini Robotics-ER」を提案した論文。
- RoPEを超えて:STRINGによる2D・3D位置エンコーディングの改善VLA2025/2/1
大規模言語モデルで広く使われるRotary Position Encodingsを統一的な理論枠組みで拡張し、任意次元のトークン座標に対して厳密な並進不変性を保ちつつ低計算コストで2D・3D位置エンコーディングを実現するSTRINGを提案。Vision Transformerに統合し、オープンボキャブラリ物体検出やロボティクス制御で性能向上を示した。
- 相互情報量推定によるロボットデモデータの品質選別模倣学習2025/2/1
ロボットの模倣学習データについて、状態と行動の相互情報量への各軌道の寄与をVAE埋め込みとk近傍推定で評価し、デモの品質を選別する手法を提案した。
- 視覚言語モデルは文脈内価値学習器であるVLA2024/11/1
視覚言語モデルにシャッフルした動画フレームの時系列順序を予測させることで、ロボットやタスク固有の訓練なしに300以上の実世界タスクの進捗を推定できる汎用価値関数を実現した。
- ALOHA Unleashed:ロボット巧みさのためのシンプルなレシピマニピュレーション2024/10/1
ALOHA 2プラットフォームでの大規模データ収集とDiffusion Policyを組み合わせることで、変形物体や複雑な接触を伴う両手巧み操作タスクを模倣学習で高精度に実現できることを示した研究。
- ALOHA 2:両腕テレオペレーション向けの改良型低コストハードウェアテレオペレーション2024/5/1
両腕マニピュレーション研究を加速するため、低コストで堅牢なテレオペレーション用ハードウェアALOHA 2を開発し、設計とMuJoCoモデルをオープンソース化した。
- RT-H: 言語による行動階層VLA2024/3/1
低レベル動作を「腕を前に動かす」のような言語フレーズで表現し、タスクと行動の間に言語動作を介在させることで、多様なタスク間でデータを共有し、人間の言語介入による修正も可能にする模倣学習手法を提案。
- 言語モデル予測制御による人間フィードバックからの高速学習VLA2024/2/1
人間との対話履歴を遷移モデルとしてLLMに微調整し、モデル予測制御と組み合わせることで、ロボットの教示効率と成功率を向上させるフレームワークLMPCを提案。
- Geometry Matching for Multi-Embodiment Grasping2023/12/1
- Video Language Planning2023/10/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- PaLM-E: An Embodied Multimodal Language Model2023/3/1
- Scaling Robot Learning with Semantically Imagined Experience2023/2/1
- Robotic Skill Acquisition via Instruction Augmentation with Vision-Language Models2022/11/1
- Interactive Language: Talking to Robots in Real Time2022/10/1
- Inner Monologue: Embodied Reasoning through Planning with Language Models2022/7/1
- Visuomotor Control in Multi-Object Scenes Using Object-Aware Representations2022/5/1
- Implicit Behavioral Cloning2021/9/1
- XIRL: Cross-embodiment Inverse Reinforcement Learning2021/6/1
- Learning to Rearrange Deformable Cables, Fabrics, and Bags with Goal-Conditioned Transporter Networks2020/12/1
- Transporter Networks: Rearranging the Visual World for Robotic Manipulation2020/10/1
- Learning Latent Plans from Play2019/3/1
- Learning Actionable Representations from Visual Observations2018/8/1
- Learning Robotic Manipulation of Granular Media2017/9/1