Trevor Darrell
UC Berkeley
収録論文 52本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 世界運動モデル:SE(3)軌道の柔軟な系列モデリングVLA2026/10/1
動的3D世界の要素を剛体SE(3)軌道として表現し、フローマッチングによる系列モデリングで予測・補間・制御・IK・リターゲティング・方策学習を統一的に扱う手法を提案。
- DexTacWAM: 巧みな操作のための視触覚ワールドアクションモデルマニピュレーション2026/9/21
各指先の触覚を個別に符号化し、指・姿勢を考慮した圧縮器で統合して動画拡散ワールドモデルに注入する視触覚ワールドアクションモデルを提案し、接触の多い両手巧み操作タスクで大幅な性能向上を達成した。
- Webエージェントのための判別的世界モデルWebエージェント2026/9/2
Webエージェントの行動選択を改善するため、予測状態マッチングという新しい学習目的を導入し、真の結果状態と代替行動の結果を区別できる世界モデルを訓練した。
- 視覚運動制御のための対比的行動-画像事前学習視覚エンコーダ/事前学習/模倣学習2026/6/15
大規模な人間の第一人称ビデオから手のキーポイントを行動の代理として抽出し、対比学習でロボットの視覚エンコーダを事前学習する手法を提案。実機の器用操作タスクで既存手法を30%以上上回る性能を達成した。
- 遊び心のあるエージェント型ロボット学習スキル獲得2026/6/1
ロボットエージェントが指示なしで自己主導の「遊び」を通じてスキルを獲得し、後続タスクに活用する手法を提案。コード生成エージェントチーム(RATs)が探索タスクを生成・実行・検証・修正し、成功体験をコードスキルライブラリに蓄積する。
- T-Rex: 触覚反応型巧みな操作触覚/操作2026/6/1
触覚信号に動的に反応する操作を実現するため、大規模な触覚データセットと可変レートのMixture-of-Transformersアーキテクチャを導入し、12の操作タスクで成功率を大幅に向上させた。
- 身体化世界モデルの高次化による計画と制御の実現世界モデル/計画/制御2026/4/28
高次元の関節動作空間を直接探索する代わりに、高レベル行動を低レベル関節動作列に変換する軽量ポリシーを訓練し、凍結した世界モデルと組み合わせて高レベル行動から未来観測を予測する「持ち上げられた世界モデル」を提案。人間型エージェントで2Dウェイポイントを高レベル行動とし、低レベル探索より3.8倍精度が向上。
- EgoScale:多様な一人称視点ヒューマンデータによる器用なマニピュレーションのスケーリングマニピュレーション2026/2/1
2万時間超の一人称視点ヒューマン動画でVLAモデルを事前学習し、人間データ量と検証損失の対数線形則を発見。軽量な人間-ロボット中間学習により、22自由度ハンドの器用な操作成功率を54%向上させた。
- 生成された人間動画から物理的に妥当なロボット軌道へヒューマノイド2025/12/1
生成動画から人間の動きを4D表現に変換し、強化学習方策GenMimicでヒューマノイドの物理的に安定した動作として再現する手法を提案。
- 少数デモンストレーションによる視覚-言語-行動モデルのメカニズム的解釈に基づくファインチューニングVLA2025/11/1
少数の実演からタスク固有のアテンションヘッドを特定し選択的にファインチューニングするRobotic Steeringを提案し、LoRAを上回る性能とロバスト性、計算コスト削減、解釈性向上を実機で示した。
- ランダムなおもちゃで遊んで何でも掴めるようになる学習マニピュレーション2025/10/1
球・直方体・円柱・リングの4つの基本形状をランダムに組み合わせた「おもちゃ」で訓練することで、実世界の多様な物体をゼロショットで掴める汎化可能な把持方策を実現した研究。
- 何をする?不可能な指示を拒否するよう視覚-言語-行動モデルを教えるVLA2025/8/1
VLAモデルが環境に存在しない物体を参照する偽前提の指示を検出し、言語で確認・訂正して代替案を実行するInstruct-Verify-and-Actフレームワークを提案。
- シミュレーションの音:生成的音声でマルチモーダルなsim-to-realロボット方策を学習sim2real2025/7/1
物理シミュレータに大規模生成モデルを統合し、映像に条件づけたリアルな音声を合成することで、実機データなしに注ぐタスクのマルチモーダル方策を学習し、未知の容器や液体へのゼロショット転移を実現した。
- LeVERB: 潜在視覚言語指示によるヒューマノイド全身制御VLA2025/6/1
ヒューマノイドの全身制御向けに、視覚言語ポリシーが潜在的な行動語彙を学習し、強化学習ベースの全身制御ポリシーがそれを実行する階層型フレームワークを提案。150以上のタスクを含む初のsim-to-real対応ベンチマークで評価し、単純な階層型VLAより7.8倍高い成功率を達成。
- 全身姿勢に条件付けられた一人称視点動画予測動画予測2025/6/1
過去の動画と3D身体姿勢の動作から、一人称視点の未来動画を自己回帰拡散トランスフォーマーで予測するモデルPEVAを提案し、大規模データセットNymeriaで学習・評価した。
- 視覚的模倣による文脈依存型ヒューマノイド制御全身制御2025/5/1
日常動画から人間と環境を再構成し、階段昇降や椅子への着座など周囲の状況に応じた全身制御方策をヒューマノイドに学習させるreal-to-sim-to-realパイプラインを提案。
- 4D表現で事前学習する自己回帰ロボットモデルVLA2025/2/1
人間の動画から得た3D点追跡の4D表現を活用し、ロボット制御に効率的に転移できる自己回帰モデルARM4Rを提案した。
- ナビゲーション世界モデルナビゲーション/世界モデル2024/12/1
人間とロボットの視点動画で学習した10億パラメータの拡散トランスフォーマーにより、過去の観測と行動から将来の視覚像を予測し、ナビゲーション経路を計画するモデルを提案した。
- 難地形を歩行するヒューマノイドの学習歩行2024/10/1
固有感覚と行動の履歴から次行動を予測するTransformerを平坦地で事前学習し強化学習で不整地に微調整することで、実機ヒューマノイドが未整備の自然地形や急斜面を安定して歩行できるようにした。
- 文脈内学習でLLMにロボット動作を予測させるRoboPromptVLA2024/10/1
訓練なしのテキストのみのLLMが、キーフレームから抽出した動作と物体姿勢をテキスト化した実演を文脈内学習に用いてロボット動作を直接予測するフレームワークを提案。
- LLARVA: 視覚-行動インストラクションチューニングによるロボット学習の強化VLA2024/6/1
構造化プロンプトで多様なロボットタスクを統合するインストラクションチューニング手法と、中間2D表現「ビジュアルトレース」の予測により視覚と行動を整合させ、RLBenchと実機Frankaで高い汎化性能を示した研究。
- EgoPet: 動物視点の自己運動とインタラクションデータセット歩行2024/4/1
ペットの視点から撮影した映像で自己運動とマルチエージェント相互作用を同時に含むデータセットを構築し、四足歩行ロボットの事前学習に有効であることを示した。
- 次トークン予測としてのヒューマノイド歩行歩行2024/2/1
センサ運動軌跡を自己回帰的に次トークン予測するTransformerで学習し、実機ヒューマノイドをサンフランシスコでゼロショット歩行させた研究。
- Which One? Leveraging Context Between Objects and Multiple Views for Language Grounding2023/11/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Robot Learning with Sensorimotor Pre-training2023/6/1
- Real-World Humanoid Locomotion with Reinforcement Learning2023/3/1
- Real-World Robot Learning with Masked Visual Pre-training2022/10/1
- Decentralized Vehicle Coordination: The Berkeley DeepDrive Drone Dataset and Consensus-Based Models2022/9/1
- Masked Visual Pre-training for Motor Control2022/3/1
- Explaining Reinforcement Learning Policies through Counterfactual Trajectories2022/1/1
- Towards Learning to Play Piano with Dexterous Hands and Touch2021/6/1
- PyTouch: A Machine Learning Library for Touch Processing2021/5/1
- Auto-Tuned Sim-to-Real Transfer2021/4/1
- Instance-Aware Predictive Navigation in Multi-Agent Environments2021/1/1
- Fighting Copycat Agents in Behavioral Cloning from Observation Histories2020/10/1
- Seeing the Un-Scene: Learning Amodal Semantic Maps for Room Navigation2020/7/1
- ParkPredict: Motion and Intent Prediction of Vehicles in Parking Lots2020/4/1
- Towards Practical Multi-Object Manipulation using Relational Reinforcement Learning2019/12/1
- Plan Arithmetic: Compositional Plan Vectors for Multi-Task Control2019/10/1
- Monocular Plan View Networks for Autonomous Driving2019/5/1
- Learning to Control Self-Assembling Morphologies: A Study of Generalization via Modularity2019/2/1
- Deep Object-Centric Policies for Autonomous Driving2018/11/1
- Large-Scale Study of Curiosity-Driven Learning2018/8/1
- Learning Instance Segmentation by Interaction2018/6/1
- Zero-Shot Visual Imitation2018/4/1
- Deep Object-Centric Representations for Generalizable Robot Learning2017/8/1
- Curiosity-driven Exploration by Self-supervised Prediction2017/5/1
- Learning Modular Neural Network Policies for Multi-Task and Multi-Robot Transfer2016/9/1
- Deep Learning for Tactile Understanding From Visual and Haptic Data2015/11/1
- Deep Spatial Autoencoders for Visuomotor Learning2015/9/1
- End-to-End Training of Deep Visuomotor Policies2015/4/1