Danny Driess
収録論文 37本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- π0.7: 操縦可能な汎用ロボット基盤モデルと創発的能力VLA2026/4/1
多様なコンテキスト条件付けを用いて、未見環境での言語指示追従やゼロショットの身体汎化を実現するロボット基盤モデルπ0.7を提案した。
- MEM: 視覚言語行動モデルのためのマルチスケール具現化メモリVLA2026/3/1
ロボットの長期タスク遂行のために、ビデオベースの短期記憶とテキストベースの長期記憶を組み合わせたマルチスケールメモリアーキテクチャを提案し、15分に及ぶ複雑なタスクを可能にした。
- 操縦可能な視覚-言語-行動ポリシーによる身体性推論と階層制御VLA2026/2/1
サブタスクや動作、ピクセル座標など多様な抽象度の合成コマンドでVLAを訓練し、VLMの知識を低レベル行動に反映させて汎化性能を高める手法を提案。
- π*0.6:経験から学ぶVLAVLA2025/11/1
実世界での経験と人間の修正を活用した強化学習手法RECAPにより、洗濯物畳みや箱組み立て、エスプレッソ抽出などのタスクを高成功率で実行できる汎用VLAモデルπ*0.6を開発した。
- 知識を保護する視覚-言語-行動モデル:高速学習・高速推論・より良い汎化VLA2025/5/1
連続制御用のアクションエキスパートを組み込んだVLAモデルにおいて、学習速度と知識転移が損なわれる問題を分析し、VLMバックボーンを保護する学習手法を提案した。
- 効率的な身体性推論のための学習戦略VLA2025/5/1
ロボットのChain-of-Thought推論がなぜ有効かを分析し、軽量で高速な代替推論手法を提案した論文。
- π0.5: オープンワールド汎化を実現する視覚-言語-行動モデルVLA2025/4/1
異種タスクの共同学習により、未知の家庭環境でもキッチンや寝室の掃除などの長期的で器用な操作を実行できるVLAモデルπ0.5を提案した。
- Gemini Robotics:AIを物理世界へVLA2025/3/1
Gemini 2.0を基盤に、ロボットを直接制御できる汎用VLAモデル「Gemini Robotics」と、空間・時間理解を強化した推論モデル「Gemini Robotics-ER」を提案した論文。
- Hi Robot: 階層型視覚言語行動モデルによるオープンエンドな指示追従VLA2025/2/1
視覚言語モデルを階層的に用い、複雑な指示や実行中のフィードバックを解釈してロボットの低レベル行動に変換するシステムを提案し、片腕・双腕・移動ロボットで評価した。
- FAST: 視覚言語行動モデルのための効率的な行動トークン化VLA2025/1/1
離散コサイン変換に基づく新しい行動トークン化手法FASTを提案し、高頻度で器用なロボットタスクにおける自己回帰型VLAの学習を可能にした。
- 視覚言語モデルは文脈内価値学習器であるVLA2024/11/1
視覚言語モデルにシャッフルした動画フレームの時系列順序を予測させることで、ロボットやタスク固有の訓練なしに300以上の実世界タスクの進捗を推定できる汎用価値関数を実現した。
- RT-Affordance: ロボットマニピュレーションのための汎用中間表現としてのアフォーダンスマニピュレーション2024/11/1
タスクの要所でのロボット姿勢を表すアフォーダンスを中間表現として用い、言語指示からアフォーダンス計画を生成して操作方策を条件付ける階層モデルを提案し、新規タスクで既存手法を50%以上上回る性能を示した。
- π0: 汎用ロボット制御のための視覚-言語-行動フローモデルVLA2024/10/1
事前学習済み視覚言語モデルにフローマッチングを組み合わせ、多様なロボットの大規模データで訓練することで、洗濯物畳みや箱組み立てなどの器用なタスクをゼロショットや言語指示で実行できる汎用ロボット基盤モデルを提案した。
- ALOHA Unleashed:ロボット巧みさのためのシンプルなレシピマニピュレーション2024/10/1
ALOHA 2プラットフォームでの大規模データ収集とDiffusion Policyを組み合わせることで、変形物体や複雑な接触を伴う両手巧み操作タスクを模倣学習で高精度に実現できることを示した研究。
- Vid2Robot: クロスアテンションTransformerによる動画条件付きエンドツーエンド方策学習VLA2024/3/1
人間の操作動画を入力として、クロスアテンションTransformerでロボットの行動を生成するエンドツーエンド方策を提案し、実機で従来手法を20%以上上回る性能と物体間の動作転移を実現した。
- PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs2024/2/1
- SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities2024/1/1
- Foundation Models in Robotics: Applications, Challenges, and the Future2023/12/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control2023/7/1
- Large Language Models as General Pattern Machines2023/7/1
- PaLM-E: An Embodied Multimodal Language Model2023/3/1
- Grounded Decoding: Guiding Text Generation with Grounded Models for Embodied Agents2023/3/1
- Learning Feasibility of Factored Nonlinear Programs in Robotic Manipulation Planning2022/10/1
- Reinforcement Learning with Neural Radiance Fields2022/6/1
- FC$^3$: Feasibility-Based Control Chain Coordination2022/5/1
- Sequence-of-Constraints MPC: Reactive Timing-Optimal Control of Sequential Manipulation2022/3/1
- Learning Multi-Object Dynamics with Compositional Neural Radiance Fields2022/2/1
- Deep Visual Constraints: Neural Implicit Models for Manipulation Planning from Visual Input2021/12/1
- Learning to Execute: Efficient Learning of Universal Plan-Conditioned Policies in Robotics2021/11/1
- Learning Models as Functionals of Signed-Distance Fields for Manipulation Planning2021/10/1
- Long-Horizon Multi-Robot Rearrangement Planning for Construction Assembly2021/6/1
- Deep 6-DoF Tracking of Unknown Objects for Reactive Grasping2021/3/1
- Deep Visual Reasoning: Learning to Predict Action Sequences for Task and Motion Planning from an Initial Scene Image2020/6/1
- Robust Task and Motion Planning for Long-Horizon Architectural Construction Planning2020/3/1
- Probabilistic Framework for Constrained Manipulations and Task and Motion Planning under Uncertainty2020/3/1
- Describing Physics For Physical Reasoning: Force-based Sequential Manipulation Planning2020/2/1