Jost Tobias Springenberg
収録論文 31本 ・ フィジカルAI/ロボット学習
VLA/強化学習VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RLトークン:視覚言語行動モデルを用いたオンライン強化学習のブートストラップVLA/強化学習2026/4/1
事前学習済みの視覚言語行動モデル(VLA)にRLトークンと呼ばれる小型の表現を追加し、その上で強化学習を行うことで、実ロボット上で数時間の練習だけで効率的に微調整できる手法を提案した。
- π0.7: 操縦可能な汎用ロボット基盤モデルと創発的能力VLA2026/4/1
多様なコンテキスト条件付けを用いて、未見環境での言語指示追従やゼロショットの身体汎化を実現するロボット基盤モデルπ0.7を提案した。
- MEM: 視覚言語行動モデルのためのマルチスケール具現化メモリVLA2026/3/1
ロボットの長期タスク遂行のために、ビデオベースの短期記憶とテキストベースの長期記憶を組み合わせたマルチスケールメモリアーキテクチャを提案し、15分に及ぶ複雑なタスクを可能にした。
- π*0.6:経験から学ぶVLAVLA2025/11/1
実世界での経験と人間の修正を活用した強化学習手法RECAPにより、洗濯物畳みや箱組み立て、エスプレッソ抽出などのタスクを高成功率で実行できる汎用VLAモデルπ*0.6を開発した。
- 知識を保護する視覚-言語-行動モデル:高速学習・高速推論・より良い汎化VLA2025/5/1
連続制御用のアクションエキスパートを組み込んだVLAモデルにおいて、学習速度と知識転移が損なわれる問題を分析し、VLMバックボーンを保護する学習手法を提案した。
- π0.5: オープンワールド汎化を実現する視覚-言語-行動モデルVLA2025/4/1
異種タスクの共同学習により、未知の家庭環境でもキッチンや寝室の掃除などの長期的で器用な操作を実行できるVLAモデルπ0.5を提案した。
- Gemini Robotics:AIを物理世界へVLA2025/3/1
Gemini 2.0を基盤に、ロボットを直接制御できる汎用VLAモデル「Gemini Robotics」と、空間・時間理解を強化した推論モデル「Gemini Robotics-ER」を提案した論文。
- ゲーム開始:言語モデルを強化学習の実験者として活用するVLA2024/9/1
VLMを用いて強化学習の実験サイクルを自動化し、タスク提案・スキル分解・カリキュラム構築を行うエージェントアーキテクチャを提案した。
- Offline Actor-Critic Reinforcement Learning Scales to Large Models2024/2/1
- GATS: Gather-Attend-Scatter2024/1/1
- Mastering Stacking of Diverse Shapes with Large-Scale Iterative Reinforcement Learning on Real Robots2023/12/1
- RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation2023/6/1
- A Generalist Dynamics Model for Control2023/5/1
- Leveraging Jumpy Models for Planning and Fast Learning in Robotic Domains2023/2/1
- How to Spend Your Robot Time: Bridging Kickstarting and Offline Reinforcement Learning for Vision-based Robotic Manipulation2022/5/1
- A Generalist Agent2022/5/1
- Revisiting Gaussian mixture critics in off-policy reinforcement learning: a sample-based approach2022/4/21
- Evaluating model-based planning and planner amortization for continuous control2021/10/1
- Beyond Pick-and-Place: Tackling Robotic Stacking of Diverse Shapes2021/10/1
- On Multi-objective Policy Optimization as a Tool for Reinforcement Learning: Case Studies in Offline RL and Finetuning2021/6/1
- Learning Dexterous Manipulation from Suboptimal Experts2020/10/1
- Simple Sensor Intentions for Exploration2020/5/1
- Keep Doing What Worked: Behavioral Modelling Priors for Offline Reinforcement Learning2020/2/1
- Continuous-Discrete Reinforcement Learning for Hybrid Control in Robotics2020/1/1
- Imagined Value Gradients: Model-Based Policy Optimization with Transferable Latent Dynamics Models2019/10/1
- Compositional Transfer in Hierarchical Reinforcement Learning2019/6/1
- Self-supervised Learning of Image Embedding for Continuous Control2019/1/1
- Maximum a Posteriori Policy Optimisation2018/6/1
- Learning by Playing - Solving Sparse Reward Tasks from Scratch2018/2/1
- Deep Reinforcement Learning with Successor Features for Navigation across Similar Environments2016/12/1
- Multimodal Deep Learning for Robust RGB-D Object Recognition2015/7/1