Michael S. Ryoo
収録論文 17本 ・ フィジカルAI/ロボット学習
視覚表現学習VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LACE: クロスエンボディメント学習のための潜在視覚表現視覚表現学習2026/5/1
人間とロボットの視覚表現を潜在空間で整列させるフレームワークを提案し、ロボットのデモデータが少ない場合でも人間のデモデータを活用できるようにした。
- 動作画像拡散との共同学習によるロボットVLAの性能向上VLA2025/12/1
VLAモデルに将来の動きを予測する動作ヘッドを追加し、動作ヘッドと共同学習することで、推論速度を保ちながら動作推論能力と実環境性能を大幅に向上させた。
- ロボット制御に必要なのはピクセルモーション拡散であるVLA2025/9/1
高レベルな運動意図と低レベルなロボット動作をピクセルモーション表現で橋渡しする拡散モデルベースの統合フレームワークDAWNを提案し、CALVINやMetaWorldで高性能を示すとともに実機への転移も実証した。
- LLaRA:視覚言語モデルをロボット制御に転用する対話型ポリシー学習VLA2024/6/1
ロボットの行動を視覚と言語の対話として扱い、既存の模倣学習データから自動で対話形式の学習データを生成して視覚言語モデルを微調整し、ロボット制御に転用する手法を提案した。
- Crossway Diffusion: Improving Diffusion-based Visuomotor Policy via Self-supervised Learning2023/7/1
- Energy-Based Models for Cross-Modal Localization using Convolutional Transformers2023/6/1
- Active Vision Reinforcement Learning under Limited Visual Observability2023/6/1
- Token Turing Machines2022/11/1
- Open-vocabulary Queryable Scene Representations for Real World Planning2022/9/1
- Learning Viewpoint-Agnostic Visual Representations by Recovering Tokens in 3D Space2022/6/1
- Does Self-supervised Learning Really Improve Reinforcement Learning from Pixels?2022/6/1
- Self-Supervised Disentangled Representation Learning for Third-Person Imitation Learning2021/8/1
- Visionary: Vision architecture discovery for robot learning2021/3/1
- Model-based Behavioral Cloning with Future Image Similarity Learning2019/10/1
- Learning Real-World Robot Policies by Dreaming2018/5/1
- Learning Social Affordance Grammar from Videos: Transferring Human Interactions to Human-Robot Interactions2017/3/1
- Learning Robot Activities from First-Person Human Videos Using Convolutional Future Regression2017/3/1