Homer Walke
収録論文 12本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MEM: 視覚言語行動モデルのためのマルチスケール具現化メモリVLA2026/3/1
ロボットの長期タスク遂行のために、ビデオベースの短期記憶とテキストベースの長期記憶を組み合わせたマルチスケールメモリアーキテクチャを提案し、15分に及ぶ複雑なタスクを可能にした。
- 知識を保護する視覚-言語-行動モデル:高速学習・高速推論・より良い汎化VLA2025/5/1
連続制御用のアクションエキスパートを組み込んだVLAモデルにおいて、学習速度と知識転移が損なわれる問題を分析し、VLMバックボーンを保護する学習手法を提案した。
- π0.5: オープンワールド汎化を実現する視覚-言語-行動モデルVLA2025/4/1
異種タスクの共同学習により、未知の家庭環境でもキッチンや寝室の掃除などの長期的で器用な操作を実行できるVLAモデルπ0.5を提案した。
- 異なる身体を超えて学ぶ:操作・ナビゲーション・歩行・飛行を1つのポリシーでVLA2024/8/1
20種類のロボットの90万軌道をTransformerで学習し、単一のポリシーでマニピュレーションから歩行・飛行まで制御できるCrossFormerを提案した。
- 基盤モデルによる指示追従スキルの自律的改善VLA2024/7/1
視覚言語モデルを活用してロボットが自律的に多様なデータを収集・評価し、人間の注釈なしで指示追従ポリシーを改善する手法を提案。未知環境での性能を2倍に向上させた。
- Octo: オープンソースの汎用ロボットポリシーVLA2024/5/1
80万件の軌道データで学習したTransformerベースの汎用ロボットマニピュレーションポリシーを提案し、言語や目標画像で指示でき、新しいセンサーや行動空間にも短時間でファインチューニング可能であることを示した。
- Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models2023/10/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- BridgeData V2: A Dataset for Robot Learning at Scale2023/8/1
- Goal Representations for Instruction Following: A Semi-Supervised Language Interface to Control2023/7/1
- Generalization with Lossy Affordances: Leveraging Broad Offline Data for Learning Visuomotor Tasks2022/10/1
- Don't Start From Scratch: Leveraging Prior Data to Automate Robotic Reinforcement Learning2022/7/1