Catherine Glossop
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- π0.7: 操縦可能な汎用ロボット基盤モデルと創発的能力VLA2026/4/1
多様なコンテキスト条件付けを用いて、未見環境での言語指示追従やゼロショットの身体汎化を実現するロボット基盤モデルπ0.7を提案した。
- SteerVLA:長尾運転シーンで視覚言語行動モデルを操舵する自動運転/VLA2026/2/1
VLMの常識推論で細かい言語指示を生成し、VLA運転ポリシーを操舵する手法を提案。閉ループベンチマークで長尾シーンの性能を大幅に改善した。
- AsyncVLA:エッジ上での高速・堅牢なナビゲーションのための非同期VLAVLA2026/2/1
大規模基盤モデルを遠隔ワークステーションで動かし、軽量なオンボードアダプタが高頻度で動作を補正する非同期制御フレームワークを提案し、最大6秒の通信遅延下でも高いナビゲーション成功率を実現した。
- 操縦可能な視覚-言語-行動ポリシーによる身体性推論と階層制御VLA2026/2/1
サブタスクや動作、ピクセル座標など多様な抽象度の合成コマンドでVLAを訓練し、VLMの知識を低レベル行動に反映させて汎化性能を高める手法を提案。
- π*0.6:経験から学ぶVLAVLA2025/11/1
実世界での経験と人間の修正を活用した強化学習手法RECAPにより、洗濯物畳みや箱組み立て、エスプレッソ抽出などのタスクを高成功率で実行できる汎用VLAモデルπ*0.6を開発した。
- OmniVLA:ロボットナビゲーションのためのオムニモーダル視覚言語行動モデルVLA2025/9/1
2D姿勢・自己中心画像・自然言語などの複数のゴール指定をランダムに融合して学習し、未知環境への汎化や新しい言語指示への追従を可能にしたナビゲーション用VLAモデルを提案。
- CAST: 反事実ラベルによる視覚言語行動モデルの指示追従性向上VLA2025/8/1
視覚言語モデルを用いて既存のロボットデータセットに反事実ラベルを付与し、言語指示への追従性能を向上させる手法を提案。
- モデルベース再アノテーションによるどこでも走行学習ナビゲーション2025/5/1
クラウドソースの遠隔操作データや未ラベルのYouTube動画を、学習したモデルベース専門家で再ラベル付けし、長距離ナビゲーション方策LogoNavを訓練して未知環境でのロバストな走行を実現した。
- LeLaN: 実世界動画から言語条件付きナビゲーション方策を学習ナビゲーション2024/10/1
大規模視覚言語モデルとロボット基盤モデルを活用し、ラベルなし・行動なしの一人称視点動画から言語で指示された物体ナビゲーション方策を学習する手法を提案。1000回以上の実世界実験で既存手法を上回り、エッジ計算で4倍高速に推論可能。
- Pushing the Limits of Cross-Embodiment Learning for Manipulation and Navigation2024/2/1
- NoMaD: Goal Masked Diffusion Policies for Navigation and Exploration2023/10/1