Quan Vuong
収録論文 40本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- グリッパー認識型視覚言語行動モデルVLA2026/8/25
異なるグリッパー種別に応じた戦略を学習できるよう、5種類のグリッパーを含む大規模データセットと、専用トークナイザーとポリシールーティングを備えたモデルを提案した。
- SC3-Eval: 自己整合的なビデオ生成によるロボット基盤モデルの評価評価2026/6/1
ロボット操作ポリシーの実世界評価を、アクション条件付きビデオ世界モデルを用いてスケーラブルに代替する手法を提案。前方・逆方向ダイナミクス整合性、クロスビュー整合性、テスト時整合性の3つの整合性を課すことで、正確なポリシー評価を実現する。
- π0.7: 操縦可能な汎用ロボット基盤モデルと創発的能力VLA2026/4/1
多様なコンテキスト条件付けを用いて、未見環境での言語指示追従やゼロショットの身体汎化を実現するロボット基盤モデルπ0.7を提案した。
- Open-H-Embodiment:医療ロボティクスにおける基盤モデルを可能にする大規模データセット医療ロボティクス/データセット/基盤モデル2026/4/1
医療ロボットの自律化を妨げるデータ不足を解決するため、複数のロボットプラットフォームにわたる大規模な医療ロボットビデオと運動学データセットを公開し、基盤モデルの開発を実証した。
- MEM: 視覚言語行動モデルのためのマルチスケール具現化メモリVLA2026/3/1
ロボットの長期タスク遂行のために、ビデオベースの短期記憶とテキストベースの長期記憶を組み合わせたマルチスケールメモリアーキテクチャを提案し、15分に及ぶ複雑なタスクを可能にした。
- π、しかし飛ばす:VLAモデルの空中マニピュレーションへの物理誘導転移空中マニピュレーション/VLA2026/3/1
固定ベースのマニピュレータ向けに事前学習されたVLAモデルを空中プラットフォームへ転移させる際の「ダイナミクスギャップ」を、推論時のペイロード認識ガイダンスと合成データ生成で橋渡しし、空中ピックアンドプレースの成功率を向上させた。
- π*0.6:経験から学ぶVLAVLA2025/11/1
実世界での経験と人間の修正を活用した強化学習手法RECAPにより、洗濯物畳みや箱組み立て、エスプレッソ抽出などのタスクを高成功率で実行できる汎用VLAモデルπ*0.6を開発した。
- 知識を保護する視覚-言語-行動モデル:高速学習・高速推論・より良い汎化VLA2025/5/1
連続制御用のアクションエキスパートを組み込んだVLAモデルにおいて、学習速度と知識転移が損なわれる問題を分析し、VLMバックボーンを保護する学習手法を提案した。
- π0.5: オープンワールド汎化を実現する視覚-言語-行動モデルVLA2025/4/1
異種タスクの共同学習により、未知の家庭環境でもキッチンや寝室の掃除などの長期的で器用な操作を実行できるVLAモデルπ0.5を提案した。
- Hi Robot: 階層型視覚言語行動モデルによるオープンエンドな指示追従VLA2025/2/1
視覚言語モデルを階層的に用い、複雑な指示や実行中のフィードバックを解釈してロボットの低レベル行動に変換するシステムを提案し、片腕・双腕・移動ロボットで評価した。
- FAST: 視覚言語行動モデルのための効率的な行動トークン化VLA2025/1/1
離散コサイン変換に基づく新しい行動トークン化手法FASTを提案し、高頻度で器用なロボットタスクにおける自己回帰型VLAの学習を可能にした。
- 注目点を活用したハイブリッド模倣学習模倣学習2024/12/1
点群からタスクに関連する注目点を推定し、遠距離移動はウェイポイント、精密動作は手首画像からの密な動作で予測する模倣学習手法を提案。
- π0: 汎用ロボット制御のための視覚-言語-行動フローモデルVLA2024/10/1
事前学習済み視覚言語モデルにフローマッチングを組み合わせ、多様なロボットの大規模データで訓練することで、洗濯物畳みや箱組み立てなどの器用なタスクをゼロショットや言語指示で実行できる汎用ロボット基盤モデルを提案した。
- RoVi-Aug: ロボットと視点の拡張による異なる機体間のロボット学習sim2real2024/9/1
画像生成モデルでロボットの種類とカメラ視点を拡張し、未見のロボットや視点でもゼロショットで動く方策を学習する手法を提案。
- ネガティブプロンプト誘導を用いた言語駆動型6自由度把持検出マニピュレーション2024/7/1
自然言語の指示に基づき、散らかった点群の中から目的の物体を6自由度で把持する手法を提案。大規模データセットGrasp-Anything-6Dと、不要物体を避けるネガティブプロンプト誘導拡散モデルを導入した。
- OpenVLA: オープンソースの視覚-言語-行動モデルVLA2024/6/1
97万件の実機ロボット実演で学習した7BパラメータのオープンソースVLAモデルを提案し、閉源モデルRT-2-Xを上回る汎用マニピュレーション性能と効率的なファインチューニングを実現した。
- 実世界ロボットマニピュレーションポリシーのシミュレーション評価sim2real2024/5/1
実環境とシミュレーションの制御・視覚ギャップを緩和し、実機セットアップに対応した評価環境SIMPLERを構築。実機とシミュレーションの性能が強く相関することを示した。
- Octo: オープンソースの汎用ロボットポリシーVLA2024/5/1
80万件の軌道データで学習したTransformerベースの汎用ロボットマニピュレーションポリシーを提案し、言語や目標画像で指示でき、新しいセンサーや行動空間にも短時間でファインチューニング可能であることを示した。
- RT-Sketch: 手描きスケッチによる目標条件付き模倣学習模倣学習2024/3/1
手描きスケッチを目標指定に用いる操作ポリシーを提案し、言語や画像条件よりも曖昧さや視覚的妨害に頑健であることを示した。
- DROID: 大規模実環境ロボットマニピュレーションデータセットマニピュレーション2024/3/1
北米・アジア・欧州の50名が12ヶ月かけて564シーン・84タスクで収集した76k軌道・350時間のロボット操作データセットを構築し、学習ポリシーの性能と汎化性能が向上することを示した。
- Vid2Robot: クロスアテンションTransformerによる動画条件付きエンドツーエンド方策学習VLA2024/3/1
人間の操作動画を入力として、クロスアテンションTransformerでロボットの行動を生成するエンドツーエンド方策を提案し、実機で従来手法を20%以上上回る性能と物体間の動作転移を実現した。
- Pushing the Limits of Cross-Embodiment Learning for Manipulation and Navigation2024/2/1
- Mirage: Cross-Embodiment Zero-Shot Policy Transfer with Cross-Painting2024/2/1
- PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs2024/2/1
- Learning to Learn Faster from Human Feedback with Language Model Predictive Control2024/2/1
- AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents2024/1/1
- SARA-RT: Scaling up Robotics Transformers with Self-Adaptive Robust Attention2023/12/1
- RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches2023/11/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Q-Transformer: Scalable Offline Reinforcement Learning via Autoregressive Q-Functions2023/9/1
- Robotic Offline RL from Internet Videos via Value-Function Pre-Training2023/9/1
- BridgeData V2: A Dataset for Robot Learning at Scale2023/8/1
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control2023/7/1
- PaLM-E: An Embodied Multimodal Language Model2023/3/1
- Open-World Object Manipulation using Pre-trained Vision-Language Models2023/3/1
- RT-1: Robotics Transformer for Real-World Control at Scale2022/12/1
- A Real2Sim2Real Method for Robust Object Grasping with Neural Surface Reconstruction2022/10/1
- Single RGB-D Camera Teleoperation for General Robotic Manipulation2021/6/1
- Machine Learning for Robotic Manipulation2021/1/1
- Supervised Policy Update for Deep Reinforcement Learning2018/5/1