Oier Mees
収録論文 38本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 待ち時間に学習する:推論遅延下での汎用ロボットポリシーのRLファインチューニングRL/遅延対応2026/8/24
推論遅延がRLのマルコフ性を壊す問題に対し、非同期推論と状態拡張で遅延を隠蔽しつつRL改善を可能にするフレームワークARLIを提案。シミュレーションと実機で有効性を実証した。
- FlowDAgger: 潜在空間における人間参加型生成ロボットポリシーの適応模倣学習/適応2026/7/1
事前学習済みの生成ロボットポリシーを、人間の介入から潜在空間で適応させる手法を提案。介入行動を逆変換してノイズに変換し、軽量な潜在ポリシーで基盤モデルを操縦することで、少数の介入から迅速にスキル獲得する。
- ロボットの自己改善:人間のビデオからの力学モデルを用いてロボット学習2026/6/1
人間のビデオから学習した行動・力学・価値表現をロボットに転移し、失敗状態を修正するDGAC法を提案。7つの実世界操作タスクで成功率を40%から81%に向上させ、ロボットの自己改善を実証した。
- 人間のビデオからロボット操作へ:人間中心データを用いたスケーラブルな視覚言語行動学習に関するサーベイVLA/サーベイ2026/6/1
ロボットのデモデータに頼らず、豊富な人間のビデオをVLAモデルの学習に活用する手法を4つのカテゴリに分類して整理し、未解決の課題と今後の研究方向を提示したサーベイ論文。
- ロボット学習のためのワールドモデル:包括的サーベイサーベイ2026/5/1
ロボット学習におけるワールドモデルの役割と進化を体系的にレビューし、ポリシー学習、シミュレーション、評価への応用や課題を整理したサーベイ論文。
- SteerVLA:長尾運転シーンで視覚言語行動モデルを操舵する自動運転/VLA2026/2/1
VLMの常識推論で細かい言語指示を生成し、VLA運転ポリシーを操舵する手法を提案。閉ループベンチマークで長尾シーンの性能を大幅に改善した。
- mimic-video: VLAを超える汎化可能なロボット制御のためのビデオ行動モデルVLA2025/12/1
大規模動画モデルを事前学習に用い、その潜在表現からフローマッチングでロボットの低レベル行動を生成するVideo-Action Modelを提案。シミュレーションと実機のマニピュレーションでVLAを上回り、サンプル効率10倍・収束速度2倍を達成した。
- ロボットナビゲーションと操作のためのマルチモーダル空間言語マップVLA2025/6/1
視覚・言語・音声の特徴を3D環境再構成に融合した空間マップを構築し、LLMと組み合わせて自然言語指示やマルチモーダルな目標を地図上に定位してロボットのナビゲーションと操作を可能にする手法を提案。
- 効率的な身体性推論のための学習戦略VLA2025/5/1
ロボットのChain-of-Thought推論がなぜ有効かを分析し、軽量で高速な代替推論手法を提案した論文。
- 視覚を超えて:言語グラウンディングによる異種センサーでの汎用ロボット方策のファインチューニングVLA2025/1/1
自然言語を共通のクロスモーダル基盤として用い、視覚・触覚・音声などの異種センサー入力を扱えるよう汎用ロボット方策をファインチューニングする手法FuSeを提案。実世界実験で成功率を20%以上向上させた。
- FAST: 視覚言語行動モデルのための効率的な行動トークン化VLA2025/1/1
離散コサイン変換に基づく新しい行動トークン化手法FASTを提案し、高頻度で器用なロボットタスクにおける自己回帰型VLAの学習を可能にした。
- GHIL-Glue: フィルタリングされたサブゴール画像による階層制御VLA2024/10/1
生成モデルが作るサブゴール画像をフィルタリングし、下位方策と効果的に繋ぐことで、言語条件付きロボット操作の汎化性能を向上させた研究。
- 汎用ロボット基盤モデルを価値誘導で操る:V-GPSVLA2024/10/1
オフライン強化学習で学習した価値関数を用いて汎用ロボット方策の行動を再ランク付けし、微調整なしで性能を向上させる手法を提案。
- 基盤モデルによるゼロショットラベリングでロボット方策学習をスケールさせるVLA2024/10/1
視覚言語基盤モデルを組み合わせ、未整理の長期ロボットデータに自然言語指示を自動でゼロショット付与するNILSを提案し、11.5万軌道以上をラベリングした。
- LeLaN: 実世界動画から言語条件付きナビゲーション方策を学習ナビゲーション2024/10/1
大規模視覚言語モデルとロボット基盤モデルを活用し、ラベルなし・行動なしの一人称視点動画から言語で指示された物体ナビゲーション方策を学習する手法を提案。1000回以上の実世界実験で既存手法を上回り、エッジ計算で4倍高速に推論可能。
- ロボット拡散トランスフォーマーの構成要素VLA2024/10/1
拡散モデルとトランスフォーマーを組み合わせたロボット政策の設計指針を検討し、長期的な器用タスクで高性能を発揮する新アーキテクチャを提案した。
- 異なる身体を超えて学ぶ:操作・ナビゲーション・歩行・飛行を1つのポリシーでVLA2024/8/1
20種類のロボットの90万軌道をTransformerで学習し、単一のポリシーでマニピュレーションから歩行・飛行まで制御できるCrossFormerを提案した。
- 言語最適化による方策適応:少数ショット模倣のためのタスク分解模倣学習2024/8/1
視覚言語モデルによるタスク分解を活用し、少数の実演から未知の長期的ロボット操作タスクに適応する手法PALOを提案した。
- 身体性を伴う連鎖的思考推論によるロボット制御VLA2024/7/1
視覚言語行動モデルに、計画・サブタスク・動作・物体位置などの推論を段階的に行わせてから行動を予測するECoTを導入し、大規模データセット向けの合成訓練データ生成パイプラインを構築して成功率を向上させた。
- 基盤モデルによる指示追従スキルの自律的改善VLA2024/7/1
視覚言語モデルを活用してロボットが自律的に多様なデータを収集・評価し、人間の注釈なしで指示追従ポリシーを改善する手法を提案。未知環境での性能を2倍に向上させた。
- Octo: オープンソースの汎用ロボットポリシーVLA2024/5/1
80万件の軌道データで学習したTransformerベースの汎用ロボットマニピュレーションポリシーを提案し、言語や目標画像で指示でき、新しいセンサーや行動空間にも短時間でファインチューニング可能であることを示した。
- 実世界ロボットマニピュレーションポリシーのシミュレーション評価sim2real2024/5/1
実環境とシミュレーションの制御・視覚ギャップを緩和し、実機セットアップに対応した評価環境SIMPLERを構築。実機とシミュレーションの性能が強く相関することを示した。
- Bridging Language and Action: A Survey of Language-Conditioned Robot Manipulation2023/12/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Audio Visual Language Maps for Robot Navigation2023/3/1
- Grounding Language with Visual Affordances over Unstructured Data2022/10/1
- Visual Language Maps for Robot Navigation2022/10/1
- Latent Plans for Task-Agnostic Offline Reinforcement Learning2022/9/1
- What Matters in Language Conditioned Robotic Imitation Learning over Unstructured Data2022/4/1
- Affordance Learning from Play for Sample-Efficient Policy Learning2022/3/1
- CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks2021/12/1
- Composing Pick-and-Place Tasks By Grounding Language2021/2/1
- Hindsight for Foresight: Unsupervised Structured Dynamics Models from Physical Interaction2020/8/1
- Learning Object Placements For Relational Instructions by Hallucinating Scene Representations2020/1/1
- Adversarial Skill Networks: Unsupervised Robot Skill Learning from Video2019/10/1
- Self-supervised 3D Shape and Viewpoint Estimation from Single Images for Robotics2019/10/1
- Choosing Smartly: Adaptive Multimodal Fusion for Object Detection in Changing Environments2017/7/1
- Metric Learning for Generalizing Spatial Relations to New Objects2017/3/1