Dhruv Shah
収録論文 59本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EmbodiedSWE:長期的器用ロボティクスのためのコーディングエージェントVLA2026/9/23
コーディングエージェントが長期的・器用なロボットタスクを解き、その解を多様な軌道に拡張してVLAを訓練し、実機タスクまで完了できることを示した研究。
- TANGO: 雑然環境における全身視覚言語行動モデルを用いた人型ロボットナビゲーションナビゲーション2026/9/8
雑然とした屋内環境での人型ロボットナビゲーションを、言語指示と視覚情報から全身の関節動作を直接予測するフレームワークTANGOを提案。シミュレーションで学習し、実機にゼロショット適用可能。
- Mixture-of-Experts VLAにおける創発的な構成スキルVLA2026/7/1
専門家デモからロボットポリシーをエンドツーエンドで学習する際、Mixture-of-Expertsアーキテクチャを用いることで、タスク分解や階層構造を事前に定義せずとも、再利用可能で解釈可能なプリミティブが創発的に獲得されることを示した論文。
- RoboVista:多様なロボット応用のための視覚言語モデル評価VLM評価2026/7/1
ロボットの多様な応用における視覚言語モデル(VLM)の能力を評価するためのモジュール型フレームワークとベンチマークを提案し、実ロボット実験でその有効性を示した。
- 汎用ロボットにおけるオーケストレーションギャップへの物理的主体性による対処ロボット制御2026/7/1
汎用ロボットの能力を、学習済みのポリシーと高レベルのオーケストレーターに分解し、追加学習なしで複雑なタスクを解決する手法を提案した。
- ロボットポリシー編成における重要要素:階層型VLAエージェントの体系的研究VLA/階層制御2026/6/9
階層型VLAシステムの設計原則を体系的に研究し、プランナーとコントローラの選択や接続方法などが性能に与える影響を分析。導出した原則に基づくシステムが、フラットなVLAや素朴な階層構造より優れることをシミュレーションと実機で示した。
- RAVEN: 視覚・空間・時間メモリによる長期的推論とナビゲーションナビゲーション2026/6/1
ロボットの長期運用向けに、視覚特徴と位置・時刻をベクトルDBに保存し、空間マップで検索するメモリシステムRAVENを提案。画像を直接扱うことで高精度かつ低コストな長期QA・ナビゲーションを実現し、実機でも検証した。
- 視覚検証による推論時制御と自律的なポリシー改善ロボット学習2026/6/1
汎用ロボットポリシーに視覚検証器を組み合わせ、推論時に行動を評価・選択することで追加学習なしで性能を向上させ、さらに検証済み軌道で微調整して自律的に改善する手法を提案した。
- WorldArena 2.0:モダリティ・機能・プラットフォームにわたる身体化ワールドモデルベンチマークの拡張ベンチマーク2026/5/1
身体化ワールドモデルの評価を、視覚のみから視触覚へ、政策評価から強化学習環境としての利用へ、シミュレータから実ロボットへと拡張したベンチマークを提案した。
- MolmoB0T: 大規模シミュレーションによるゼロショット操作の実現操作2026/3/1
大規模で多様なシミュレーションデータのみを用いて、実世界へのゼロショット転移が可能であることを示し、静的・移動操作の両方で有効なポリシーを訓練した。
- 訓練データに基づくロボット汎化の接地:検索拡張型VLMによるアプローチロボット操作/汎化評価/VLM2026/3/1
ロボット操作の評価タスクを訓練データと比較し、どのような汎化が必要かを分類するフレームワークRADARを提案した。
- LAP: 言語-行動事前学習によるゼロショットの異機体転移VLA2026/2/1
ロボットの低レベル行動を自然言語で表現して事前学習することで、未知のロボット機体にもファインチューニングなしでゼロショット転移できるVLAモデルLAP-3Bを提案した。
- BPP: 重要な履歴フレームに注目した長文脈ロボット模倣学習模倣学習2026/2/1
視覚言語モデルで検出したタスクに関連するキーフレームのみを条件とすることで、履歴に依存するロボットタスクの模倣学習を安定化させ、実世界タスクで成功率を大幅に向上させた。
- AsyncVLA:エッジ上での高速・堅牢なナビゲーションのための非同期VLAVLA2026/2/1
大規模基盤モデルを遠隔ワークステーションで動かし、軽量なオンボードアダプタが高頻度で動作を補正する非同期制御フレームワークを提案し、最大6秒の通信遅延下でも高いナビゲーション成功率を実現した。
- WorldArena:身体性世界モデルの知覚と機能的実用性を評価する統合ベンチマーク世界モデル2026/2/1
身体性世界モデルを映像知覚品質と下流タスクでの機能的実用性の両面から評価する統合ベンチマークWorldArenaを提案し、14モデルの実験から知覚と機能の間に大きなギャップがあることを示した。
- PolaRiS: 汎用ロボットポリシーのためのスケーラブルな実世界→シミュレーション評価sim2real2025/12/1
実世界の短い動画スキャンからニューラル再構成で高忠実度なシミュレーション環境を構築し、汎用ロボットポリシーを実世界と強く相関する形で評価できるようにしたフレームワーク。
- VeoワールドシミュレータによるGeminiロボティクスポリシーの評価sim2real2025/12/1
最先端の動画生成モデルVeoを基盤とした生成評価システムを構築し、ロボットポリシーの通常性能から分布外汎化、物理・意味的安全性までをシミュレーションで評価できることを示した。
- 3D生成AIと視覚言語モデルによるテキストからの多部品ロボット組立ロボット組立2025/11/1
3D生成AIと視覚言語モデルを組み合わせ、自然言語から多部品オブジェクトをロボットで組み立てるパイプラインを提案。VLMが形状と機能を推論して部品割り当てを行い、ユーザーは対話的に修正できる。
- Gemini Robotics 1.5:高度な身体性推論・思考・動作転移で汎用ロボットの最前線を押し広げるVLA2025/10/1
異種ロボットデータから学ぶ動作転移機構と自然言語での多段階推論を組み合わせたVLAモデルと、身体性推論に特化したモデルを発表し、複雑な多段階タスクの実行と解釈性を向上させた。
- 物体目標ナビゲーションのための強化学習手法で重要な要素は何か?実証研究と統合フレームワーク物体目標ナビゲーション2025/10/1
物体目標ナビゲーションの強化学習システムを認識・方策・テスト時強化の3要素に分解し、大規模実験で各要素の影響を分析。認識とテスト時戦略の改善が方策改善より効果的であることを示し、統合フレームワークを提案。
- OmniVLA:ロボットナビゲーションのためのオムニモーダル視覚言語行動モデルVLA2025/9/1
2D姿勢・自己中心画像・自然言語などの複数のゴール指定をランダムに融合して学習し、未知環境への汎化や新しい言語指示への追従を可能にしたナビゲーション用VLAモデルを提案。
- データ駆動型社会ロボットナビゲーション指標のベンチマークに向けて社会ナビゲーション2025/9/1
社会ロボットナビゲーションのベンチマークと政策最適化のためのデータ駆動型指標を開発し、4427件の軌道データセットを収集・評価して、学習済み指標SN26を提案した。
- CAST: 反事実ラベルによる視覚言語行動モデルの指示追従性向上VLA2025/8/1
視覚言語モデルを用いて既存のロボットデータセットに反事実ラベルを付与し、言語指示への追従性能を向上させる手法を提案。
- 知覚と行動をつなぐ:ロボットの汎化のための空間的に接地された中間表現マニピュレーション2025/6/1
物体中心性・姿勢認識・深度認識という中間表現を専門家エンコーダで学習し、その混合専門家ポリシーで実世界の両手巧み操作タスクの汎化性能を向上させた研究。
- モデルベース再アノテーションによるどこでも走行学習ナビゲーション2025/5/1
クラウドソースの遠隔操作データや未ラベルのYouTube動画を、学習したモデルベース専門家で再ラベル付けし、長距離ナビゲーション方策LogoNavを訓練して未知環境でのロバストな走行を実現した。
- 因子分解スケーリング曲線によるデータ収集の指針模倣学習2025/5/1
データ量に対する性能変化を因子ごとに定量化する因子分解スケーリング曲線を構築し、限られた予算で最も影響力のある因子の組み合わせに絞ったデータ収集を可能にする手法を提案。
- 汎用ロボットマニピュレーション政策の評価のための分類体系マニピュレーション2025/3/1
ロボットマニピュレーションにおける汎化の種類を整理した分類体系STAR-Genを提案し、実世界ベンチマークで検証した。
- Gemini Robotics:AIを物理世界へVLA2025/3/1
Gemini 2.0を基盤に、ロボットを直接制御できる汎用VLAモデル「Gemini Robotics」と、空間・時間理解を強化した推論モデル「Gemini Robotics-ER」を提案した論文。
- 相互情報量推定によるロボットデモデータの品質選別模倣学習2025/2/1
ロボットの模倣学習データについて、状態と行動の相互情報量への各軌道の寄与をVAE埋め込みとk近傍推定で評価し、デモの品質を選別する手法を提案した。
- 視覚言語モデルは文脈内価値学習器であるVLA2024/11/1
視覚言語モデルにシャッフルした動画フレームの時系列順序を予測させることで、ロボットやタスク固有の訓練なしに300以上の実世界タスクの進捗を推定できる汎用価値関数を実現した。
- STEER: 密な言語グラウンディングによる柔軟なロボットマニピュレーションマニピュレーション2024/11/1
自然言語で表現された基本的な操作スキルを密なアノテーションで学習し、それらを組み合わせて未見の状況や新規タスクに適応できるロボット学習フレームワークSTEERを提案。
- LeLaN: 実世界動画から言語条件付きナビゲーション方策を学習ナビゲーション2024/10/1
大規模視覚言語モデルとロボット基盤モデルを活用し、ラベルなし・行動なしの一人称視点動画から言語で指示された物体ナビゲーション方策を学習する手法を提案。1000回以上の実世界実験で既存手法を上回り、エッジ計算で4倍高速に推論可能。
- 実世界の視覚データから学習する走破性認識型脚式ナビゲーション歩行2024/10/1
脚式ロボットの制御器の価値関数に基づいて走破性コストをロボット中心に推定し、RGBDナビゲーション計画に統合して実世界で効率的に強化学習する手法を提案した。
- Gen2Act: 人間動画生成を活用した汎用ロボットマニピュレーションマニピュレーション2024/9/1
ウェブデータで学習した人間動画生成モデルを使い、生成された動画を条件にロボット方策を学習することで、未見物体や新規動作への汎化を実現した。
- Mobility VLA:長文脈VLMとトポロジカルグラフによるマルチモーダル指示ナビゲーションナビゲーション/VLA2024/7/1
デモ動画と自然言語・画像の指示を入力とし、長文脈VLMで目標フレームを特定、トポロジカルグラフに基づく低レベル方策で実環境をナビゲートする階層型VLAを提案した。
- SELFI: 強化学習による社会ナビゲーションのための自律的自己改善社会ナビゲーション2024/3/1
オフラインのモデルベース学習で事前学習した方策を、オンラインのモデルフリー強化学習で微調整する手法を提案し、実環境での衝突回避と社会的配慮行動を改善した。
- Pushing the Limits of Cross-Embodiment Learning for Manipulation and Navigation2024/2/1
- Bridging Language and Action: A Survey of Language-Conditioned Robot Manipulation2023/12/1
- GOAT: GO to Any Thing2023/11/1
- NoMaD: Goal Masked Diffusion Policies for Navigation and Exploration2023/10/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Navigation with Large Language Models: Semantic Guesswork as a Heuristic for Planning2023/10/1
- SACSoN: Scalable Autonomous Control for Social Navigation2023/6/1
- ViNT: A Foundation Model for Visual Navigation2023/6/1
- FastRLAP: A System for Learning High-Speed Driving via Deep RL and Autonomous Practicing2023/4/1
- Grounded Decoding: Guiding Text Generation with Grounded Models for Embodied Agents2023/3/1
- Offline Reinforcement Learning for Visual Navigation2022/12/1
- Learning Robotic Navigation from Experience: Principles, Methods, and Recent Results2022/12/1
- ExAug: Robot-Conditioned Navigation Policies via Geometric Experience Augmentation2022/10/1
- GNM: A General Navigation Model to Drive Any Robot2022/10/1
- LM-Nav: Robotic Navigation with Large Pre-Trained Models of Language, Vision, and Action2022/7/1
- ViKiNG: Vision-Based Kilometer-Scale Navigation with Geographic Hints2022/2/1
- Value Function Spaces: Skill-Centric State Abstractions for Long-Horizon Reasoning2021/11/1
- Hybrid Imitative Planning with Geometric and Predictive Costs in Off-road Environments2021/11/1
- Rapid Exploration for Open-World Navigation with Latent Goal Models2021/4/1
- ViNG: Learning Open-World Navigation with Visual Goals2020/12/1
- Aerial Manipulation Using Hybrid Force and Position NMPC Applied to Aerial Writing2020/6/1
- The Ingredients of Real-World Robotic Reinforcement Learning2020/4/1
- Robust Localization of an Arbitrary Distribution of Radioactive Sources for Aerial Inspection2017/10/1