Dorsa Sadigh
Stanford University
収録論文 142本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- リアルタイム視覚-言語-行動ポリシーのための強化学習VLA2026/9/16
大規模VLAモデルの推論遅延による観測のずれを解消するため、遅い行動生成と速い反応的編集を分離し、強化学習でリアルタイム制御を可能にするフレームワークを提案。
- 1つのデモで多様な物体へ:局所接触形状による操作の一般化マニピュレーション2026/9/1
人間のデモから学習し、接触点周りの局所形状に注目した報酬設計で、多指ロボットハンドの操作を未見の物体へ一般化する手法を提案した。
- 世界モデルを用いたQ学習強化学習2026/8/17
Q学習に世界モデルを組み合わせ、実データのみで学習しつつ想像上の軌道で探索を行うことで、サンプル効率と性能を向上させる手法を提案した。
- VIA: ロボット制御のための視覚インターフェースエージェントロボット制御2026/7/1
既存の基盤モデルをロボット制御に活用する新しいフレームワークVIAを提案。ロボットをブラウザベースの3Dインターフェースを通じて操作するエージェントとして扱い、スクリーンショットとコマンドでタスクをゼロショットで実行する。
- 行動整合表現によるクロスエンボディメント転移VLA/クロスエンボディメント転移2026/7/1
ロボット操作の大規模模倣学習において、行動整合表現(物体のバウンディングボックスや言語動作、エンドエフェクタの軌跡など)がVLAモデルのクロスエンボディメント転移を促進するかを検証し、シミュレーションベンチマークで評価。エンドエフェクタ軌跡が特に有効で、シミュレーションから実機への転移成功率を28%向上させた。
- 近接状態ナッジング:AI支援による技能萎縮の軽減共有自律/技能学習2026/5/1
AI支援下での技能低下を防ぐため、学習しやすい状態へユーザーを誘導する共有自律アルゴリズムを提案し、シミュレーションと人間実験で効果を実証した。
- EXPO-FT: 視覚言語行動モデルのサンプル効率的強化学習ファインチューニングVLA/強化学習ファインチューニング2026/5/1
事前学習済みの視覚言語行動(VLA)モデルを強化学習で安定かつサンプル効率的にファインチューニングするシステムEXPO-FTを提案し、高精度・動的動作を要する複数の操作タスクで完全成功率を達成した。
- ロボットトレーナーは人に楽しまれるか?ペーサーロボットSnoopieのケーススタディヒューマンロボットインタラクション2026/4/1
四足歩行ロボットがランニングのインターバルトレーニングのペーサーとして機能し、ウェアラブル端末と比較してペース順守率と一貫性が向上し、ユーザーにも好意的に受け入れられることを示した。
- 訓練データに基づくロボット汎化の接地:検索拡張型VLMによるアプローチロボット操作/汎化評価/VLM2026/3/1
ロボット操作の評価タスクを訓練データと比較し、どのような汎化が必要かを分類するフレームワークRADARを提案した。
- データの類推が効率的な異種ロボット間転移を可能にする模倣学習/転移学習2026/3/1
異なるロボット間での模倣学習の転移において、単にデータ量を増やすよりも、シーンやタスクを揃えたペアデータ(データ類推)が形態の違いに対して効果的であることを示し、実世界で成功率を平均22.5%向上させた。
- DexDrummer: 手内・接触豊富・長期的な巧みなロボットドラミング巧みな操作2026/3/1
手内操作、接触の多い相互作用、長期的な調整を統合した複雑なタスクとしてドラム演奏を提案し、階層的な物体中心の両手ポリシーをシミュレーションで訓練し実機に転送する。
- HandelBot: 巧みなロボット政策の高速適応による実世界ピアノ演奏マニピュレーション2026/3/1
シミュレーションで訓練した多指ハンド政策を、構造的調整と残差強化学習の2段階で実機に高速適応させ、両手ピアノ演奏を実現した。
- SteerVLA:長尾運転シーンで視覚言語行動モデルを操舵する自動運転/VLA2026/2/1
VLMの常識推論で細かい言語指示を生成し、VLA運転ポリシーを操舵する手法を提案。閉ループベンチマークで長尾シーンの性能を大幅に改善した。
- RoboCade:ロボットデータ収集をゲーム化データ収集2025/12/1
一般ユーザーが遠隔操作でゲーム感覚でロボットのデモデータを収集できるプラットフォームを開発し、そのデータで訓練した方策が対象タスクの成功率を16〜56%向上させることを示した。
- ロボットの視覚汎化のための不変性共訓練sim2real2025/12/1
ロボットデモと非物理シミュレーションの画像を共訓練し、状態類似性と観測摂動への不変性を補助タスクとして導入することで、未見の視点・照明・妨害物体への汎化性能を18%向上させた。
- ロボット駆動データフライホイール:実環境展開による継続的データ収集と基盤モデル適応VLA2025/11/1
ロボットを実環境に配備してタスク遂行中に実世界データを収集し、基盤モデルを継続的に改善する「データフライホイール」枠組みを提案。図書館で2週間稼働した移動マニピュレータScanfordで、VLMの書架スキャンと自動ラベリングによりドメイン特化・隣接タスクの性能を向上させた。
- 重要度重み付きデータ検索による少数ショット模倣学習模倣学習2025/9/1
少数の実演データを補強するため、事前データセットから関連サンプルを検索する際に、ターゲットと事前データの分布比(重要度重み)をガウスKDEで推定する手法を提案し、従来の最近傍検索の欠点を改善した。
- 知覚と行動をつなぐ:ロボットの汎化のための空間的に接地された中間表現マニピュレーション2025/6/1
物体中心性・姿勢認識・深度認識という中間表現を専門家エンコーダで学習し、その混合専門家ポリシーで実世界の両手巧み操作タスクの汎化性能を向上させた研究。
- 視覚言語モデルによる巧みな操作の足場構築マニピュレーション2025/6/1
視覚言語モデルを使ってタスクに関連するキーポイントを特定し、手と物体の粗い3D軌道を生成して、シミュレーションで残差強化学習方策を訓練する手法を提案。
- HoMeR: ハイブリッド模倣と全身制御による実環境モバイルマニピュレーションの学習モバイルマニピュレーション2025/6/1
全身制御と絶対/相対のハイブリッド行動を組み合わせ、家庭内でのモバイルマニピュレーションを少数のデモで学習する模倣学習フレームワークを提案。
- ProVox: 状況に応じた人とロボットの協調のためのパーソナライズと先回り計画VLA2025/6/1
大規模言語モデルを活用し、ユーザーの好みや意図を事前に取り込んで、指示を待たずに先回りして行動を計画する協働ロボットの枠組みを提案した。家庭内の調理補助タスクでのユーザー研究により評価した。
- ロボティクスにおけるバッチオンライン強化学習で重要な要素は何か?強化学習2025/5/1
自律収集データからのバッチオンライン強化学習において、アルゴリズムクラス・方策抽出法・方策表現力の3軸を体系的に検証し、Q関数の利用と暗黙的な方策抽出が性能向上に重要であることを示した。
- 模倣学習のための潜在拡散プランニング模倣学習2025/4/1
行動なしのデモと準最適データを活用するため、潜在空間上で動くプランナーと逆動力学モデルを拡散目的で訓練するLDPを提案し、視覚ロボット操作タスクで既存手法を上回った。
- 統合動画行動モデルVLA2025/3/1
動画と行動を統合的に学習し、推論時は動画生成を省略して高速に行動を予測できるロボティクス向けモデルを提案。
- 介護タスクにおけるソフトロボティクスの知覚的安全性に関する研究ソフトロボティクス2025/3/1
入浴など身体接触が不可避な介護場面を想定し、正負圧を組み合わせた3Dプリント製ソフトグリッパを設計。硬質グリッパより低く均一な圧力で把持でき、実演後に参加者のロボットへの信頼が有意に向上した。
- Gemini Robotics:AIを物理世界へVLA2025/3/1
Gemini 2.0を基盤に、ロボットを直接制御できる汎用VLAモデル「Gemini Robotics」と、空間・時間理解を強化した推論モデル「Gemini Robotics-ER」を提案した論文。
- 汎用ロボットマニピュレーション政策の評価のための分類体系マニピュレーション2025/3/1
ロボットマニピュレーションにおける汎化の種類を整理した分類体系STAR-Genを提案し、実世界ベンチマークで検証した。
- ロボットの訓練方法:模倣学習におけるデモンストレーション手法の影響模倣学習2025/3/1
キネステティック教示・VRコントローラ・スペースマウスの3つのデモ手法を比較し、キネステティックが最も直感的で学習性能も高いが、大規模収集には不向きであることを示し、少数のキネステティックと遠隔操作を混ぜる収集法を提案した。
- 言語ガイド付き選好学習による表現豊かな四足歩行行動の効率的生成歩行2025/2/1
LLMが生成する事前分布と人間の選好フィードバックを組み合わせ、少ないクエリで四足ロボットの表現豊かな歩容を効率的に学習する手法LGPLを提案。
- 行動ラベルなしデータからの推論による方策の汎化VLA2025/2/1
人間の動画から言語ベースの推論を学習し、ロボットの行動ラベルなしデータを活用して汎化性能の高いロボット方策を訓練する手法RADを提案した。
- 共有自律性による近接発達領域に基づく個別指導教育・共有自律性2025/2/1
共有自律性を活用して学生の近接発達領域を推定し、個別化されたカリキュラムを設計するZ-COACHを提案し、自動運転シミュレータでの高速レース指導で有効性を示した。
- 相互情報量推定によるロボットデモデータの品質選別模倣学習2025/2/1
ロボットの模倣学習データについて、状態と行動の相互情報量への各軌道の寄与をVAE埋め込みとk近傍推定で評価し、デモの品質を選別する手法を提案した。
- モーショントラック:少数ショット模倣学習における人間-ロボット転移のための統一表現模倣学習2025/1/1
人間の手とロボットのエンドエフェクタの動きを画像上の短い2D軌跡(モーショントラック)として統一的に表現し、少数の人間動画とロボット実演から模倣学習ポリシーを訓練する手法を提案。実世界4タスクで86.5%の成功率を達成。
- 注目点を活用したハイブリッド模倣学習模倣学習2024/12/1
点群からタスクに関連する注目点を推定し、遠距離移動はウェイポイント、精密動作は手首画像からの密な動作で予測する模倣学習手法を提案。
- ボーカルサンドボックス:状況に応じた人とロボットの協働のための継続学習と適応人ロボット協働2024/11/1
音声対話やキネステティック教示など多様な教示から、ロボットが低レベル技能と高レベル計画を継続的に学習・適応する枠組みを提案し、ギフト袋詰めとLEGOストップモーション制作で有効性を示した。
- RoboCrowd: クラウドソーシングによるロボットデータ収集のスケーリングデータ収集2024/11/1
クラウドソーシングとインセンティブ設計でロボット模倣学習用の人間デモデータ収集を分散・拡張する枠組みを提案し、大学カフェでの2週間実験で200人以上から800エピソード超を収集した。
- RT-Affordance: ロボットマニピュレーションのための汎用中間表現としてのアフォーダンスマニピュレーション2024/11/1
タスクの要所でのロボット姿勢を表すアフォーダンスを中間表現として用い、言語指示からアフォーダンス計画を生成して操作方策を条件付ける階層モデルを提案し、新規タスクで既存手法を50%以上上回る性能を示した。
- 視覚言語モデルは文脈内価値学習器であるVLA2024/11/1
視覚言語モデルにシャッフルした動画フレームの時系列順序を予測させることで、ロボットやタスク固有の訓練なしに300以上の実世界タスクの進捗を推定できる汎用価値関数を実現した。
- 自律ロボットデータ収集のスケールアップは本当に可能か?自律データ収集2024/11/1
自律模倣学習によるデータ収集は、実世界でのスケールアップにおいて環境設計の課題など強化学習と同様の限界に直面することを実験的に示した研究。
- MotIF: 動作指示ファインチューニングVLA2024/9/1
ロボットの動作の成否を判定するために、キーポイント軌跡を最終画像に重ねた抽象表現で視覚言語モデルをファインチューニングする手法を提案し、MotIF-1Kデータセットを構築した。
- Gen2Act: 人間動画生成を活用した汎用ロボットマニピュレーションマニピュレーション2024/9/1
ウェブデータで学習した人間動画生成モデルを使い、生成された動画を条件にロボット方策を学習することで、未見物体や新規動作への汎化を実現した。
- Re-Mix: 大規模模倣学習のためのデータ混合最適化模倣学習2024/8/1
ロボット基盤モデルの事前学習において、データセットの異なるサブセットの重み付けを分布ロバスト最適化で最適化する手法Re-Mixを提案し、Open X-Embodimentデータセットで均一重みより38%性能を向上させた。
- FlowRetrieval: フロー誘導型データ検索による少数ショット模倣学習模倣学習2024/8/1
オプティカルフローで動作の類似性を測り、他タスクのデータから関連動作を検索して少数ショット模倣学習を強化する手法を提案。
- FLAIR: 長期的な取得による現実的な食事の摂食支援摂食支援ロボティクス2024/7/1
基盤モデルとパラメータ化されたスキルライブラリを活用し、多様な食品を含む現実的な食事をユーザーの好みに合わせて効率的に摂食させる長期的な支援システムを開発した。
- OpenVLA: オープンソースの視覚-言語-行動モデルVLA2024/6/1
97万件の実機ロボット実演で学習した7BパラメータのオープンソースVLAモデルを提案し、閉源モデルRT-2-Xを上回る汎用マニピュレーション性能と効率的なファインチューニングを実現した。
- Octo: オープンソースの汎用ロボットポリシーVLA2024/5/1
80万件の軌道データで学習したTransformerベースの汎用ロボットマニピュレーションポリシーを提案し、言語や目標画像で指示でき、新しいセンサーや行動空間にも短時間でファインチューニング可能であることを示した。
- VADER: マルチロボット・人間協調のための視覚的アフォーダンス検出とエラー回復VLA2024/5/1
視覚的アフォーダンス検出とエラー認識を行い、他ロボットや人間への助け要請を新たなスキルとして組み込むことで、長期的タスクの中断から回復して完遂するフレームワークVADERを提案した。
- RT-Sketch: 手描きスケッチによる目標条件付き模倣学習模倣学習2024/3/1
手描きスケッチを目標指定に用いる操作ポリシーを提案し、言語や画像条件よりも曖昧さや視覚的妨害に頑健であることを示した。
- DROID: 大規模実環境ロボットマニピュレーションデータセットマニピュレーション2024/3/1
北米・アジア・欧州の50名が12ヶ月かけて564シーン・84タスクで収集した76k軌道・350時間のロボット操作データセットを構築し、学習ポリシーの性能と汎化性能が向上することを示した。
- RT-H: 言語による行動階層VLA2024/3/1
低レベル動作を「腕を前に動かす」のような言語フレーズで表現し、タスクと行動の間に言語動作を介在させることで、多様なタスク間でデータを共有し、人間の言語介入による修正も可能にする模倣学習手法を提案。
- 確信するまで探索せよ:身体性質問応答のための効率的探索VLA2024/3/1
大規模視覚言語モデル(VLM)とConformal Predictionを組み合わせ、ロボットが環境を効率的に探索して質問に答える身体性質問応答(EQA)フレームワークを提案。HM3D上に新データセットも構築した。
- 合成的一般化を活用したロボットマニピュレーションの効率的データ収集マニピュレーション2024/3/1
視覚模倣学習ポリシーが環境要因を合成できることを実証し、その合成能力を活かした効率的なデータ収集戦略を提案。実機で77.5%の成功率を達成。
- Batch Active Learning of Reward Functions from Human Preferences2024/2/1
- Learning to Learn Faster from Human Feedback with Language Model Predictive Control2024/2/1
- Pushing the Limits of Cross-Embodiment Learning for Manipulation and Navigation2024/2/1
- AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents2024/1/1
- Generative Expressive Robot Behaviors using Large Language Models2024/1/1
- SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities2024/1/1
- Chain of Code: Reasoning with a Language Model-Augmented Code Emulator2023/12/1
- Distilling and Retrieving Generalizable Knowledge for Robot Manipulation via Language Corrections2023/11/1
- RoboCLIP: One Demonstration is Enough to Learn Robot Policies2023/10/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Stabilize to Act: Learning to Coordinate for Bimanual Manipulation2023/9/1
- Gesture-Informed Robot Assistance via Foundation Models2023/9/1
- Robots That Can See: Leveraging Human Pose for Trajectory Prediction2023/9/1
- Physically Grounded Vision-Language Models for Robotic Manipulation2023/9/1
- Learning Sequential Acquisition Policies for Robot-Assisted Feeding2023/9/1
- Polybot: Training One Policy Across Robots While Embracing Variability2023/7/1
- Large Language Models as General Pattern Machines2023/7/1
- Robots That Ask For Help: Uncertainty Alignment for Large Language Model Planners2023/7/1
- HYDRA: Hybrid Robot Actions for Imitation Learning2023/6/1
- Language to Rewards for Robotic Skill Synthesis2023/6/1
- Data Quality in Imitation Learning2023/6/1
- Generating Language Corrections for Teaching Physical Control Tasks2023/6/1
- KITE: Keypoint-Conditioned Policies for Semantic Manipulation2023/6/1
- Toward Grounded Commonsense Reasoning2023/6/1
- Behavior Retrieval: Few-Shot Imitation Learning by Querying Unlabeled Datasets2023/4/1
- Soy: An Efficient MILP Solver for Piecewise-Affine Systems2023/3/1
- Language-Driven Representation Learning for Robotics2023/2/1
- Active Reward Learning from Online Preferences2023/2/1
- "No, to the Right" -- Online Language Corrections for Robotic Manipulation via Shared Autonomy2023/1/1
- Few-Shot Preference Learning for Human-in-the-Loop RL2022/12/1
- In-Mouth Robotic Bite Transfer with Visual and Haptic Sensing2022/11/1
- Learning Tool Morphology for Contact-Rich Manipulation Tasks with Differentiable Simulation2022/11/1
- Learning Visuo-Haptic Skewering Strategies for Robot-Assisted Feeding2022/11/1
- Learning Bimanual Scooping Policies for Food Acquisition2022/11/1
- Assistive Teaching of Motor Control Tasks to Humans2022/11/1
- Eliciting Compatible Demonstrations for Multi-Human Imitation Learning2022/10/1
- Masked Imitation Learning: Discovering Environment-Invariant Modalities in Multimodal Demonstrations2022/9/1
- PLATO: Predicting Latent Affordances Through Object-Centric Play2022/3/1
- Weakly Supervised Correspondence Learning2022/3/1
- Leveraging Smooth Attention Prior for Multi-Agent Trajectory Prediction2022/3/1
- Learning from Imperfect Demonstrations via Adversarial Confidence Transfer2022/2/1
- Balancing Efficiency and Comfort in Robot-Assisted Bite Transfer2021/11/1
- LILA: Language-Informed Latent Actions2021/11/1
- Confidence-Aware Imitation Learning from Demonstrations with Varying Optimality2021/10/1
- Partner-Aware Algorithms in Decentralized Cooperative Bandit Teams2021/10/1
- Learning Feasibility to Imitate Demonstrators with Different Dynamics2021/10/1
- Influencing Towards Stable Multi-Agent Interactions2021/10/1
- Learning Reward Functions from Scale Feedback2021/10/1
- From Machine Learning to Robotics: Challenges and Opportunities for Embodied Intelligence2021/10/1
- Learning Multimodal Rewards from Rankings2021/9/1
- APReL: A Library for Active Preference-based Reward Learning Algorithms2021/8/1
- Social Coordination and Altruism in Autonomous Driving2021/7/1
- Learning Latent Actions to Control Assistive Robots2021/7/1
- Cooperative Autonomous Vehicles that Sympathize with Human Drivers2021/7/1
- Altruistic Maneuver Planning for Cooperative Autonomous Vehicles Using Multi-agent Advantage Actor-Critic2021/7/1
- Incentivizing Efficient Equilibria in Traffic Networks with Mixed Autonomy2021/6/1
- Learning Visually Guided Latent Actions for Assistive Teleoperation2021/5/1
- Learning Human Objectives from Sequences of Physical Corrections2021/4/1
- On the Critical Role of Conventions in Adaptive Human-AI Collaboration2021/4/1
- ELLA: Exploration through Learned Language Abstraction2021/3/1
- Learning from Imperfect Demonstrations from Agents with Varying Dynamics2021/3/1
- Transfer Reinforcement Learning across Homotopy Classes2021/2/1
- ROIAL: Region of Interest Active Learning for Characterizing Exoskeleton Gait Preference Landscapes2020/11/1
- Learning Latent Representations to Influence Multi-Agent Interaction2020/11/1
- Learning Adaptive Language Interfaces through Decomposition2020/10/1
- Multi-Agent Safe Planning with Gaussian Processes2020/8/1
- Reinforcement Learning based Control of Imitative Policies for Near-Accident Driving2020/7/1
- Learning User-Preferred Mappings for Intuitive Robot Control2020/7/1
- Formalizing and Guaranteeing* Human-Robot Interaction2020/6/1
- Learning Reward Functions from Diverse Sources of Human Feedback: Optimally Integrating Demonstrations and Preferences2020/6/1
- Dynamic Multi-Robot Task Allocation under Uncertainty and Temporal Constraints2020/5/1
- Active Preference-Based Gaussian Process Regression for Reward Learning2020/5/1
- Shared Autonomy with Learned Latent Actions2020/5/1
- When Humans Aren't Optimal: Robots that Collaborate with Risk-Aware Humans2020/1/1
- Learning from My Partner's Actions: Roles in Decentralized Robot Teams2019/10/1
- Asking Easy Questions: A User-Friendly Approach to Active Reward Learning2019/10/1
- Learning How to Dynamically Route Autonomous Vehicles on Shared Roads2019/9/1
- Controlling Assistive Robots with Learned Latent Actions2019/9/1
- Robots that Take Advantage of Human Trust2019/9/1
- Learning Reward Functions by Integrating Human Demonstrations and Preferences2019/6/1
- Deep Local Trajectory Replanning and Control for Robot Navigation2019/5/1
- The Green Choice: Learning and Influencing Human Decisions on Shared Roads2019/4/1
- Efficient and Safe Exploration in Deterministic Markov Decision Processes with Unknown Transition Models2019/4/1
- Unsupervised Visuomotor Control through Distributional Planning Networks2019/2/1
- Batch Active Preference-Based Learning of Reward Functions2018/10/1
- Efficient and Trustworthy Social Navigation Via Explicit and Implicit Robot-Human Communication2018/10/1
- Hierarchical Game-Theoretic Planning for Autonomous Vehicles2018/10/1
- Altruistic Autonomy: Beating Congestion on Shared Roads2018/10/1
- Maximizing Road Capacity Using Cars that Influence People2018/7/1
- Safe Control under Uncertainty2015/10/1