Chelsea Finn
Stanford University
収録論文 175本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- リアルタイム視覚-言語-行動ポリシーのための強化学習VLA2026/9/16
大規模VLAモデルの推論遅延による観測のずれを解消するため、遅い行動生成と速い反応的編集を分離し、強化学習でリアルタイム制御を可能にするフレームワークを提案。
- 世界モデルを用いたQ学習強化学習2026/8/17
Q学習に世界モデルを組み合わせ、実データのみで学習しつつ想像上の軌道で探索を行うことで、サンプル効率と性能を向上させる手法を提案した。
- シミュレーションでの視覚的器用さの事前学習器用操作/事前学習2026/8/16
VRヘッドセットを使い、人間がシミュレーション内で物体を操作して収集したデータで、多指ロボットハンドの操作ポリシーを事前学習する手法を提案。実機での微調整により、ゼロから学習するよりも高い性能を達成した。
- SpeedTuning: 軽量強化学習によるポリシー実行の高速化操作/強化学習2026/8/1
模倣学習で得た操作ポリシーの実行速度を、追加データ収集なしで強化学習により最適化し、成功率を保ちつつ2.4倍以上の高速化を実現するフレームワークを提案した。
- LLMを検証器として使う:汎用検証フレームワークLLM検証2026/7/1
LLMの検証能力を新たなスケーリング軸として捉え、追加学習なしでエージェントタスクにきめ細かいフィードバックを与える汎用検証フレームワークを提案した。スコアの粒度拡大や繰り返し評価、基準分解により検証精度を向上させ、複数のベンチマークで最高性能を達成した。
- DIRECT: 身体化プランナーにおけるテスト時計算の割り当てはいつ、どこで行うべきか?VLA/プランニング2026/6/10
VLMを高レベルプランナーとして使う際、テスト時計算を増やすと性能が上がるが、コストも増える。シーン文脈に基づいて計算をルーティングするDIRECTを提案し、成功率とコストのトレードオフを改善した。
- Ego-Pi: 自己中心視点の人間・ロボットデータによるVLAファインチューニングVLA2026/6/6
ロボット操作のデータ不足を解決するため、自己中心視点の人間データを活用してVLAモデルをファインチューニングし、ロボットが新しいタスクの意味を学習し、既存スキルを組み合わせて新行動を生み出せることを示した論文。
- フロー逆転ステアリングによるロボット汎用ポリシーの性能向上操作2026/6/1
フローマッチングに基づく汎用ロボットポリシーに対し、不完全な行動を逆フローで潜在ノイズに変換し、近傍の高品質な行動モードへ写像する手法を提案。シミュレーションと実機でゼロショット制御や強化学習の改善に効果を示した。
- CHORUS: 単一VLAポリシーによる分散型マルチエンボディ協調群制御2026/6/1
事前学習済みの視覚言語行動(VLA)モデルの基盤を活用し、各ロボットが自身の観測のみで分散協調できるフレームワークCHORUSを提案。実世界実験で既存手法より高い性能を示した。
- ロボット操作のための自由形式選好学習マニピュレーション2026/6/1
人間が自然言語で選好軸を定義し、軸ごとにペア比較を行うことで、言語条件付き報酬モデルを学習し、複数の品質次元を最適化するポリシーを訓練する手法を提案。長期的な操作タスクで従来法より大幅に性能向上。
- EXPO-FT: 視覚言語行動モデルのサンプル効率的強化学習ファインチューニングVLA/強化学習ファインチューニング2026/5/1
事前学習済みの視覚言語行動(VLA)モデルを強化学習で安定かつサンプル効率的にファインチューニングするシステムEXPO-FTを提案し、高精度・動的動作を要する複数の操作タスクで完全成功率を達成した。
- 世界行動検証器:順方向・逆方向の非対称性による自己改善型世界モデル世界モデル2026/4/1
世界モデルが自身の予測誤差を検出し自己改善するフレームワークWAVを提案。状態の妥当性と行動の到達可能性を分離検証し、順方向・逆方向の非対称性を活用してサンプル効率とポリシー性能を向上させる。
- π0.7: 操縦可能な汎用ロボット基盤モデルと創発的能力VLA2026/4/1
多様なコンテキスト条件付けを用いて、未見環境での言語指示追従やゼロショットの身体汎化を実現するロボット基盤モデルπ0.7を提案した。
- Open-H-Embodiment:医療ロボティクスにおける基盤モデルを可能にする大規模データセット医療ロボティクス/データセット/基盤モデル2026/4/1
医療ロボットの自律化を妨げるデータ不足を解決するため、複数のロボットプラットフォームにわたる大規模な医療ロボットビデオと運動学データセットを公開し、基盤モデルの開発を実証した。
- MEM: 視覚言語行動モデルのためのマルチスケール具現化メモリVLA2026/3/1
ロボットの長期タスク遂行のために、ビデオベースの短期記憶とテキストベースの長期記憶を組み合わせたマルチスケールメモリアーキテクチャを提案し、15分に及ぶ複雑なタスクを可能にした。
- データの類推が効率的な異種ロボット間転移を可能にする模倣学習/転移学習2026/3/1
異なるロボット間での模倣学習の転移において、単にデータ量を増やすよりも、シーンやタスクを揃えたペアデータ(データ類推)が形態の違いに対して効果的であることを示し、実世界で成功率を平均22.5%向上させた。
- RoboMME:ロボット汎用ポリシーの記憶能力を評価・理解するベンチマークVLA2026/3/1
長期的・履歴依存的な操作タスクにおけるVLAモデルの記憶機構を評価するため、16タスクからなる標準ベンチマークと14種の記憶拡張VLAを構築し、記憶表現の有効性がタスク依存であることを示した。
- 検証のスケーリングは視覚-言語-行動の整合性において方策学習のスケーリングより効果的になり得るVLA2026/2/1
視覚-言語-行動モデルの指示と行動のずれを減らすため、テスト時に言い換え指示と行動候補を増やして検証する手法CoVerを提案し、方策事前学習のスケーリングより高い性能を示した。
- SteerVLA:長尾運転シーンで視覚言語行動モデルを操舵する自動運転/VLA2026/2/1
VLMの常識推論で細かい言語指示を生成し、VLA運転ポリシーを操舵する手法を提案。閉ループベンチマークで長尾シーンの性能を大幅に改善した。
- VLAW:視覚-言語-行動ポリシーと世界モデルの反復的相互改善VLA2026/2/1
実ロボットのロールアウトデータで世界モデルの精度を高め、その世界モデルが生成する合成データでVLAモデルを改善する反復手法を提案し、実タスクで成功率を39.2%向上させた。
- RoboReward: ロボティクス向け汎用視覚言語報酬モデルVLA2026/1/1
実ロボットの大規模データセットから報酬モデル用データセットとベンチマークを構築し、4B/8Bの視覚言語報酬モデルを訓練。短期的なロボットタスクで大規模VLMを上回る性能を達成し、実機強化学習に適用した。
- Cosmos Policy: 視覚運動制御と計画のための動画モデル微調整VLA2026/1/1
大規模事前学習済み動画モデルを、アーキテクチャ変更なしの一段階の追加学習だけでロボット方策に変換し、行動・将来画像・価値を潜在フレームとして生成して計画も可能にした手法。
- PolaRiS: 汎用ロボットポリシーのためのスケーラブルな実世界→シミュレーション評価sim2real2025/12/1
実世界の短い動画スキャンからニューラル再構成で高忠実度なシミュレーション環境を構築し、汎用ロボットポリシーを実世界と強く相関する形で評価できるようにしたフレームワーク。
- 視覚-言語-行動モデルにおける人間からロボットへの転移の創発VLA2025/12/1
多様なロボットデータで事前学習したVLAモデルに人間の動画を共訓練すると、人間からロボットへのスキル転移が自然に生じることを示し、その要因が身体非依存の表現獲得にあると分析した。
- 事後行動クローニング:効率的なRLファインチューニングのためのBC方策の事前学習模倣学習/RLファインチューニング2025/12/1
模倣学習で事前学習した方策がRLファインチューニングの初期値として不十分な場合があることを理論的に示し、デモンストレータ行動の事後分布をモデル化するPostBCを提案して効率的なファインチューニングを可能にした。
- ロボットの視覚汎化のための不変性共訓練sim2real2025/12/1
ロボットデモと非物理シミュレーションの画像を共訓練し、状態類似性と観測摂動への不変性を補助タスクとして導入することで、未見の視点・照明・妨害物体への汎化性能を18%向上させた。
- π*0.6:経験から学ぶVLAVLA2025/11/1
実世界での経験と人間の修正を活用した強化学習手法RECAPにより、洗濯物畳みや箱組み立て、エスプレッソ抽出などのタスクを高成功率で実行できる汎用VLAモデルπ*0.6を開発した。
- SutureBot:自律的な端から端までの縫合のための精密フレームワークとベンチマークマニピュレーション2025/10/1
da Vinci Research Kit上で針の把持から組織への刺入、結紮までの自律縫合を実現するベンチマークを提案し、1890件の縫合デモデータセットを公開。目標条件付きフレームワークで刺入点精度を59-74%改善し、最先端VLAモデルを評価した。
- MemER: 経験検索によるロボット制御のための記憶の拡張マニピュレーション2025/10/1
ロボット政策に長期記憶を持たせるため、過去の重要フレームを選択・追跡する高レベル政策と、それに基づく低レベル政策の階層型フレームワークを提案し、実世界の長期的操作タスクで性能を向上させた。
- Ctrl-World: ロボットマニピュレーションのための制御可能な生成ワールドモデルワールドモデル2025/10/1
多視点予測と細かい行動制御、長期一貫性を備えた制御可能なワールドモデルを提案し、汎用ロボット政策の評価と改善を可能にした。
- 自己誘導型アクション拡散拡散方策2025/8/1
拡散ベースのロボット方策において、各拡散ステップの提案分布を事前の決定に基づいて誘導することで、双方向デコードを効率化し、少ないサンプリング予算でも高い成功率を達成する手法を提案した。
- RoboArena:汎用ロボットポリシーの分散型実世界評価ロボット評価/ベンチマーク2025/6/1
評価者ネットワークが自由にタスクと環境を選び、ペア比較の二重盲検評価を集約することで、汎用ロボットポリシーをスケーラブルかつ公平にランキングする手法を提案し、7機関・600以上の実機評価で有効性を示した。
- SRT-H: 言語条件付き模倣学習による自律手術の階層フレームワーク手術ロボティクス2025/5/1
言語空間で計画する高レベル方策と軌道生成の低レベル方策を組み合わせ、胆嚢摘出術の体外実験で未見検体8例すべてを完全自律で成功させた。
- 過去トークン予測による長文脈拡散ポリシーの学習模倣学習2025/5/1
拡散ポリシーに過去の行動トークンを予測する補助タスクを導入し、長い文脈の履歴情報を保持しつつメモリと計算コストを抑えて学習する手法を提案した。
- ロボティクスにおけるバッチオンライン強化学習で重要な要素は何か?強化学習2025/5/1
自律収集データからのバッチオンライン強化学習において、アルゴリズムクラス・方策抽出法・方策表現力の3軸を体系的に検証し、Q関数の利用と暗黙的な方策抽出が性能向上に重要であることを示した。
- 模倣学習のための潜在拡散プランニング模倣学習2025/4/1
行動なしのデモと準最適データを活用するため、潜在空間上で動くプランナーと逆動力学モデルを拡散目的で訓練するLDPを提案し、視覚ロボット操作タスクで既存手法を上回った。
- π0.5: オープンワールド汎化を実現する視覚-言語-行動モデルVLA2025/4/1
異種タスクの共同学習により、未知の家庭環境でもキッチンや寝室の掃除などの長期的で器用な操作を実行できるVLAモデルπ0.5を提案した。
- オンライン経験を活用したデモンストレーションのキュレーション模倣学習2025/3/1
ロボットが自身のオンライン経験に基づいて成功・失敗を見分ける分類器を訓練し、質の異なるデモデータを自動で選別することで、模倣学習の性能を向上させる手法を提案。
- CoT-VLA:視覚的思考連鎖推論を用いた視覚-言語-行動モデルVLA2025/3/1
将来の画像フレームを視覚的目標として自己回帰的に予測してから行動系列を生成することで、視覚的思考連鎖推論をVLAに組み込み、実世界タスクで17%の性能向上を達成した。
- 視覚言語行動モデルの微調整:速度と成功率の最適化VLA2025/2/1
VLAモデルの微調整戦略を検討し、並列デコードやアクションチャンキングを組み合わせた最適化レシピを提案。LIBEROベンチマークで成功率を76.5%から97.1%に向上させ、推論速度も26倍高速化した。
- Hi Robot: 階層型視覚言語行動モデルによるオープンエンドな指示追従VLA2025/2/1
視覚言語モデルを階層的に用い、複雑な指示や実行中のフィードバックを解釈してロボットの低レベル行動に変換するシステムを提案し、片腕・双腕・移動ロボットで評価した。
- FAST: 視覚言語行動モデルのための効率的な行動トークン化VLA2025/1/1
離散コサイン変換に基づく新しい行動トークン化手法FASTを提案し、高頻度で器用なロボットタスクにおける自己回帰型VLAの学習を可能にした。
- RoboCrowd: クラウドソーシングによるロボットデータ収集のスケーリングデータ収集2024/11/1
クラウドソーシングとインセンティブ設計でロボット模倣学習用の人間デモデータ収集を分散・拡張する枠組みを提案し、大学カフェでの2週間実験で200人以上から800エピソード超を収集した。
- お手伝いわんちゃんボット:脚式ロボットと視覚言語モデルによるオープンワールド物体取得マニピュレーション2024/10/1
四足歩行ロボットにグリッパと視覚言語モデルを組み合わせ、未知の屋内環境で指示に従って物を取ってくるシステムを実現した。
- π0: 汎用ロボット制御のための視覚-言語-行動フローモデルVLA2024/10/1
事前学習済み視覚言語モデルにフローマッチングを組み合わせ、多様なロボットの大規模データで訓練することで、洗濯物畳みや箱組み立てなどの器用なタスクをゼロショットや言語指示で実行できる汎用ロボット基盤モデルを提案した。
- ALOHA Unleashed:ロボット巧みさのためのシンプルなレシピマニピュレーション2024/10/1
ALOHA 2プラットフォームでの大規模データ収集とDiffusion Policyを組み合わせることで、変形物体や複雑な接触を伴う両手巧み操作タスクを模倣学習で高精度に実現できることを示した研究。
- 双方向デコーディング:ガイド付きテスト時サンプリングによるアクションチャンキングの改善VLA2024/8/1
アクションチャンキングの長所と短所を分析し、テスト時に複数候補から後方一貫性と前方コントラストで最適行動を選ぶBIDを提案、シミュレーションと実機で性能を向上させた。
- D5RL: データ駆動型深層強化学習のための多様なデータセットオフライン強化学習2024/8/1
実世界のロボット操作・移動環境を模したシミュレーションで、スクリプト・人間操作・その他多様なデータ源を含むオフライン強化学習の新ベンチマークを提案。
- Mobility VLA:長文脈VLMとトポロジカルグラフによるマルチモーダル指示ナビゲーションナビゲーション/VLA2024/7/1
デモ動画と自然言語・画像の指示を入力とし、長文脈VLMで目標フレームを特定、トポロジカルグラフに基づく低レベル方策で実環境をナビゲートする階層型VLAを提案した。
- 視覚プロンプトによるアフォーダンス誘導強化学習強化学習2024/7/1
視覚言語モデルが推定するキーポイントのアフォーダンスを報酬に変換し、実世界の多様なマニピュレーションタスクで自律強化学習のサンプル効率を向上させる手法KAGIを提案。
- 身体性を伴う連鎖的思考推論によるロボット制御VLA2024/7/1
視覚言語行動モデルに、計画・サブタスク・動作・物体位置などの推論を段階的に行わせてから行動を予測するECoTを導入し、大規模データセット向けの合成訓練データ生成パイプラインを構築して成功率を向上させた。
- 視覚言語モデルの常識推論による脚式ロボットの適応脚式ロボット2024/7/1
視覚言語モデル(VLM)の常識推論を活用し、過去の相互作用と将来の計画を考慮して脚式ロボットが未知の障害物に対処するシステムVLM-PCを提案。
- 手術ロボットトランスフォーマー(SRT):手術タスクのための模倣学習模倣学習/手術ロボット2024/7/1
da Vinci手術ロボットの不正確な順運動学データでも模倣学習を成功させる相対行動定式化を提案し、組織操作・針操作・結紮の3タスクで実証した。
- 失敗はロボットの常:展開中の迅速な価値ベース試行錯誤ロボット学習2024/6/1
ロボットの基本方針に価値関数を組み合わせ、進捗を監視して失敗時に素早く再試行・戦略変更することで成功率を20%以上向上させる手法を提案。
- HumanPlus:ヒューマノイドの人間動作模倣とシャドーイング模倣学習2024/6/1
人間の動作データセットとRGBカメラによるリアルタイムシャドーイングを組み合わせ、ヒューマノイドが自律的に多様なタスクを模倣学習できるフルスタックシステムを構築した。
- OpenVLA: オープンソースの視覚-言語-行動モデルVLA2024/6/1
97万件の実機ロボット実演で学習した7BパラメータのオープンソースVLAモデルを提案し、閉源モデルRT-2-Xを上回る汎用マニピュレーション性能と効率的なファインチューニングを実現した。
- 実世界ロボットマニピュレーションポリシーのシミュレーション評価sim2real2024/5/1
実環境とシミュレーションの制御・視覚ギャップを緩和し、実機セットアップに対応した評価環境SIMPLERを構築。実機とシミュレーションの性能が強く相関することを示した。
- ALOHA 2:両腕テレオペレーション向けの改良型低コストハードウェアテレオペレーション2024/5/1
両腕マニピュレーション研究を加速するため、低コストで堅牢なテレオペレーション用ハードウェアALOHA 2を開発し、設計とMuJoCoモデルをオープンソース化した。
- Octo: オープンソースの汎用ロボットポリシーVLA2024/5/1
80万件の軌道データで学習したTransformerベースの汎用ロボットマニピュレーションポリシーを提案し、言語や目標画像で指示でき、新しいセンサーや行動空間にも短時間でファインチューニング可能であることを示した。
- 合成的一般化を活用したロボットマニピュレーションの効率的データ収集マニピュレーション2024/3/1
視覚模倣学習ポリシーが環境要因を合成できることを実証し、その合成能力を活かした効率的なデータ収集戦略を提案。実機で77.5%の成功率を達成。
- DROID: 大規模実環境ロボットマニピュレーションデータセットマニピュレーション2024/3/1
北米・アジア・欧州の50名が12ヶ月かけて564シーン・84タスクで収集した76k軌道・350時間のロボット操作データセットを構築し、学習ポリシーの性能と汎化性能が向上することを示した。
- ロボットに怒鳴って教える:言語訂正によるオンザフライ改善VLA2024/3/1
人間がロボットに言語で訂正を与えることで、高レベル方策がリアルタイムに適応し、反復学習を通じて長期的タスクの成功率を向上させるフレームワークを提案。
- PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs2024/2/1
- Pushing the Limits of Cross-Embodiment Learning for Manipulation and Navigation2024/2/1
- Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation2024/1/1
- MOTO: Offline Pre-training to Online Fine-tuning for Model-based Robot Learning2024/1/1
- SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning2024/1/1
- AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents2024/1/1
- What Makes Pre-Trained Visual Representations Successful for Robust Manipulation?2023/12/1
- Adapt On-the-Go: Behavior Modulation for Single-Life Robot Deployment2023/11/1
- RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches2023/11/1
- Robot Fine-Tuning Made Easy: Pre-Training Rewards and Policies for Autonomous Real-World Reinforcement Learning2023/10/1
- RoboCLIP: One Demonstration is Enough to Learn Robot Policies2023/10/1
- Offline Retraining for Online RL: Decoupled Policy Learning to Mitigate Exploration Bias2023/10/1
- Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models2023/10/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Q-Transformer: Scalable Offline Reinforcement Learning via Autoregressive Q-Functions2023/9/1
- Robot Parkour Learning2023/9/1
- BridgeData V2: A Dataset for Robot Learning at Scale2023/8/1
- Polybot: Training One Policy Across Robots While Embracing Variability2023/7/1
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control2023/7/1
- Decomposing the Generalization Gap in Imitation Learning for Visual Robotic Manipulation2023/7/1
- Giving Robots a Hand: Learning Generalizable Manipulation with Eye-in-Hand Human Video Demonstrations2023/7/1
- Contrastive Example-Based Control2023/7/1
- Waypoint-Based Imitation Learning for Robotic Manipulation2023/7/1
- Train Offline, Test Online: A Real Robot Learning Benchmark2023/6/1
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware2023/4/1
- A Control-Centric Benchmark for Video Prediction2023/4/1
- Behavior Retrieval: Few-Shot Imitation Learning by Querying Unlabeled Datasets2023/4/1
- Self-Improving Robots: End-to-End Autonomous Visuomotor Reinforcement Learning2023/3/1
- Open-World Object Manipulation using Pre-trained Vision-Language Models2023/3/1
- Language-Driven Representation Learning for Robotics2023/2/1
- NeRF in the Palm of Your Hand: Corrective Augmentation for Robotics via Novel-View Synthesis2023/1/1
- RT-1: Robotics Transformer for Real-World Control at Scale2022/12/1
- Pre-Training for Robots: Offline RL Enables Learning New Tasks from a Handful of Trials2022/10/1
- Offline Reinforcement Learning at Multiple Frequencies2022/7/1
- Play it by Ear: Learning Skills amidst Occlusion through Audio-Visual Imitation Learning2022/5/1
- A State-Distribution Matching Approach to Non-Episodic Reinforcement Learning2022/5/1
- Do As I Can, Not As I Say: Grounding Language in Robotic Affordances2022/4/1
- Training and Evaluation of Deep Policies using Reinforcement Learning and Generative Models2022/4/1
- Vision-Based Manipulators Need to Also See from Their Hands2022/3/1
- R3M: A Universal Visual Representation for Robot Manipulation2022/3/1
- Policy Architectures for Compositional Generalization in Control2022/3/1
- BC-Z: Zero-Shot Task Generalization with Robotic Imitation Learning2022/2/1
- Robust Policy Learning over Multiple Uncertainty Sets2022/2/1
- How to Leverage Unlabeled Data in Offline Reinforcement Learning2022/2/1
- CoMPS: Continual Meta Policy Search2021/12/1
- MESA: Offline Meta-RL for Safe Adaptation and Fault Tolerance2021/12/1
- Autonomous Reinforcement Learning: Formalism and Benchmarking2021/12/1
- Example-Driven Model-Based Reinforcement Learning for Solving Long-Horizon Visuomotor Tasks2021/9/1
- Lifelong Robotic Reinforcement Learning by Retaining Experiences2021/9/1
- Conservative Data Sharing for Multi-Task Offline Reinforcement Learning2021/9/1
- Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets2021/9/1
- Learning Language-Conditioned Robot Behavior from Offline Data and Crowd-Sourced Annotation2021/9/1
- Visual Adversarial Imitation Learning using Variational Models2021/7/1
- Autonomous Reinforcement Learning via Subgoal Curricula2021/7/1
- Actionable Models: Unsupervised Offline Reinforcement Learning of Robotic Skills2021/4/1
- MT-Opt: Continuous Multi-Task Robotic Reinforcement Learning at Scale2021/4/1
- Greedy Hierarchical Variational Autoencoders for Large-Scale Video Prediction2021/3/1
- Learning Generalizable Robotic Reward Functions from "In-The-Wild" Human Videos2021/3/1
- Bayesian Meta-Learning for Few-Shot Policy Adaptation Across Robotic Platforms2021/3/1
- COMBO: Conservative Offline Model-Based Policy Optimization2021/2/1
- How to Train Your Robot with Deep Reinforcement Learning; Lessons We've Learned2021/2/1
- Offline Reinforcement Learning from Images with Latent Space Models2020/12/1
- Model-Based Visual Planning with Self-Supervised Functional Distances2020/12/1
- Learning Latent Representations to Influence Multi-Agent Interaction2020/11/1
- Reinforcement Learning with Videos: Combining Offline Observations with Interaction2020/11/1
- Measuring and Harnessing Transference in Multi-Task Learning2020/10/1
- Learning to be Safe: Deep RL with a Safety Critic2020/10/1
- Recovery RL: Safe Reinforcement Learning with Learned Recovery Zones2020/10/1
- Batch Exploration with Examples for Scalable Robotic Reinforcement Learning2020/10/1
- MELD: Meta-Reinforcement Learning from Images via Latent State Models2020/10/1
- Goal-Aware Prediction: Learning to Model What Matters2020/7/1
- Long-Horizon Visual Planning with Goal-Conditioned Hierarchical Predictors2020/6/1
- Deep Reinforcement Learning amidst Lifelong Non-Stationarity2020/6/1
- Never Stop Learning: The Effectiveness of Fine-Tuning in Robotic Reinforcement Learning2020/4/1
- Weakly-Supervised Reinforcement Learning for Controllable Behavior2020/4/1
- OmniTact: A Multi-Directional High Resolution Touch Sensor2020/3/1
- Scalable Multi-Task Imitation Learning with Autonomous Improvement2020/3/1
- Rapidly Adaptable Legged Robots via Evolutionary Meta-Learning2020/3/1
- Gradient Surgery for Multi-Task Learning2020/1/1
- Learning Predictive Models From Observation and Interaction2019/12/1
- Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning2019/10/1
- RoboNet: Large-Scale Multi-Robot Learning2019/10/1
- Hierarchical Foresight: Self-Supervised Learning of Long-Horizon Tasks via Visual Subgoal Generation2019/9/1
- End-to-End Robotic Reinforcement Learning without Reward Engineering2019/4/1
- Guided Meta-Policy Search2019/4/1
- Improvisation through Physical Understanding: Using Novel Objects as Tools with Visual Foresight2019/4/1
- NoRML: No-Reward Meta Learning2019/3/1
- Manipulation by Feel: Touch-Based Control with Deep Predictive Models2019/3/1
- Unsupervised Visuomotor Control through Distributional Planning Networks2019/2/1
- Reasoning About Physical Interactions with Object-Oriented Prediction and Planning2018/12/1
- Deep Online Learning via Meta-Learning: Continual Adaptation for Model-Based RL2018/12/1
- Visual Foresight: Model-Based Deep Reinforcement Learning for Vision-Based Robotic Control2018/12/1
- One-Shot Hierarchical Imitation Learning of Compound Visuomotor Tasks2018/10/1
- Few-Shot Goal Inference for Visuomotor Learning and Planning2018/10/1
- Time Reversal as Self-Supervision2018/10/1
- Robustness via Retrying: Closed-Loop Robotic Manipulation with Self-Supervised Learning2018/10/1
- Universal Planning Networks2018/4/1
- Stochastic Adversarial Video Prediction2018/4/1
- Learning to Adapt in Dynamic, Real-World Environments Through Meta-Reinforcement Learning2018/3/1
- Deep Reinforcement Learning for Vision-Based Robotic Grasping: A Simulated Comparative Evaluation of Off-Policy Methods2018/2/1
- One-Shot Imitation from Observing Humans via Domain-Adaptive Meta-Learning2018/2/1
- Self-Supervised Visual Planning with Temporal Skip Connections2017/10/1
- Stochastic Variational Video Prediction2017/10/1
- One-Shot Visual Imitation Learning via Meta-Learning2017/9/1
- Model-Agnostic Meta-Learning for Fast Adaptation of Deep Networks2017/3/1
- Generalizing Skills with Semi-Supervised Reinforcement Learning2016/12/1
- Reset-Free Guided Policy Search: Efficient Deep Reinforcement Learning with Stochastic Initial States2016/10/1
- Deep Visual Foresight for Planning Robot Motion2016/10/1
- Unsupervised Learning for Physical Interaction through Video Prediction2016/5/1
- Guided Cost Learning: Deep Inverse Optimal Control via Policy Optimization2016/3/1
- Deep Spatial Autoencoders for Visuomotor Learning2015/9/1
- Learning Deep Neural Network Policies with Continuous Memory States2015/7/1
- End-to-End Training of Deep Visuomotor Policies2015/4/1