Jeannette Bohg
Stanford University
収録論文 115本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MessyMem: モバイルマニピュレーションのための経験から学ぶ永続メモリマニピュレーション2026/9/14
モバイルマニピュレータが過去の経験を永続的に記憶し、物体や場所の知識を再利用できるメモリシステムを提案。25タスクの連続シミュレーションで高いタスク進捗を達成した。
- 1つのデモで多様な物体へ:局所接触形状による操作の一般化マニピュレーション2026/9/1
人間のデモから学習し、接触点周りの局所形状に注目した報酬設計で、多指ロボットハンドの操作を未見の物体へ一般化する手法を提案した。
- 接触を伴うタスクにおけるVLAの失敗原因の解明とその修正方法VLA/接触操作2026/8/1
視覚言語行動モデルが接触を伴う操作タスクで失敗する原因を2つのモードに分類し、それぞれに特化した対策を組み合わせたFACTを提案。実機2500回の評価で成功率66%を達成した。
- フレーム混合ポリシー:双腕移動操作のためのマルチフレーム行動ノイズ除去拡散ポリシー/双腕操作/移動操作2026/7/1
拡散ベースの視覚運動ポリシーにおいて、複数の座標フレームで同期して行動ノイズ除去を行う新しい手法を提案し、シミュレーションと実機の双腕移動操作タスクで性能を実証した。
- Play2Perfect:精密組立のための巧みなプレイ事前学習で重要な要素は何か?ロボット学習2026/6/1
多指ロボットが精密組立を達成するために、まず多様な物体と目標でタスク非依存のプレイ事前学習を行い、その後精密組立にファインチューニングするRLフレームワークPlay2Perfectを提案し、事前学習の設計選択がサンプル効率と実機転送に与える影響を体系的に調査した。
- CHORUS: 単一VLAポリシーによる分散型マルチエンボディ協調群制御2026/6/1
事前学習済みの視覚言語行動(VLA)モデルの基盤を活用し、各ロボットが自身の観測のみで分散協調できるフレームワークCHORUSを提案。実世界実験で既存手法より高い性能を示した。
- ロックインの打破:低データVLA後訓練における操縦性の維持VLA2026/4/1
低データでの後訓練後にVLAポリシーが新しい指示に応答しなくなる「ロックイン」現象を特定し、視覚的接地の維持とテスト時の対照的プロンプトガイダンスによりこれを緩和するDeLockを提案した。
- HoMMI: 人間のデモンストレーションから全身移動マニピュレーションを学習移動マニピュレーション2026/3/1
ロボットを使わずに人間のデモンストレーションから全身移動マニピュレーションを学習するデータ収集・方策学習フレームワークを提案し、自己中心視センシングと身体差を埋めるハンド・アイ方策設計により長期的な移動操作タスクを実現した。
- SimToolReal: 物体中心方策によるゼロショット巧みな道具操作sim2real2026/2/1
多様な道具形状をシミュレーションで大量生成し、ランダムな目標姿勢へ操作する単一の強化学習方策を訓練することで、実機で未知の道具をゼロショットで巧みに操作できるようにした研究。
- 基盤モデルはロボティクスにおけるフルスタック転移への道か?転移学習2026/2/1
ロボティクスにおける転移学習を言語から運動技能までの階層で整理し、基盤モデルやTransformerが「フルスタック転移」にどう貢献するかを概観した記事。
- ロボット駆動データフライホイール:実環境展開による継続的データ収集と基盤モデル適応VLA2025/11/1
ロボットを実環境に配備してタスク遂行中に実世界データを収集し、基盤モデルを継続的に改善する「データフライホイール」枠組みを提案。図書館で2週間稼働した移動マニピュレータScanfordで、VLMの書架スキャンと自動ラベリングによりドメイン特化・隣接タスクの性能を向上させた。
- Masquerade: データ編集による野生の人間動画からのロボット学習模倣学習2025/8/1
人間の一人称視点動画をロボットの腕に置き換えて編集し、その動画でロボット政策を事前学習・微調整することで、少ない実演データでも汎化性能を大幅に向上させる手法を提案。
- マルチモーダル力覚センシングと模倣学習による密集クラッタからの優しい物体引き抜きマニピュレーション2025/8/1
密集した物体群からロボットが物体を安全に引き抜くため、視覚・固有感覚・触覚・関節トルク・吸着監視を統合した模倣学習を提案し、力覚情報の有効性を検証した。
- 視覚運動ポリシー学習のための制約保持データ生成マニピュレーション2025/8/1
単一の専門家軌道から、新しい物体形状や姿勢を含むロボット実演を生成し、実世界にゼロショット転移する閉ループ視覚運動ポリシーを訓練する手法を提案。
- 視覚言語モデルによる巧みな操作の足場構築マニピュレーション2025/6/1
視覚言語モデルを使ってタスクに関連するキーポイントを特定し、手と物体の粗い3D軌道を生成して、シミュレーションで残差強化学習方策を訓練する手法を提案。
- 行動の中の視覚:人間の実演から能動的知覚を学ぶマニピュレーション2025/6/1
6自由度のロボット首とVRテレオペレーションを用いて、人間の能動的知覚戦略を実演から直接学習し、視覚遮蔽を含む両腕マニピュレーションタスクで高い性能を達成した。
- HoMeR: ハイブリッド模倣と全身制御による実環境モバイルマニピュレーションの学習モバイルマニピュレーション2025/6/1
全身制御と絶対/相対のハイブリッド行動を組み合わせ、家庭内でのモバイルマニピュレーションを少数のデモで学習する模倣学習フレームワークを提案。
- CUPID: 影響関数でロボットが好むデータを選別模倣学習2025/6/1
模倣学習において、各デモンストレーションが方策の性能に与える影響を影響関数で推定し、有害なデータを除去・有益なデータを選択するデータキュレーション手法を提案。
- 微小重力下でのAstrobeeによる変形可能な貨物輸送マニピュレーション2025/5/1
NASAのAstrobeeロボットを用いた貨物操作・輸送タスクのためのPythonシミュレーション環境と制御スタックを開発し、サンプリングベースMPCで変形可能な貨物の制御に成功した。
- Mobi-π: ロボット学習ポリシーのモビライゼーションマニピュレーション2025/5/1
限られた視点で学習したマニピュレーションポリシーを移動ロボットで活用するため、3Dガウススプラッティングとサンプリング最適化により、ポリシーの分布内となるベース姿勢を探索する手法を提案。
- SLAG: スケーラブルな言語拡張ガウシアンスプラッティング3Dシーン理解2025/5/1
2D視覚言語モデルの特徴を3Dガウシアンシーンに統合し、損失関数不要の並列化可能な手法とベクトルデータベースで大規模シーンの言語埋め込みを高速化したマルチGPUフレームワーク。
- 人間の実演1本からロボットの巧みな操作を学習するSim-to-Real強化学習sim2real2025/4/1
人間のRGB-D動画1本だけから物体の軌道と手の初期姿勢を抽出し、シミュレーション上の強化学習で身体差を埋めてロボットの巧みな操作方策を学習する手法を提案。
- Shadow: セグメンテーションマスクを活用した異なるロボット間のポリシー転移sim2real2025/3/1
訓練時と評価時にロボットをソースとターゲットの合成セグメンテーションマスクに置き換えることで、単一のロボットアームの専門家軌道から別のロボットアームへポリシーを効率的に転移させる手法を提案。
- Phantom: 人間の動画だけでロボットを訓練する模倣学習2025/3/1
人間の動画デモから手の姿勢推定と視覚編集でロボット用の観測・行動ペアを生成し、ロボットデータなしで操作方策を訓練するフレームワーク。実機で最大92%の成功率を達成。
- モーショントラック:少数ショット模倣学習における人間-ロボット転移のための統一表現模倣学習2025/1/1
人間の手とロボットのエンドエフェクタの動きを画像上の短い2D軌跡(モーショントラック)として統一的に表現し、少数の人間動画とロボット実演から模倣学習ポリシーを訓練する手法を提案。実世界4タスクで86.5%の成功率を達成。
- 力覚を考慮した自律ロボット手術医療ロボティクス2025/1/1
da Vinci研究用ロボットで組織の牽引を模倣学習により自動化し、力覚センサを入力に加えることで成功率と組織への優しさが大きく向上することを示した。
- DexForce: 力情報を活用した巧みな操作のためのキネステティック実演からの行動抽出マニピュレーション2025/1/1
キネステティック実演中に計測した接触力を用いて力情報を反映した行動を計算し、接触の多い巧みな操作タスクの模倣学習を可能にする手法を提案。
- TidyBot++: ロボット学習のためのオープンソース全方向移動マニピュレータ移動マニピュレーション2024/12/1
模倣学習による家庭内移動マニピュレーションのデータ収集を容易にするため、動力付きキャスタで全方向移動を実現し、任意のアームを搭載できる低コストなオープンソース移動マニピュレータを提案した。スマホ遠隔操作インタフェースで収集したデータから学習した方策が家庭内タスクを実行できることを示した。
- 注目点を活用したハイブリッド模倣学習模倣学習2024/12/1
点群からタスクに関連する注目点を推定し、遠距離移動はウェイポイント、精密動作は手首画像からの密な動作で予測する模倣学習手法を提案。
- 生成ポリシーの失敗モードを解き明かす:一貫性と進捗のランタイムモニタリングVLA2024/10/1
模倣学習ポリシーの失敗を、行動の時間的一貫性の統計的監視とVLMによるタスク進捗監視を組み合わせて検出するランタイム監視フレームワークSentinelを提案。
- APRICOT: LLMを用いた能動的選好学習と制約を考慮したタスクプランニングタスクプランニング2024/10/1
冷蔵庫への物品整理のような制約空間での作業において、LLMによるベイズ能動的選好学習と制約を考慮したタスクプランニングを組み合わせ、ユーザーの選好を推定しつつ環境制約に適応した計画を生成する手法を提案した。
- ニューラルアテンションフィールド:3Dシーンにおける点間関連性の創発とワンショット巧み把持マニピュレーション2024/10/1
3D空間の任意のクエリ点とシーン点群のクロスアテンションを計算するトランスフォーマーデコーダを自己教師あり学習し、ワンショット実演から新しいシーンで巧みな把持を実現する手法を提案。
- 掴みを極める:大規模多指把持評価によるロバストなsim-to-real転移マニピュレーション2024/10/1
350万件の把持データセットを公開し、視覚ベースの把持評価器を学習させることで、多指ロボットハンドの実世界把持を高精度に実現した。
- Points2Plans: 点群から長期計画を生成する構成可能な関係力学モデルマニピュレーション2024/8/1
部分視点の点群と言語指示から、関係力学モデルを連続・記号表現の橋渡しとして使い、長期マニピュレーション計画をゼロショットで生成するフレームワーク。
- EquiBot: 汎化性とデータ効率を両立するSIM(3)同変拡散ポリシーマニピュレーション2024/7/1
拡散ポリシーにSIM(3)同変なネットワークを組み合わせ、スケール・回転・並進の変化に不変なロボットマニピュレーション方策を実現した。各タスク5分の実演だけで新しい物体や環境に汎化できる。
- 一貫性ポリシー:一貫性蒸留による視覚運動ポリシーの高速化VLA2024/5/1
事前学習済みDiffusion Policyから一貫性蒸留することで、推論を桁違いに高速化しつつ成功率を維持する視覚運動制御ポリシーを提案した。
- COAST: 制約とストリームによるタスク・動作計画タスク・動作計画2024/5/1
ストリームベースの動作計画と制約付きタスク計画を組み合わせた確率的完全なTAMPアルゴリズムを提案し、複雑なタスクで従来手法より一桁速く解けることを示した。
- SpringGrasp: 形状不確かさ下での柔軟で器用な把持の合成マニピュレーション2024/4/1
物体形状の不確かさを考慮し、柔軟な把持を計画する微分可能な指標SpringGraspを提案。実機実験で高い把持成功率を達成。
- RT-Sketch: 手描きスケッチによる目標条件付き模倣学習模倣学習2024/3/1
手描きスケッチを目標指定に用いる操作ポリシーを提案し、言語や画像条件よりも曖昧さや視覚的妨害に頑健であることを示した。
- DROID: 大規模実環境ロボットマニピュレーションデータセットマニピュレーション2024/3/1
北米・アジア・欧州の50名が12ヶ月かけて564シーン・84タスクで収集した76k軌道・350時間のロボット操作データセットを構築し、学習ポリシーの性能と汎化性能が向上することを示した。
- 触覚情報に基づく行動プリミティブによる密集環境でのジャミング緩和マニピュレーション2024/2/1
密集した横方向アクセスシーンで物体を回収する際、隣接物体や壁とのジャミングを解消するために、掘削と穴掘りの2つの行動プリミティブを提案し、触覚と固有感覚情報を用いた閉ループハイブリッド制御で成功率を10倍に向上させた。
- Robot Fine-Tuning Made Easy: Pre-Training Rewards and Policies for Autonomous Real-World Reinforcement Learning2023/10/1
- AO-Grasp: Articulated Object Grasp Generation2023/10/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- EquivAct: SIM(3)-Equivariant Visuomotor Policies beyond Rigid Object Manipulation2023/10/1
- KITE: Keypoint-Conditioned Policies for Semantic Manipulation2023/6/1
- The ObjectFolder Benchmark: Multisensory Learning with Neural and Real Objects2023/6/1
- TidyBot: Personalized Robot Assistance with Large Language Models2023/5/1
- CARTO: Category and Joint Agnostic Reconstruction of ARTiculated Objects2023/3/1
- Text2Motion: From Natural Language Instructions to Feasible Plans2023/3/1
- Development and Evaluation of a Learning-based Model for Real-time Haptic Texture Rendering2022/12/1
- Learning Tool Morphology for Contact-Rich Manipulation Tasks with Differentiable Simulation2022/11/1
- Active Task Randomization: Learning Robust Skills via Unsupervised Generation of Diverse and Feasible Tasks2022/11/1
- STAP: Sequencing Task-Agnostic Policies2022/10/1
- In-Hand Manipulation of Unknown Objects with Tactile Sensing for Insertion2022/10/1
- Whisker-Inspired Tactile Sensing for Contact Localization on Robot Manipulators2022/10/1
- Rethinking Optimization with Differentiable Simulation from a Global Perspective2022/7/1
- Deep Learning Approaches to Grasp Synthesis: A Review2022/7/1
- Category-Independent Articulated Object Tracking with Factor Graphs2022/5/1
- Visuomotor Control in Multi-Object Scenes Using Object-Aware Representations2022/5/1
- DiffCloud: Real-to-Sim from Point Clouds with Differentiable Simulation and Rendering of Deformable Objects2022/4/1
- ObjectFolder 2.0: A Multisensory Object Dataset for Sim2Real Transfer2022/4/1
- Symbolic State Estimation with Predicates for Contact-Rich Manipulation Tasks2022/3/1
- A Bayesian Treatment of Real-to-Sim for Deformable Object Manipulation2021/12/1
- From Machine Learning to Robotics: Challenges and Opportunities for Embodied Intelligence2021/10/1
- Vision-Only Robot Navigation in a Neural Radiance World2021/10/1
- TrajectoTree: Trajectory Optimization Meets Tree Search for Planning Multi-contact Dexterous Manipulation2021/9/1
- Grounding Predicates through Actions2021/9/1
- Learning Periodic Tasks from Human Demonstrations2021/9/1
- Learning Latent Actions to Control Assistive Robots2021/7/1
- XIRL: Cross-embodiment Inverse Reinforcement Learning2021/6/1
- Differentiable Factor Graph Optimization for Learning Smoothers2021/5/1
- OmniHang: Learning to Hang Arbitrary Objects using Contact Point Correspondences and Neural Collision Estimation2021/3/1
- Interpreting Contact Interactions to Overcome Failure in Robot Assembly Tasks2021/1/1
- Dexterous Manipulation Primitives for the Real Robot Challenge2021/1/1
- How to Train Your Differentiable Filter2020/12/1
- Detect, Reject, Correct: Crossmodal Compensation of Corrupted Sensors2020/12/1
- Probabilistic 3D Multi-Modal, Multi-Object Tracking for Autonomous Driving2020/12/1
- Multimodal Sensor Fusion with Differentiable Filters2020/10/1
- Learning Topological Motion Primitives for Knot Planning2020/9/1
- GRAC: Self-Guided and Self-Regularized Actor-Critic2020/9/1
- Learning User-Preferred Mappings for Intuitive Robot Control2020/7/1
- Dynamic Multi-Robot Task Allocation under Uncertainty and Temporal Constraints2020/5/1
- Probabilistic 3D Multi-Object Tracking for Autonomous Driving2020/1/1
- Accurate Vision-based Manipulation through Contact Reasoning2019/11/1
- Object-Centric Task and Motion Planning in Dynamic Environments2019/11/1
- Self-Supervised Learning of State Estimation for Manipulating Deformable Linear Objects2019/11/1
- Learning to Scaffold the Development of Robotic Manipulation Skills2019/11/1
- Learning Task-Oriented Grasping from Human Activity Datasets2019/10/1
- UniGrasp: Learning a Unified Model to Grasp with Multifingered Robotic Hands2019/10/1
- Learning from My Partner's Actions: Roles in Decentralized Robot Teams2019/10/1
- Learning Hierarchical Control for Robust In-Hand Manipulation2019/10/1
- MeteorNet: Deep Learning on Dynamic 3D Point Cloud Sequences2019/10/1
- Learning an Action-Conditional Model for Haptic Texture Generation2019/9/1
- Making Sense of Vision and Touch: Learning Multimodal Representations for Contact-Rich Tasks2019/7/1
- Variable Impedance Control in End-Effector Space: An Action Space for Reinforcement Learning in Contact-Rich Tasks2019/6/1
- Learning Manipulation under Physics Constraints with Visual Perception2019/4/1
- Making Sense of Vision and Touch: Self-Supervised Learning of Multimodal Representations for Contact-Rich Tasks2018/10/1
- Leveraging Contact Forces for Learning to Grasp2018/9/1
- Grasp success prediction with quality metrics2018/9/1
- ClusterNet: 3D Instance Segmentation in RGB-D Images2018/7/1
- Motion-based Object Segmentation based on Dense RGB-D Scene Flow2018/4/1
- Acquiring Target Stacking Skills by Goal-Parameterized Deep Reinforcement Learning2017/11/1
- Combining Learned and Analytical Models for Predicting Action Effects from Sensory Data2017/10/1
- Real-time Perception meets Reactive Motion Generation2017/3/1
- Probabilistic Articulated Real-Time Tracking for Robot Manipulation2016/10/1
- Latest Datasets and Technologies Presented in the Workshop on Grasping and Manipulation Datasets2016/9/1
- On the Fundamental Importance of Gauss-Newton in Motion Optimization2016/5/1
- Automatic LQR Tuning Based on Gaussian Process Global Optimization2016/5/1
- Interactive Perception: Leveraging Action in Perception and Perception in Action2016/4/1
- Depth-Based Object Tracking Using a Robust Gaussian Filter2016/2/1
- The Coordinate Particle Filter - A novel Particle Filter for High Dimensional Systems2015/5/1
- Probabilistic Object Tracking using a Range Camera2015/5/1
- Policy Learning with Hypothesis based Local Action Selection2015/3/1
- Data-Driven Grasp Synthesis - A Survey2013/9/1