Abhishek Gupta
収録論文 83本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 世界モデルによる汎化可能なロボット挿入マニピュレーション2026/9/23
手首カメラの視覚と固有感覚を統合した単一の世界モデルを最大90の挿入タスクで訓練し、未知形状の物体へのゼロショット挿入を実現した研究。
- 幾何変動下におけるロボット挿入の視覚的sim-to-real学習:鉄筋設置への応用sim2real2026/9/17
鉄筋挿入タスクを対象に、手続き的生成とドメインランダム化を用いた視覚ベースのsim-to-real学習システムを構築し、実機で91.3%の成功率を達成した。
- 潜在記憶宮殿:制御のための推論を自己回帰変分推論として捉える制御/強化学習2026/7/1
連続制御ポリシーに適応的な推論能力を持たせるため、自己回帰潜在空間での変分推論として推論を定式化し、潜在空間強化学習で変分下界を最適化する手法を提案した。
- 模倣学習のための差分認識検索ポリシー模倣学習2026/6/8
模倣学習の汎化性能を向上させるため、推論時に訓練データを再利用する半パラメトリックな検索ベース手法DARPを提案。局所近傍構造に基づいて行動を予測し、連続制御やロボット操作で標準的な行動クローニングより15-46%性能が向上した。
- サポート制約付きRLによる実世界経験なしの実世界ポリシー改善強化学習2026/6/1
実データで事前学習したポリシーをシミュレーション内でRLにより改善する際、生成ポリシーのサポートに制約を課すことで、転移可能な行動を保証しつつ性能を向上させる手法SCOREを提案。8つの器用な多指操作タスクで成功率を大幅に改善した。
- OGPO: 生成制御ポリシーのサンプル効率的な完全ファインチューニングロボット学習2026/5/1
拡散やフローベースの生成制御ポリシーを、オフポリシーな批判ネットワークとPPO目的関数を用いて効率的にファインチューニングする手法OGPOを提案し、操作タスクで最先端の性能を達成した。
- TMRL: 拡散タイムステップ変調による事前学習が効率的なポリシー微調整のための探索を可能にするロボット学習/強化学習2026/5/1
ロボットポリシーの事前学習と強化学習による微調整を橋渡しする統一フレームワークを提案。事前学習時に拡散ノイズを注入し、微調整時にタイムステップを動的調整することで探索を制御し、複雑な操作タスクの実機微調整を1時間以内で成功させる。
- シミュレーション蒸留:実世界への迅速な適応のためのシミュレーションでのワールドモデル事前学習ワールドモデル/sim2real2026/3/1
物理シミュレータから得た行動条件付き経験をワールドモデルに蒸留し、実世界ではエンコーダ等を固定して潜在ダイナミクスのみを更新することで、接触を伴う操作や歩行タスクで迅速な適応を実現する手法を提案した。
- 多様なリセットと大規模強化学習による創発的な器用さ器用操作/強化学習2026/3/1
シミュレータのリセットを多様化して強化学習に様々なロボットと物体の相互作用を経験させることで、単一の報酬関数と固定ハイパーパラメータで長時間の器用な操作タスクを解くフレームワークOmniResetを提案した。
- Robometer:軌道比較による汎用ロボット報酬モデルのスケーリング報酬モデリング2026/3/1
軌道内の進捗監督と軌道間の選好監督を組み合わせた報酬モデルを提案し、100万軌道のデータセットで学習することで、汎用性の高い報酬関数を実現した。
- SPARR: 実世界の非対称残差を組み合わせたシミュレーション方策による組立sim2real2026/2/1
シミュレーションで訓練した基本方策と実世界で学習する残差方策を組み合わせ、sim-to-realギャップを埋めて組立タスクの成功率とサイクルタイムを改善した手法。
- 残差フロー誘導による強化学習:器用なマニピュレーションのための適応手法マニピュレーション2026/2/1
事前学習済みのフローマッチング方策を、残差行動と潜在ノイズ分布を同時最適化する強化学習で微調整し、器用なマニピュレーションを効率的に適応させる手法を提案。
- Point Bridge: クロスドメイン方策学習のための3D表現sim2real2026/1/1
VLMで抽出した点群表現とTransformer方策を用い、合成データのみで実世界マニピュレーションのゼロショットsim-to-real転移を実現するフレームワーク。
- PolaRiS: 汎用ロボットポリシーのためのスケーラブルな実世界→シミュレーション評価sim2real2025/12/1
実世界の短い動画スキャンからニューラル再構成で高忠実度なシミュレーション環境を構築し、汎用ロボットポリシーを実世界と強く相関する形で評価できるようにしたフレームワーク。
- Refinery: 接触の多いタスク向け能動的ファインチューニングと展開時最適化マニピュレーション2025/10/1
ベイズ最適化によるファインチューニングとGMMベースの初期化選択で、接触の多い組立タスクの成功率を91.51%まで向上させ、多部品の長期組立も可能にした。
- VAMOS:能力に応じて調整可能な階層型視覚-言語-行動モデルによる誘導可能なナビゲーションナビゲーション2025/10/1
意味的計画と身体性の接地を分離した階層型VLAを提案し、車輪・脚型ロボット間のクロス身体性ナビゲーションと自然言語による誘導を実現した。
- 意味論的ワールドモデルVLA2025/10/1
未来のピクセルを再構成する代わりに、タスクに関連する意味情報を視覚的質問応答として予測するワールドモデルを提案し、VLMを活用してロボット制御の汎化性能を向上させた。
- ロボティクスにおけるリアルギャップ:課題・解決策・ベストプラクティスsim2real2025/10/1
シミュレーションと実環境の差異(リアルギャップ)の原因・解決手法・評価指標を体系的に整理したサーベイ。sim-to-real転移の現状と課題を概観する。
- 非専門家データを活用したオフライン強化学習による模倣学習のロバスト化模倣学習/オフライン強化学習2025/10/1
非専門家データ(プレイデータや不完全なデモ)をオフライン強化学習で活用し、模倣学習ポリシーの回復性と汎化性能を高める手法を提案。
- PEEK: ロボットマニピュレーションポリシーのゼロショット汎化のための誘導と最小画像表現マニピュレーション2025/9/1
VLMを使ってエンドエフェクタ経路とタスク関連マスクを予測し、ポリシーに必要な最小限の手がかりを与えることで、シミュレーションのみで訓練したポリシーの実世界ゼロショット汎化を大幅に向上させる手法を提案。
- VLMをロボット向けに:低レベル手順推論の自己批判的蒸留VLA2025/7/1
小さな視覚言語モデルが外部教師なしで自己批判・修正・検証を繰り返し、ロボット実行可能な手順計画を生成する自己改善フレームワークを提案。
- RoboArena:汎用ロボットポリシーの分散型実世界評価ロボット評価/ベンチマーク2025/6/1
評価者ネットワークが自由にタスクと環境を選び、ペア比較の二重盲検評価を集約することで、汎用ロボットポリシーをスケーラブルかつ公平にランキングする手法を提案し、7機関・600以上の実機評価で有効性を示した。
- ATK: タスク駆動型キーポイント自動選択によるロバストな方策学習模倣学習2025/6/1
タスクに応じて画像中の2Dキーポイントを自動選択し、それを用いて模倣学習を行うことで、sim-to-real転移や実世界タスクにおけるロバストな方策を実現する手法を提案。
- 拡散ポリシーを潜在空間強化学習で操縦するVLA2025/6/1
拡散ポリシーの潜在ノイズ空間に強化学習を適用し、実世界で効率的に自律適応させる手法DSRLを提案。
- DRAWER: 実環境のリアリズムを備えたデジタル再構築と関節構造の再現sim2real2025/4/1
室内シーンの動画から、細部まで再現されたフォトリアルで操作可能なデジタル環境を自動生成するフレームワークを提案し、ゲーム制作やロボティクスのsim-to-real転移に応用した。
- 統合ワールドモデル:大規模ロボットデータセットの事前学習に向けた動画と行動の拡散の結合VLA2025/4/1
行動拡散と動画拡散を単一のトランスフォーマーに統合し、拡散タイムステップを制御することで政策・順動力学・逆動力学・動画生成を柔軟に表現できるUWMを提案。大規模マルチタスクデータでの事前学習と行動なし動画からの学習を可能にした。
- SRSA: ロボット組立タスクのためのスキル検索と適応マニピュレーション2025/3/1
既存のスキルライブラリから新タスクに最も適したスキルを検索し、微調整することで、接触の多い組立タスクをデータ効率的に学習するフレームワークを提案。
- HAMSTER: オープンワールドロボット操作のための階層型行動モデルVLA2025/2/1
高レベルVLMが粗い2D経路を予測し、低レベル3D制御ポリシーが精密操作を行う階層型VLAモデルを提案。非ドメインデータを活用し、実機でのオープンワールド汎化を実現する。
- シミュレーション誘導ファインチューニングによる実世界への迅速な適応sim2real2025/2/1
シミュレータで学習した価値関数を実世界の探索に活用し、少ない実データで巧みな操作タスクへ適応させる手法を提案。
- STRAP: 拡張方策学習のためのロボットサブ軌道検索模倣学習2024/12/1
大規模なロボットデータからサブ軌道単位で関連データを検索し、テスト時に方策を適応的に学習する手法を提案。
- 超線形スケーリングを実現するロボット学習sim2real2024/12/1
クラウドソーシングで実世界シーンのデジタルツインを収集し、シミュレーション上で強化学習とモデル生成デモを組み合わせて、人間の労力に対して超線形的に性能が向上するデータ収集・学習パイプラインを提案。
- Sim-to-Realギャップの克服:探索方策の学習による実世界強化学習の効率化sim2real2024/10/1
シミュレータで直接方策を学習するのではなく、探索方策を学習して実世界に転移することで、サンプル効率を指数関数的に改善できることを理論と実験で示した。
- 意味的に制御可能な拡張による汎化可能なロボット学習sim2real2024/9/1
画像テキスト生成モデルをデータ拡張に活用し、ロボット操作データを多様化することで、未見の実環境への汎化を可能にする学習フレームワークを提案した。
- 変分選好学習による人間フィードバック強化学習の個人化RLHF2024/8/1
ユーザーごとの潜在変数を推論し、多様な選好に対応するマルチモーダルRLHF手法を提案。シミュレーションと言語データで報酬精度の向上を実証。
- URDFormer: 実世界画像から関節構造を持つシミュレーション環境を構築するパイプラインsim2real2024/5/1
実世界の画像から関節構造や物理特性を推定し、シミュレーションシーンを自動生成するURDFormerを提案。テキストから画像生成モデルを活用して学習データを生成し、大規模でリアルなシーン構築を可能にした。
- 連続性に基づく修正ラベルによるデータ効率的な微細マニピュレーションの模倣学習マニピュレーション2024/5/1
接触を伴う微細な操作タスクにおいて、実演データのみから局所連続なダイナミクスモデルを学習し修正ラベルを生成することで、模倣学習の誤差蓄積を軽減し、特に低データ領域で性能を向上させる手法を実機検証した。
- ASID: ロボットマニピュレーションにおけるシステム同定のための能動的探索マニピュレーション2024/4/1
少量の実世界データを用いてシミュレータを自律的に改良し、正確な制御戦略を計画する学習システムを提案。
- Rank2Reward: 受動的動画から整形報酬関数を学習模倣学習2024/4/1
タスク実行の動画からフレームの時間的順序を学習し、強化学習のための整形報酬関数を推論する手法を提案。
- DROID: 大規模実環境ロボットマニピュレーションデータセットマニピュレーション2024/3/1
北米・アジア・欧州の50名が12ヶ月かけて564シーン・84タスクで収集した76k軌道・350時間のロボット操作データセットを構築し、学習ポリシーの性能と汎化性能が向上することを示した。
- シミュレーションで現実を再現する:実世界からシミュレーションを経て実世界に戻るロバストマニピュレーション手法マニピュレーション2024/3/1
少量の実世界データからデジタルツインを構築し、強化学習で模倣学習ポリシーをロバスト化するreal-to-sim-to-realパイプラインを提案。
- SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning2024/1/1
- RoboHive: A Unified Framework for Robot Learning2023/10/1
- CCIL: Continuity-based Data Augmentation for Corrective Imitation Learning2023/10/1
- Autonomous Robotic Reinforcement Learning with Asynchronous Human Feedback2023/10/1
- Universal Visual Decomposer: Long-Horizon Manipulation Made Easy2023/10/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- RePo: Resilient Model-Based Reinforcement Learning by Regularizing Posterior Predictability2023/9/1
- Lifelong Robot Learning with Human Assisted Language Planners2023/9/1
- REBOOT: Reuse Data for Bootstrapping Efficient Real-World Dexterous Manipulation2023/9/1
- Breadcrumbs to the Goal: Goal-Conditioned Exploration from Human-in-the-Loop Feedback2023/7/1
- Fighting Uncertainty with Gradients: Offline Reinforcement Learning via Diffusion Score Matching2023/6/1
- Self-Supervised Reinforcement Learning that Transfers using Random Features2023/5/26
- Cherry-Picking with Reinforcement Learning : Robust Dynamic Grasping in Unstable Conditions2023/3/1
- TactoFind: A Tactile Only System for Object Retrieval2023/3/1
- GenAug: Retargeting behaviors to unseen situations via Generative Augmentation2023/2/1
- Pendulum Actuated Spherical Robot: Dynamic Modeling & Analysis for Wobble & Precession2023/1/1
- Wobble control of a pendulum actuated spherical robot2023/1/1
- Dexterous Manipulation from Images: Autonomous Real-World RL via Substep Guidance2022/12/1
- Learning Robust Real-World Dexterous Grasping Policies via Implicit Shape Augmentation2022/10/1
- Prediction of Maneuvering Status for Aerial Vehicles using Supervised Learning Methods2022/6/1
- Demonstration-Bootstrapped Autonomous Practicing via Multi-Task Reinforcement Learning2022/3/1
- Autonomous Reinforcement Learning: Formalism and Benchmarking2021/12/1
- MURAL: Meta-Learning Uncertainty-Aware Rewards for Outcome-Driven Reinforcement Learning2021/7/1
- Autonomous Reinforcement Learning via Subgoal Curricula2021/7/1
- Fully Autonomous Real-World Reinforcement Learning with Applications to Mobile Manipulation2021/7/1
- Reset-Free Reinforcement Learning via Multi-Task Learning: Learning Dexterous Manipulation Behaviors without Human Intervention2021/4/1
- AWAC: Accelerating Online Reinforcement Learning with Offline Datasets2020/6/1
- The Ingredients of Real-World Robotic Reinforcement Learning2020/4/1
- Gradient Surgery for Multi-Task Learning2020/1/1
- Reciprocal Collision Avoidance for General Nonlinear Agents using Reinforcement Learning2019/10/1
- Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning2019/10/1
- ROBEL: Robotics Benchmarks for Learning with Low-Cost Robots2019/9/1
- Guided Meta-Policy Search2019/4/1
- Soft Actor-Critic Algorithms and Applications2018/12/1
- Dexterous Manipulation with Deep Reinforcement Learning: Efficient, General, and Low-Cost2018/10/1
- Diversity is All You Need: Learning Skills without a Reward Function2018/2/1
- Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations2017/9/1
- Imitation from Observation: Learning to Imitate Behaviors from Raw Video via Context Translation2017/7/1
- Adapting Low-Cost Platforms for Robotics Research2017/5/1
- Learning Invariant Feature Spaces to Transfer Skills with Reinforcement Learning2017/3/1
- Learning Dexterous Manipulation Policies from Experience and Imitation2016/11/1
- Learning Modular Neural Network Policies for Multi-Task and Multi-Robot Transfer2016/9/1
- Learning Dexterous Manipulation for a Soft Robotic Hand from Human Demonstration2016/3/1