Jitendra Malik
Amazon FAR
収録論文 113本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 反実仮想動画生成によるスケーラブルなヒューマノイドの移動操作移動操作2026/9/29
少数の実動画から反実仮想の人間-物体インタラクション動画を大量生成し、実→シミュ→実のパイプラインで物理的に妥当な軌道に変換して、多様な物体の運搬を実機で実現する方策を学習した。
- 形態模倣:形態と接触を考慮したハンドリターゲティングからSim-to-Real視覚運動ポリシーへsim2real2026/9/23
人間の手と物体の相互作用を、形態最適化・残差強化学習・視覚運動ポリシー蒸留の3段階でロボットハンドに転移し、ゼロショットで実世界に展開するフレームワークを提案。
- オープンボキャブラリなシーン地図構築のためのシーン言語モデルシーン理解2026/9/18
シーン全体を構造化テキストの物体リストとして保持し、画像入力ごとに追加・編集・削除で地図を更新するSceneLMを提案。専用モジュール構成の従来手法と同等性能を6〜12倍コンパクトな表現で実現し、四足歩行ロボット上でのオンライン動作も示した。
- 物理的インタラクションの学習:触覚・力覚を考慮したロボット学習のサーベイ触覚・力覚学習2026/8/1
触覚・力覚センシングを統合したロボット学習手法を、マルチモーダルかつ多段階のシステム設計の観点から統一的な分類学TF-ARTを用いて整理し、今後の研究課題を考察したサーベイ論文。
- 私の真似をして:日常の人間ビデオからの器用な操作データ器用操作/データ生成2026/6/17
単眼RGBの人間ビデオから手と物体のインタラクションを再構築し、多指ロボットハンドの実行可能な操作軌道へとリターゲティングするアルゴリズムを提案した。
- 視覚運動制御のための対比的行動-画像事前学習視覚エンコーダ/事前学習/模倣学習2026/6/15
大規模な人間の第一人称ビデオから手のキーポイントを行動の代理として抽出し、対比学習でロボットの視覚エンコーダを事前学習する手法を提案。実機の器用操作タスクで既存手法を30%以上上回る性能を達成した。
- T-Rex: 触覚反応型巧みな操作触覚/操作2026/6/1
触覚信号に動的に反応する操作を実現するため、大規模な触覚データセットと可変レートのMixture-of-Transformersアーキテクチャを導入し、12の操作タスクで成功率を大幅に向上させた。
- FARM: 関係空間記憶を用いた任意物体の発見物体検索/空間記憶/VLM2026/6/1
ロボットが「ダーツボードの下の背の高いランプ」のような関係的な指示で物体を見つけられるよう、実時間で物体レベルの空間記憶を構築し、VLMでクエリを解析して検索するシステムを提案した。
- オープンデータ・訓練・評価によるスケーラブルな行動クローニング行動クローニング2026/6/1
大規模な遠隔操作データセットABC-130K(3500時間、13万エピソード)とオープンソースのハードウェア・訓練・シミュレーション基盤を公開し、行動クローニングの再現可能な研究基盤を提供した。
- ForceBand: sEMGを用いた力強い操作の学習マニピュレーション2026/6/1
筋電位センサを搭載したリストバンドで人間の指先の力を推定し、力情報を含むデモンストレーションを生成してロボットの力制御を学習する手法を提案した。
- ロボット学習のためのワールドモデル:包括的サーベイサーベイ2026/5/1
ロボット学習におけるワールドモデルの役割と進化を体系的にレビューし、ポリシー学習、シミュレーション、評価への応用や課題を整理したサーベイ論文。
- MonoDuo: 1本のロボットアームで両腕ポリシーを学習するマニピュレーション2026/5/1
単腕ロボットのデモと人間の協調動作から、両腕ロボットの操作ポリシーを学習するフレームワークを提案。合成デモにより未見の両腕ロボット構成へのゼロショット転移を実現した。
- バイナリを超えて:物理に基づく接触表現によるシミュレーションから実世界への巧みな操作触覚/シミュレーション転移2026/5/1
触覚データを物理原理に基づく圧力中心(CoP)表現に変換し、シミュレーションから実世界へのゼロショット転移を可能にする手法を提案。多指ハンドでのピン穴挿入とボールバランス課題で有効性を実証した。
- ナイフで皮をむく方法:細粒度操作と人間の好みの整合マニピュレーション2026/3/1
ナイフでの皮むきを例に、力覚を考慮した模倣学習と人間の好みに基づく報酬モデルで、連続的で主観的な成功基準を持つ操作タスクを学習する枠組みを提案した。
- PTLD: 触覚潜在一貫性蒸留によるシミュレーションから実世界への巧みな操作触覚/操作/sim2real2026/3/1
触覚センサのシミュレーションを必要とせず、実世界の特権センサから収集したデータを用いて触覚入力に基づく状態推定器を蒸留し、シミュレーションで訓練した操作ポリシーを向上させる手法を提案した。
- D-REX: 巧みな把持学習のための微分可能な実世界-シミュレーション-実世界エンジン把持/シミュレーション2026/3/1
ガウススプラット表現を用いた微分可能エンジンを構築し、実世界の視覚観測とロボット制御信号から物体質量を同定しつつ、把持ポリシーを同時学習する手法を提案。
- DreamDojo: 大規模人間動画から学ぶ汎用ロボット世界モデル世界モデル2026/2/1
44,000時間の一人称視点人間動画から汎用的なロボット世界モデルを学習し、連続潜在行動を代理ラベルとして活用することで、巧みな操作の物理理解と精密な行動制御を実現した研究。
- TactAlign: 触覚アライメントによる人間からロボットへのポリシー転送触覚2026/2/1
触覚グローブで収集した人間の触覚信号を、異なる身体を持つロボットに転送するクロスエンボディメント触覚アライメント手法を提案。ペアデータ不要で、接触の多いタスクでのポリシー転送性能を向上させる。
- マルチエージェント相互作用のための拡散強制シーケンスモデリング動作生成2025/12/1
複数人の動作生成を単一の自己回帰拡散モデルで統一的に扱い、ペア・多人数の予測や長期生成を可能にした研究。
- 選択ポリシーによる協調型ヒューマノイドマニピュレーションマニピュレーション2025/12/1
モジュール式遠隔操作で収集したデータを用い、複数の候補行動を生成・評価する模倣学習「Choice Policy」でヒューマノイドの全身協調マニピュレーションを実現した。
- 生成された人間動画から物理的に妥当なロボット軌道へヒューマノイド2025/12/1
生成動画から人間の動きを4D表現に変換し、強化学習方策GenMimicでヒューマノイドの物理的に安定した動作として再現する手法を提案。
- OSMO: 人間からロボットへの技能転移のためのオープンソース触覚グローブ触覚2025/12/1
人間とロボットの両方が同じ触覚グローブを装着し、人間の触覚データから直接ロボット政策を学習することで、接触を伴う拭き取り作業を72%の成功率で実現した。
- 不完全なシミュレーションから器用な操作スキルを学習するsim2real2025/12/1
シミュレーションで学習した方策をテレオペレーションのスキルプリミティブとして使い実世界の触覚・固有感覚データを収集し、触覚入りの行動クローニングでナット締めやネジ回しを実現するsim-to-realフレームワークを提案。
- 大規模動画プランナーによる汎用ロボット制御VLA2025/12/1
インターネット規模の人間活動動画で生成的なロボット計画モデルを基盤モデル規模で学習し、新しい場面やタスクに対してゼロショットで動画計画を生成して実機の行動に変換する手法を提案した。
- スマートレンズから器用さを獲得:日常環境での人間デモによる多指ロボットマニピュレーションマニピュレーション2025/11/1
Aria Gen 2グラスで日常環境の人間の手の動きを収集し、ロボットデータなしで多指ハンドの3D点ベース方策を学習するフレームワークAINAを提案。
- DIPOLE: 視覚と幾何を融合したロバストな視覚運動汎化VLA2025/11/1
視覚と言語・幾何の相補的なモダリティを訓練時のドロップアウトとクロスアテンションで融合し、照明や視点変化に強い拡散ポリシーを実現した。
- SPIDER: スケーラブルな物理情報に基づく巧みなリターゲティングリターゲティング2025/11/1
人間の運動データを物理シミュレーションでロボットの動的に実行可能な軌道に変換し、大規模な巧みな操作ポリシー学習を可能にするフレームワークを提案。
- ランダムなおもちゃで遊んで何でも掴めるようになる学習マニピュレーション2025/10/1
球・直方体・円柱・リングの4つの基本形状をランダムに組み合わせた「おもちゃ」で訓練することで、実世界の多様な物体をゼロショットで掴める汎化可能な把持方策を実現した研究。
- エンドツーエンド強化学習による器用な把持政策の改善マニピュレーション2025/9/1
シミュレータと強化学習を別々のGPUに分散する手法を提案し、視覚ベースのエンドツーエンド学習を効率化して、深度を用いた器用な把持政策を訓練・蒸留した。
- 人間の運動予測モデルを模倣した深層感覚運動制御感覚運動制御2025/8/1
人間の運動予測モデルをロボットの感覚運動ポリシー訓練に活用し、強化学習でタスクを達成する手法を提案。人間とロボットのキーポイント運動の類似性を利用し、ゼロショットで予測モデルを適用する。
- シミュレーションの音:生成的音声でマルチモーダルなsim-to-realロボット方策を学習sim2real2025/7/1
物理シミュレータに大規模生成モデルを統合し、映像に条件づけたリアルな音声を合成することで、実機データなしに注ぐタスクのマルチモーダル方策を学習し、未知の容器や液体へのゼロショット転移を実現した。
- 全身姿勢に条件付けられた一人称視点動画予測動画予測2025/6/1
過去の動画と3D身体姿勢の動作から、一人称視点の未来動画を自己回帰拡散トランスフォーマーで予測するモデルPEVAを提案し、大規模データセットNymeriaで学習・評価した。
- ViTacFormer:視触覚クロスモーダル表現による巧みなマニピュレーションマニピュレーション2025/6/1
視覚と触覚をクロスアテンションで融合し、将来の触覚信号を予測する自己回帰ヘッドを備えた表現学習手法を提案。多指ハンドの模倣学習に応用し、実世界タスクで成功率を約50%向上させ、11段階・2.5分の長期的操作を自律遂行した。
- SkillBlender:スキルブレンドによる汎用人型ロコマニピュレーションロコマニピュレーション2025/6/1
目標条件付きの汎用プリミティブスキルを事前学習し、それらを動的にブレンドすることで、タスク固有の報酬設計を最小限に抑えつつ多様な人型ロコマニピュレーションを実現する階層型強化学習フレームワークを提案。
- ロドリゲスネットワーク:ロボット動作学習のためのキネマティクス誘導バイアス模倣学習2025/6/1
関節系の運動学構造を反映した帰納バイアスを持つニューラル演算子「Neural Rodrigues Operator」を提案し、それを用いた動作処理特化型ネットワークRodriNetを構築。模倣学習や単眼3Dハンド再構成で有効性を示した。
- DexGarmentLab: 巧みな衣類操作のための環境と汎化可能な方策マニピュレーション2025/5/1
両手での巧みな衣類操作に特化した大規模シミュレーション環境DexGarmentLabを構築し、単一の実演から多様な軌道を自動生成する手法と、形状・変形の多様性に汎化する階層的な操作方策HALOを提案した。
- 視覚的模倣による文脈依存型ヒューマノイド制御全身制御2025/5/1
日常動画から人間と環境を再構成し、階段昇降や椅子への着座など周囲の状況に応じた全身制御方策をヒューマノイドに学習させるreal-to-sim-to-realパイプラインを提案。
- RoboVerse:スケーラブルで汎化可能なロボット学習のための統合プラットフォーム・データセット・ベンチマークsim2real2025/4/1
複数のシミュレータとロボット形態に対応する統合シミュレーション基盤MetaSimと、高品質な合成データセット、模倣学習・強化学習の統一ベンチマークを提供するフレームワークを提案。
- OTTER: テキスト認識型視覚特徴抽出を備えた視覚-言語-行動モデルVLA2025/3/1
言語指示に意味的に対応する視覚特徴だけを選択的に抽出して行動予測に用いるVLAアーキテクチャを提案し、事前学習済みの視覚言語モデルを凍結したまま高いゼロショット汎化を実現した。
- DexterityGen:前例のない器用さを実現する基盤コントローラマニピュレーション2025/2/1
強化学習で大規模な器用な動作プリミティブを事前学習し、それを基に基盤コントローラを訓練。人間の遠隔操作をプロンプトとして実世界で高度な器用操作を実現する。
- ヒューマノイドの視覚ベース巧みな操作のためのSim-to-Real強化学習sim2real2025/2/1
ヒューマノイドロボットの視覚ベース両手巧みな操作を実現するSim-to-Real強化学習の実践的レシピを提案し、把持・持ち上げ・受け渡しタスクで高い成功率を示した。
- 単純な技能から複雑な技能へ:ハンド内物体再配向の事例マニピュレーション2025/1/1
既存の回転スキルを再利用した階層的方策により、シミュレーションから実世界への転移が容易で外乱に頑健なハンド内物体再配向を実現し、固有感覚情報と低レベルスキル予測から物体姿勢を推定する手法も提案した。
- 大規模人間動画から学ぶ汎用人型ポーズ制御VLA2024/12/1
2000万件超の人間動画から人型ロボットのポーズとテキスト指示のデータセットHumanoid-Xを構築し、テキスト入力で人型ロボットを制御する大規模モデルUH-1を学習した。
- 最小限のフィードバックでアラインメントを最大化:視覚運動ロボット政策のアラインメントのための効率的な報酬学習VLA2024/12/1
視覚運動ロボット政策を人間の選好に合わせるため、事前学習済み視覚エンコーダを微調整し特徴マッチングで密な視覚報酬を構築するRAPLを提案。従来のRLHFより5倍少ない人間フィードバックでアラインメントを実現。
- 人工多モーダル指先による触覚のデジタル化触覚2024/11/1
高解像度センサとオンデバイスAIを備えた半球状の人工指先を開発し、触覚・振動・熱・匂いを多モーダルに検出できることを示した論文。
- 難地形を歩行するヒューマノイドの学習歩行2024/10/1
固有感覚と行動の履歴から次行動を予測するTransformerを平坦地で事前学習し強化学習で不整地に微調整することで、実機ヒューマノイドが未整備の自然地形や急斜面を安定して歩行できるようにした。
- 動画からの手と物体のインタラクション事前学習マニピュレーション2024/9/1
野生の動画から人間の手と物体の3D軌道を抽出し、ロボットの操作スキルを事前学習する手法を提案。生成モデルで汎用的な操作の事前分布を獲得し、下流タスクへの適応を効率化する。
- 極限適応を実現する学習ベースのクアッドコプター制御器制御/適応2024/9/1
模倣学習と強化学習を組み合わせ、機体パラメータをセンサ履歴から推定することで、質量・サイズ・アクチュエータ性能が大きく異なるクアッドコプターに適応する低レベル制御器を開発した。
- ペンを回す学習から得られた教訓マニピュレーション2024/7/1
シミュレーションで強化学習と軌道データを生成し、実世界で微調整することで、ペンのような物体を手の中で回転させる技能を習得した研究。
- せん断力と垂直力を感知する触覚スキンを用いた手内平行移動の学習触覚2024/7/1
触覚スキンのセンサモデルを提案し、せん断力と垂直力を用いた強化学習方策で手内での物体操作を実現、実機実験で有効性を示した。
- 視触覚データを用いた双腕多指ハンドによる技能学習マニピュレーション2024/4/1
低コストな双腕多指ハンドの遠隔操作システムHATOを開発し、触覚センサ付き義手を転用して視触覚データを収集、長期的で高精度なタスクを学習させた。
- DROID: 大規模実環境ロボットマニピュレーションデータセットマニピュレーション2024/3/1
北米・アジア・欧州の50名が12ヶ月かけて564シーン・84タスクで収集した76k軌道・350時間のロボット操作データセットを構築し、学習ポリシーの性能と汎化性能が向上することを示した。
- 両手でキャップをひねり開ける:双腕多指ハンドのsim-to-real強化学習sim2real2024/3/1
シミュレーションで深層強化学習を用いて訓練した双腕多指ハンドの制御方策を、物理モデリング・実時間知覚・報酬設計の工夫により実世界へ効率的に転移し、多様な未見のボトルキャップを両手でひねり開ける動的で器用な動作を実現した。
- 次トークン予測としてのヒューマノイド歩行歩行2024/2/1
センサ運動軌跡を自己回帰的に次トークン予測するTransformerで学習し、実機ヒューマノイドをサンフランシスコでゼロショット歩行させた研究。
- Neural feels with neural fields: Visuo-tactile perception for in-hand manipulation2023/12/1
- GOAT: GO to Any Thing2023/11/1
- Conformal Policy Learning for Sensorimotor Control Under Distribution Shifts2023/11/1
- Habitat 3.0: A Co-Habitat for Humans, Avatars and Robots2023/10/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Conformal Decision Theory: Safe Autonomous Decisions from Imperfect Predictions2023/10/1
- Interactive Task Planning with Language Models2023/10/1
- What Matters to You? Towards Visual Representation Alignment for Robot Learning2023/10/1
- General In-Hand Object Rotation with Vision and Touch2023/9/1
- Learning Vision-based Pursuit-Evasion Robot Policies2023/8/1
- Robot Learning with Sensorimotor Pre-training2023/6/1
- Manipulator as a Tail: Promoting Dynamic Stability for Legged Locomotion2023/5/1
- Navigating to Objects Specified by Images2023/4/1
- Where are we in the search for an Artificial Visual Cortex for Embodied Intelligence?2023/3/1
- Real-World Humanoid Locomotion with Reinforcement Learning2023/3/1
- Navigating to Objects in the Real World2022/12/1
- Learning Visual Locomotion with Cross-Modal Supervision2022/11/1
- Legged Locomotion in Challenging Terrains using Egocentric Vision2022/11/1
- Learning to Imitate Object Interactions from Internet Videos2022/11/1
- Real-World Robot Learning with Masked Visual Pre-training2022/10/1
- In-Hand Object Rotation via Rapid Motor Adaptation2022/10/1
- Learning a Single Near-hover Position Controller for Vastly Different Quadcopters2022/9/1
- Multi-skill Mobile Manipulation for Object Rearrangement2022/9/1
- Adapting Rapid Motor Adaptation for Bipedal Robots2022/5/1
- Masked Visual Pre-training for Motor Control2022/3/1
- SEAL: Self-supervised Embodied Active Learning using Exploration and 3D Consistency2021/12/1
- Differentiable Spatial Planning using Transformers2021/12/1
- Coupling Vision and Proprioception for Navigation of Legged Robots2021/12/1
- Minimizing Energy Consumption Leads to the Emergence of Gaits in Legged Robots2021/11/1
- Omnidata: A Scalable Pipeline for Making Multi-Task Mid-Level Vision Datasets from 3D Scans2021/10/1
- RMA: Rapid Motor Adaptation for Legged Robots2021/7/1
- Active 3D Shape Reconstruction from Vision and Touch2021/7/1
- Habitat 2.0: Training Home Assistants to Rearrange their Habitat2021/6/1
- From Goals, Waypoints & Paths To Long Term Human Trajectory Forecasting2020/12/1
- Rearrangement: A Challenge for Embodied AI2020/11/1
- Robust Policies via Mid-Level Visual Representations: An Experimental Study in Manipulation and Navigation2020/11/1
- 3D Shape Reconstruction from Vision and Touch2020/7/1
- State-Only Imitation Learning for Dexterous Manipulation2020/4/1
- Side-Tuning: A Baseline for Network Adaptation via Additive Side Networks2019/12/1
- Learning to Navigate Using Mid-Level Visual Priors2019/12/1
- 3D Scene Graph: A Structure for Unified Semantics, 3D Space, and Camera2019/10/1
- Learning Navigation Subroutines from Egocentric Videos2019/5/1
- Habitat: A Platform for Embodied AI Research2019/4/1
- Combining Optimal Control and Learning for Visual Navigation in Novel Environments2019/3/1
- Visual Memory for Robust Path Following2018/12/1
- Mid-Level Visual Representations Improve Generalization and Sample Efficiency for Learning Visuomotor Policies2018/12/1
- Gibson Env: Real-World Perception for Embodied Agents2018/8/1
- On Evaluation of Embodied Navigation Agents2018/7/1
- Learning Instance Segmentation by Interaction2018/6/1
- More Than a Feeling: Learning to Grasp and Regrasp using Vision and Touch2018/5/1
- Zero-Shot Visual Imitation2018/4/1
- Taskonomy: Disentangling Task Transfer Learning2018/4/1
- Unifying Map and Landmark Based Representations for Visual Navigation2017/12/1
- Generic 3D Representation via Pose Estimation and Matching2017/10/1
- Combining Self-Supervised Learning and Imitation for Vision-Based Rope Manipulation2017/3/1
- Cognitive Mapping and Planning for Visual Navigation2017/2/1
- Learning to Poke by Poking: Experiential Learning of Intuitive Physics2016/6/1
- Learning to See by Moving2015/5/1
- Learning Rich Features from RGB-D Images for Object Detection and Segmentation2014/7/1