Li Fei-Fei
収録論文 92本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- T²Mem: ロボティクスのためのテスト時メモリ学習VLA2026/9/29
事前学習済み視覚言語行動ポリシーに、テスト時訓練で観測履歴を圧縮した高速重みとして記憶させ、記憶不要なベース方策を大きく上回る成功率を達成した手法。
- DexAgent: 自己進化するツールライブラリを備えたエージェント型Human2Sim2Robotフレームワークによる巧みな操作マニピュレーション2026/9/28
一人称視点の人間動画とタスク指示から、物理的に妥当なロボット軌道を生成して方策学習を可能にするエージェント型フレームワークを提案。ツールライブラリを自己進化させ、多様な物体や長期的タスクに対応する。
- TrAct: ロボット制御と視覚予測を視覚トラックで橋渡しするVLA/世界モデル2026/8/25
ロボットの行動と画像変化の弱い対応を補うため、視覚トラックを中間表現として用いる世界モデルベースの意思決定フレームワークTrActを提案。シミュレーションと実機で成功率を大幅に向上させた。
- RoboTTT: ロボットポリシーのためのコンテキストスケーリングVLA2026/7/1
ロボットポリシーの視覚運動コンテキストを8Kタイムステップまで拡張し、推論遅延を増やさずに、人間のビデオからのワンショット模倣や長期的タスクの性能向上を実現する手法を提案。
- マスク視覚アクションによる統一世界モデリング世界モデル2026/7/1
ロボットの行動をビデオのピクセル空間で表現する新しいインターフェースを導入し、少量のデータで学習したモデルが将来予測や逆モデリングを実現する。
- T-Rex: 触覚反応型巧みな操作触覚/操作2026/6/1
触覚信号に動的に反応する操作を実現するため、大規模な触覚データセットと可変レートのMixture-of-Transformersアーキテクチャを導入し、12の操作タスクで成功率を大幅に向上させた。
- SimFoundry: ポリシー学習と評価のためのモジュール式自動シーン生成sim2real2026/6/1
実世界のビデオからシミュレーション用のシーンを自動生成し、多様なバリエーションを作成してロボットポリシーの訓練と評価を行うシステムを提案。シミュレーションでの評価が実世界性能を強く予測し、訓練時のバリエーション追加が成功率を向上させることを示した。
- ステレオポリシー:ステレオ知覚によるロボット操作ポリシーの改善マニピュレーション2026/5/1
ステレオ画像ペアを直接利用して3次元幾何推論を強化する視覚運動ポリシー学習フレームワークを提案し、シミュレーションと実ロボットの操作タスクで性能を向上させた。
- ESI-Bench:知覚と行動のループを閉じる身体化空間知能のベンチマーク身体化空間知能2026/5/1
受動的な観察ではなく、能動的な探索を通じて空間理解を行う身体化空間知能のベンチマークを提案し、能動的探索が受動的観察より優れていることを示した。
- 視点計画:VLMによる3D空間の能動的推論と計画VLA2026/5/1
VLMがカメラ移動による視点変化を予測し、複数ステップの計画で目標視点を特定できるかを検証し、その能力を高める反復的自己探索と視点グラフ蒸留の枠組みを提案した。
- 変形物体の移動操作のための粒子動力学の迅速適応変形物体操作2026/3/1
変形物体の未知の動力学を扱うため、シミュレーションで物体の粒子位置などの特権情報から動力学埋め込みを学習し、実ロボットで推論する二段階手法RAPiDを提案した。
- IMPASTO: モデルベース計画と学習された力学モデルを統合したロボット油絵再現ロボットアート/計画2026/3/1
ロボットが油絵の画像列から筆の軌道や力、色を推論して再現するシステムを提案。学習したピクセル力学モデルとモデル予測制御を統合し、自己対戦のみで学習する。
- 試行錯誤からの学習:身体性LLMのための内省的テスト時計画VLA2026/2/1
実行前の内省で行動候補を生成・評価し、実行後の内省でモデルと方針を更新する内省的テスト時計画を提案し、長期的な家庭内タスクやロボット実験で性能向上を実証した。
- PointWorld: 実世界ロボット操作のための3D世界モデルのスケーリングマニピュレーション2026/1/1
RGB-D画像とロボットの行動コマンドから3D点群の動きを予測する大規模事前学習済み3D世界モデルを提案し、実機ロボットのモデル予測制御に応用した。
- Dream2Flow: 3Dオブジェクトフローで動画生成とオープンワールド操作をつなぐマニピュレーション2025/12/1
生成動画から3Dオブジェクトの動きを再構成し、それを中間表現として軌道追跡問題に変換することで、実演なしに多様な物体を操作できるフレームワークを提案。
- ENACT: 自己中心的なインタラクションの世界モデリングによる身体性認知の評価身体性認知/ベンチマーク2025/11/1
ロボティクスシミュレーションから生成した自己中心視点の行動と観測の系列並べ替えタスクにより、視覚言語モデルが身体性認知の能力(アフォーダンス認識、行動効果推論など)をどの程度持つかを評価するベンチマークを提案。
- GeT-USE: シミュレーション上の身体拡張を介した双腕移動マニピュレーションのための汎用ツール使用学習sim2real2025/10/1
シミュレーション上でロボットの身体拡張(新しいエンドエフェクタの構築)を探索し、タスクに有効なツール形状の知識を獲得した後、実機の視覚運動ポリシーへ転移することで、利用可能な物体から最適なツールを選んで使う汎用ツール使用を実現した研究。
- MoMaGen: ソフト・ハード制約下で多段階両腕移動マニピュレーションのデモを生成sim2real2025/10/1
移動ベースと両腕の多段階タスク向けに、到達可能性などのハード制約と視認性などのソフト制約を満たすデータ生成を制約付き最適化として定式化し、多様なデモを自動生成する手法を提案。
- UAD: ロボットマニピュレーションの汎化のための教師なしアフォーダンス蒸留マニピュレーション2025/6/1
大規模視覚モデルと視覚言語モデルを組み合わせて、手動アノテーションなしでタスク条件付きアフォーダンスモデルを学習し、ロボット操作の汎化性能を向上させる手法を提案。
- Chain-of-Modality: マルチモーダル人間動画と視覚言語モデルによる操作プログラムの学習VLA2025/4/1
筋電アームバンドやマイクなどで計測した人間の操作動画から、視覚言語モデルがタスク計画と力などの制御パラメータを抽出し、ロボットに操作タスクを実行させる手法を提案した。
- BEHAVIORロボットスイート:日常家事のための実世界全身マニピュレーションを効率化全身マニピュレーション2025/3/1
両腕・車輪・4自由度胴体を備えたロボットで、全身遠隔操作インターフェースと視覚運動ポリシー学習アルゴリズムを統合し、家庭内の全身マニピュレーションタスクを実現するフレームワークを提案。
- VLM生成の反復キーポイント報酬による実機-シミュレーション-実機のロボットマニピュレーションマニピュレーション2025/2/1
VLMが言語指示とRGB-D観測からキーポイント間の関係に基づく報酬関数を生成・反復改善し、実世界シーンをシミュレーションで再構築してRL方策を訓練、実機へ展開する枠組みを提案。
- なぜ自動化するのか?ロボット自動化への欲求、費やす時間、幸福度の相関の探求HRI2025/1/1
BEHAVIOR-1Kと米国時間使用調査のデータを用い、家事タスクの自動化への欲求が所要時間よりも幸福感や痛みといった感情と強く関連することを明らかにし、性別や所得による違いも示した研究。
- ARCap: 拡張現実フィードバックで高品質な人間デモンストレーションを収集するロボット学習システム模倣学習/データ収集2024/10/1
ARによる視覚フィードバックと触覚警告で初心者でもロボット実行可能な高品質デモを収集できる携帯型データ収集システムを提案し、混雑環境での操作や長期的なクロスエンボディメント操作を実現した。
- ロバストな方策学習のためのデジタルいとこの自動生成sim2real2024/10/1
実世界のシーンを模した「デジタルいとこ」を自動生成し、シミュレーションから実世界へのゼロショット転移で高い成功率を達成する手法を提案。
- 身体性エージェントインターフェース:身体的意思決定のためのLLMベンチマークVLA2024/10/1
LLMを用いた身体的意思決定を統一的に評価するための汎用インターフェースを提案し、多様なタスク・モジュール・細粒度エラー指標でLLMの能力を体系的に分析するベンチマークを構築した。
- ReKep: ロボットマニピュレーションのための関係的キーポイント制約の時空間推論マニピュレーション2024/9/1
環境中の3Dキーポイント間の関係をPython関数で表す制約(ReKep)を導入し、大規模視覚モデルと言語モデルを用いて自由形式の指示から自動生成することで、多様なマニピュレーションタスクをリアルタイムに実行する手法を提案。
- TRANSIC: オンライン修正から学ぶSim-to-Realポリシー転移sim2real2024/5/1
人間が実世界でロボットの動作を観察・介入して修正を加え、その修正から残差ポリシーを学習することで、シミュレーションと実世界のギャップを埋めて家具組立などの接触の多いタスクを実現する手法。
- DexCap: 巧みな操作のためのスケーラブルでポータブルなモーションキャプチャデータ収集システムマニピュレーション2024/3/1
SLAMと電磁場を組み合わせたポータブルな手のモーションキャプチャシステムDexCapと、そのデータから直接ロボットの巧みな操作スキルを学習する模倣アルゴリズムDexILを提案した。
- BEHAVIOR-1K:1000の日常活動とリアルなシミュレーションによる人間中心の身体性AIベンチマークsim2real2024/3/1
人間がロボットにやってほしいと望む1000の日常活動を、50のシーンと9000以上の物体を含む物理シミュレーション環境OMNIGIBSONで再現し、実世界への転移も検証したベンチマークを提案した。
- 対話型エージェント基盤モデルVLA2024/2/1
視覚・言語・行動予測を統合したマルチタスク学習により、ロボティクス・ゲームAI・医療の3領域で動作する汎用エージェント基盤モデルを提案した。
- Model-Based Control with Sparse Neural Dynamics2023/12/1
- Chain of Code: Reasoning with a Language Model-Augmented Code Emulator2023/12/1
- NOIR: Neural Signal Operated Intelligent Robots for Everyday Activities2023/11/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Mini-BEHAVIOR: A Procedurally Generated Benchmark for Long-horizon Decision-Making in Embodied AI2023/10/1
- D$^3$Fields: Dynamic 3D Descriptor Fields for Zero-Shot Generalizable Rearrangement2023/9/1
- Sequential Dexterity: Chaining Dexterous Policies for Long-Horizon Manipulation2023/9/1
- Primitive Skill-based Robot Learning from Human Evaluative Feedback2023/7/1
- VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models2023/7/1
- The ObjectFolder Benchmark: Multisensory Learning with Neural and Real Objects2023/6/1
- Sonicverse: A Multisensory Simulation Platform for Embodied Household Agents that See and Hear2023/6/1
- Dynamic-Resolution Model Learning for Object Pile Manipulation2023/6/1
- M-EMBER: Tackling Long-Horizon Mobile Manipulation via Factorized Domain Transfer2023/5/1
- MimicPlay: Long-Horizon Imitation Learning by Watching Human Play2023/2/1
- See, Hear, and Feel: Smart Sensory Fusion for Robotic Manipulation2022/12/1
- Active Task Randomization: Learning Robust Skills via Unsupervised Generation of Diverse and Feasible Tasks2022/11/1
- VIMA: General Robot Manipulation with Multimodal Prompts2022/10/1
- MaskViT: Masked Visual Pre-Training for Video Prediction2022/6/1
- BEHAVIOR in Habitat 2.0: Simulator-Independent Logical Task Description for Benchmarking Embodied AI Agents2022/6/1
- Generalizable Task Planning through Representation Pretraining2022/5/1
- ObjectFolder 2.0: A Multisensory Object Dataset for Sim2Real Transfer2022/4/1
- MetaMorph: Learning Universal Controllers with Transformers2022/3/1
- Error-Aware Imitation Learning from Teleoperation Data for Mobile Manipulation2021/12/1
- Example-Driven Model-Based Reinforcement Learning for Solving Long-Horizon Visuomotor Tasks2021/9/1
- ObjectFolder: A Dataset of Objects with Implicit Visual, Auditory, and Tactile Representations2021/9/1
- What Matters in Learning from Offline Human Demonstrations for Robot Manipulation2021/8/1
- BEHAVIOR: Benchmark for Everyday Household Activities in Virtual, Interactive, and Ecological Environments2021/8/1
- Co-GAIL: Learning Diverse Strategies for Human-Robot Collaboration2021/8/1
- iGibson 2.0: Object-Centric Simulation for Robot Learning of Everyday Household Tasks2021/8/1
- Discovering Generalizable Skills via Automated Generation of Diverse Tasks2021/6/1
- SECANT: Self-Expert Cloning for Zero-Shot Generalization of Visual Policies2021/6/1
- Generalization Through Hand-Eye Coordination: An Action Space for Learning Spatially-Invariant Visuomotor Control2021/3/1
- Greedy Hierarchical Variational Autoencoders for Large-Scale Video Prediction2021/3/1
- Embodied Intelligence via Learning and Evolution2021/2/1
- iGibson 1.0: a Simulation Environment for Interactive Tasks in Large Realistic Scenes2020/12/1
- Human-in-the-Loop Imitation Learning using Remote Teleoperation2020/12/1
- Learning Multi-Arm Manipulation Through Collaborative Teleoperation2020/12/1
- Deep Affordance Foresight: Planning Through What Can Be Done in the Future2020/11/1
- Adaptive Procedural Task Generation for Hard-Exploration Problems2020/7/1
- Learning to Generalize Across Long-Horizon Tasks from Human Demonstrations2020/3/1
- Scaling Robot Supervision to Hundreds of Hours with RoboTurk: Robotic Manipulation Dataset through Human Reasoning and Dexterity2019/11/1
- Motion Reasoning for Goal-Based Imitation Learning2019/11/1
- IRIS: Implicit Reinforcement without Interaction at Scale for Learning Control from Offline Robot Manipulation Data2019/11/1
- Dynamics Learning with Cascaded Variational Inference for Multi-Step Manipulation2019/10/1
- Interactive Gibson Benchmark (iGibson 0.5): A Benchmark for Interactive Navigation in Cluttered Environments2019/10/1
- KETO: Learning Keypoint Representations for Tool Manipulation2019/10/1
- 6-PACK: Category-level 6D Pose Tracker with Anchor-Based Keypoints2019/10/1
- SURREAL-System: Fully-Integrated Stack for Distributed Deep Reinforcement Learning2019/9/1
- DualSMC: Tunneling Differentiable Filtering and Planning under Continuous POMDPs2019/9/1
- Regression Planning Networks2019/9/1
- Continuous Relaxation of Symbolic Planner for One-Shot Imitation Learning2019/8/1
- Making Sense of Vision and Touch: Learning Multimodal Representations for Contact-Rich Tasks2019/7/1
- Scene Memory Transformer for Embodied Agents in Long-Horizon Tasks2019/3/1
- DenseFusion: 6D Object Pose Estimation by Iterative Dense Fusion2019/1/1
- RoboTurk: A Crowdsourcing Platform for Robotic Skill Learning through Imitation2018/11/1
- Making Sense of Vision and Touch: Self-Supervised Learning of Multimodal Representations for Contact-Rich Tasks2018/10/1
- Neural Task Graphs: Generalizing to Unseen Tasks from a Single Video Demonstration2018/7/1
- Learning Task-Oriented Grasping for Tool Manipulation from Simulated Self-Supervision2018/6/1
- Neural Task Programming: Learning to Generalize Across Hierarchical Tasks2017/10/1
- ADAPT: Zero-Shot Adaptive Policy Transfer for Stochastic Dynamical Systems2017/7/1
- Visual Semantic Planning using Deep Successor Representations2017/5/1