Yilun Du
NVIDIA
収録論文 95本 ・ フィジカルAI/ロボット学習
世界モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Hydra-0: 汎用世界モデリングと制御のためのアクションフロー世界モデル2026/8/18
ロボットの動作をピクセル運動として表現するアクションフローを用いた汎用世界モデルを提案し、動作誤差を大幅に低減し、ゼロショット合成やデータ効率的な適応を実現した。
- DriftWorld: Fast World Modeling through Drifting2026/7/1
- B-spline Policy: Accelerating Manipulation Policies via B-spline Action Representations2026/7/1
- Ordered Action Tokens for Visuomotor Policy Learning2026/7/1
- Structured 4D Latent Predictive Model for Robot Planning2026/7/1
- Masked Visual Actions for Unified World Modeling2026/7/1
- World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models2026/7/1
- What Matters When Cotraining Robot Manipulation Policies on Everyday Human Videos?2026/6/1
- Hierarchical Policy Learning via Spectral Decomposition2026/6/1
- Cosmos 3: Omnimodal World Models for Physical AI2026/6/1
- IMPACT: Learning Internal-Model Predictive Control for Forceful Robotic Manipulation2026/6/1
- CoStream: Composing Simple Behaviors for Generalizable Complex Manipulation2026/6/1
- You Only Touch Once: 6-DoF Object Pose Estimation from Single Tactile Contact2026/6/1
- World Model for Robot Learning: A Comprehensive Survey2026/5/1
- GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation2026/5/1
- Plan First, Diffuse Later: Extrinsic Graph Guidance for Long-Horizon Diffusion Planning2026/5/1
- ComSim: Building Scalable Real-World Robot Data Generation via Compositional Simulation2026/4/1
- World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry2026/4/1
- Action Images: End-to-End Policy Learning via Multiview Video Generation2026/4/1
- Scaling Tasks, Not Samples: Mastering Humanoid Control through Multi-Task Model-Based Reinforcement Learning2026/3/1
- Update-Free On-Policy Steering via Verifiers2026/3/1
- World Action Models are Zero-shot Policies2026/2/17
- OAT: Ordered Action Tokenization2026/2/1
- A Very Big Video Reasoning Suite2026/2/1
- World Action Models are Zero-shot Policies2026/2/1
- Advances and Innovations in the Multi-Agent Robotic System (MARS) Challenge2026/1/1
- Flexible Multitask Learning with Factorized Diffusion Policy2025/12/1
- Model-Based Diffusion Sampling for Predictive Control in Offline Decision Making2025/12/1
- SIMPACT: Simulation-Enabled Action Planning using Vision-Language Models2025/12/1
- Large Video Planner Enables Generalizable Robot Control2025/12/1
- OPENTOUCH: Bringing Full-Hand Touch to Real-World Interaction2025/12/1
- Evaluating Gemini Robotics Policies in a Veo World Simulator2025/12/1
- Scaling Cross-Embodiment World Models for Dexterous Manipulation2025/11/1
- MoTVLA: A Vision-Language-Action Model with Unified Fast-Slow Reasoning2025/10/1
- Implicit State Estimation via Video Replanning2025/10/1
- Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer2025/10/1
- Geometry-aware Policy Imitation2025/10/1
- Flexible Locomotion Learning with Diffusion Model Predictive Control2025/10/1
- Hybrid Diffusion for Simultaneous Symbolic and Continuous Planning2025/9/1
- Multi-Modal Manipulation via Multi-Modal Policy Consensus2025/9/1
- "Set It Up": Functional Object Arrangement with Compositional Generative Models (Journal Version)2025/8/1
- MindJourney: Test-Time Scaling with World Models for Spatial Reasoning2025/7/1
- Self-Improving Loops for Visual Robotic Planning2025/6/1
- Anomalies by Synthesis: Anomaly Detection using Generative Diffusion Models for Off-Road Navigation2025/5/1
- Learning 3D Persistent Embodied World Models2025/5/1
- TesserAct: Learning 4D Embodied World Models2025/4/1
- Solving New Tasks by Adapting Internet Video Knowledge2025/4/1
- Generative AI in Embodied Systems: System-Level Analysis of Performance, Efficiency and Scalability2025/4/1
- Generative Trajectory Stitching through Diffusion Composition2025/3/1
- AdaWorld: Learning Adaptable World Models with Latent Actions2025/3/1
- MoE-Loco: Mixture of Experts for Multitask Locomotion2025/3/1
- Gemini Robotics: Bringing AI into the Physical World2025/3/1
- Inference-Time Enhancement of Generative Robot Policies via Predictive World Modeling2025/2/1
- Few-Shot Task Learning through Inverse Generative Modeling2024/11/1
- 3D-Mem: 3D Scene Memory for Embodied Exploration and Reasoning2024/11/1
- Inference-Time Policy Steering through Human Interactions2024/11/1
- Grounding Video Models to Actions through Goal Conditioned Exploration2024/11/1
- Compositional Diffusion Models for Powered Descent Trajectory Generation with Flexible Constraints2024/10/1
- Deep Generative Models in Robotics: A Survey on Learning from Multimodal Demonstrations2024/8/1
- Potential Based Diffusion Motion Planning2024/7/1
- Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion2024/7/1
- Disentangled Acoustic Fields For Multimodal Physical Scene Understanding2024/7/1
- Streaming Diffusion Policy: Fast Policy Synthesis with Variable Noise Diffusion Models2024/6/1
- "Set It Up!": Functional Object Arrangement with Compositional Generative Models2024/5/1
- Towards Generalist Robot Learning from Internet Video: A Survey2024/4/1
- RoboDreamer: Learning Compositional World Models for Robot Imagination2024/4/1
- 3D-VLA: A 3D Vision-Language-Action Generative World Model2024/3/1
- Compositional Generative Modeling: A Single Model is Not All You Need2024/2/1
- PoCo: Policy Composition from and for Heterogeneous Robot Learning2024/2/1
- DiffuseBot: Breeding Soft Robots With Physics-Augmented Generative Diffusion Models2023/11/1
- Adaptive Online Replanning with Diffusion Models2023/10/1
- Video Language Planning2023/10/1
- Learning to Act from Actionless Videos through Dense Correspondences2023/10/1
- Compositional Foundation Models for Hierarchical Planning2023/9/1
- Compositional Diffusion-Based Continuous Constraint Solvers2023/9/1
- Building Cooperative Embodied Agents Modularly with Large Language Models2023/7/1
- 3D-LLM: Injecting the 3D World into Large Language Models2023/7/1
- NeuSE: Neural SE(3)-Equivariant Embedding for Consistent Spatial Understanding with Objects2023/3/1
- Diffusion Policy: Visuomotor Policy Learning via Action Diffusion2023/3/1
- 3D Concept Learning and Reasoning from Multi-View Images2023/3/1
- Planning with Sequence Models through Iterative Energy Minimization2023/3/1
- Local Neural Descriptor Fields: Locally Conditioned Object Representations for Manipulation2023/2/1
- MIRA: Mental Imagery for Robotic Affordances2022/12/1
- Visibility-Aware Navigation Among Movable Obstacles2022/12/1
- StructDiffusion: Language-Guided Creation of Physically-Valid Structures using Unseen Objects2022/11/1
- SE(3)-Equivariant Relational Rearrangement with Neural Descriptor Fields2022/11/1
- Robust Change Detection Based on Neural Descriptor Fields2022/8/1
- Learning Neural Acoustic Fields2022/4/1
- Neural Descriptor Fields: SE(3)-Equivariant Object Representations for Manipulation2021/12/1
- Learning to Compose Visual Relations2021/11/1
- Curious Representation Learning for Embodied Intelligence2021/5/1
- Neural Radiance Flow for 4D View Synthesis and Video Processing2020/12/1
- A Long Horizon Planning Framework for Manipulating Rigid Pointcloud Objects2020/11/1
- Learning Object-Based State Estimators for Household Robots2020/11/1
- Model Based Planning with Energy Based Models2019/9/1