Hangjun Ye
収録論文 35本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model2026/7/1
- Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories2026/7/1
- GeoWorldAD: Geometry World Action Model for Autonomous Driving2026/7/1
- Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning2026/6/1
- Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation2026/6/1
- FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation2026/6/1
- OneVLA: A Unified Framework for Embodied Tasks2026/6/1
- RotVLA: Rotational Latent Action for Vision-Language-Action Model2026/5/1
- Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation2026/5/1
- Beyond Imitation: Learning Safe End-to-End Autonomous Driving from Hard Negatives2026/5/1
- Walk With Me: Long-Horizon Social Navigation for Human-Centric Outdoor Assistance2026/4/1
- DriveVA: Video Action Models are Zero-Shot Drivers2026/4/1
- UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving2026/4/1
- Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation2026/4/1
- XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments2026/4/1
- PerlAD: Towards Enhanced Closed-loop End-to-end Autonomous Driving with Pseudo-simulation-based Reinforcement Learning2026/3/1
- Learning from Mistakes: Post-Training for Driving VLA with Takeover Data2026/3/1
- Xiaomi-Robotics-0: An Open-Sourced Vision-Language-Action Model with Real-Time Execution2026/2/13
- DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving2026/2/1
- Unleashing the Potential of Diffusion Models for End-to-End Autonomous Driving2026/2/1
- MeanFuser: Fast One-Step Multi-Modal Trajectory Generation and Adaptive Reconstruction via MeanFlow for End-to-End Autonomous Driving2026/2/1
- Xiaomi-Robotics-0: An Open-Sourced Vision-Language-Action Model with Real-Time Execution2026/2/1
- The RoboSense Challenge: Sense Anything, Navigate Anywhere, Adapt Across Platforms2026/1/1
- Dichotomous Diffusion Policy Optimization2026/1/1
- Dichotomous Diffusion Policy Optimization2025/12/31
- MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning2025/12/1
- DSBench: A Comprehensive Benchmark for Evaluating External and In-Cabin Risks2025/11/1
- SimScale: Learning to Drive via Real-World Simulation at Scale2025/11/1
- SocialNav-Map: Dynamic Mapping with Human Trajectory Prediction for Zero-Shot Social Navigation2025/11/1
- RoboAfford++: A Generative AI-Enhanced Dataset for Multimodal Affordance Learning in Robotic Manipulation and Navigation2025/11/1
- MiMo-Embodied: X-Embodied Foundation Model Technical Report2025/11/1
- Learning to Navigate Socially Through Proactive Risk Perception2025/10/1
- Team Xiaomi EV-AD VLA: Caption-Guided Retrieval System for Cross-Modal Drone Navigation -- Technical Report for IROS 2025 RoboSense Challenge Track 42025/10/1
- DriveMRP: Enhancing Vision-Language Models with Synthetic Motion Data for Motion Risk Prediction2025/7/1
- ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving2025/6/1