Ziwei Liu
収録論文 42本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HumanCLAW: Can Vision-Language Models Act Through a Body?2026/7/1
- Data Pyramid for Embodied Manipulation: A Survey2026/7/1
- Not All Points Are Equal: Uncertainty-Aware 4D LiDAR Scene Synthesis2026/6/1
- Is Your Driving World Model an All-Around Player?2026/5/1
- PhysX-Omni: Unified Simulation-Ready Physical 3D Generation for Rigid, Deformable, and Articulated Objects2026/5/1
- End-to-End Dexterous Grasp Learning from Single-View Point Clouds via a Multi-Object Scene Dataset2026/3/1
- Kinema4D: Kinematic 4D World Modeling for Spatiotemporal Embodied Simulation2026/3/1
- HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human-Scene Interactions2026/3/1
- A Very Big Video Reasoning Suite2026/2/1
- BFA++: Hierarchical Best-Feature-Aware Token Prune for Multi-View Vision Language Action Model2026/2/1
- DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation2026/1/1
- The RoboSense Challenge: Sense Anything, Navigate Anywhere, Adapt Across Platforms2026/1/1
- Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future2025/12/1
- U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences2025/12/1
- 3EED: Ground Everything Everywhere in 3D2025/11/1
- Scaling Spatial Intelligence with Multimodal Foundation Models2025/11/1
- PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Image2025/11/1
- From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors2025/10/20
- From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors2025/10/1
- 3D and 4D World Modeling: A Survey2025/9/1
- Holistic Evaluation of Multimodal LLMs on Spatial Intelligence2025/8/1
- Enhanced Spatiotemporal Consistency for Image-to-LiDAR Data Pretraining2025/3/1
- LargeAD: Large-Scale Cross-Sensor Data Pretraining for Autonomous Driving2025/1/1
- LiMoE: Mixture of LiDAR Representation Learners from Automotive Scenes2025/1/1
- SMPLest-X: Ultimate Scaling for Expressive Human Pose and Shape Estimation2025/1/1
- Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives2025/1/1
- SOLAMI: Social Vision-Language-Action Modeling for Immersive Interaction with 3D Autonomous Characters2024/11/29
- DynamicCity: Large-Scale 4D Occupancy Generation from Dynamic Scenes2024/10/1
- 4D Contrastive Superflows are Dense 3D Representation Learners2024/7/1
- Multi-Space Alignments Towards Universal LiDAR Segmentation2024/5/1
- Benchmarking and Improving Bird's Eye View Perception Robustness in Autonomous Driving2024/5/1
- Multi-Modal Data-Efficient 3D Scene Understanding for Autonomous Driving2024/5/1
- The RoboDrive Challenge: Drive Anytime Anywhere in Any Condition2024/5/1
- Calib3D: Calibrating Model Preferences for Reliable 3D Scene Understanding2024/3/1
- WHAC: World-grounded Humans and Cameras2024/3/1
- InsActor: Instruction-driven Physics-based Characters2023/12/1
- Octopus: Embodied Vision-Language Programmer from Environmental Feedback2023/10/1
- Segment Any Point Cloud Sequences by Distilling Vision Foundation Models2023/6/1
- RoboBEV: Towards Robust Bird's Eye View Perception under Corruptions2023/4/1
- Rethinking Range View Representation for LiDAR Segmentation2023/3/1
- Robo3D: Towards Robust and Reliable 3D Perception against Corruptions2023/3/1
- LaserMix for Semi-Supervised LiDAR Semantic Segmentation2022/7/1