Guang Chen
Tongji University
収録論文 39本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GWM-VLA:視覚言語行動学習のための幾何認識潜在世界モデリングVLA2026/8/7
視覚言語行動モデルの堅牢性を向上させるため、多視点の幾何関係を明示的にモデル化する潜在世界モデルを提案し、シミュレーションと実環境で性能を検証した。
- GWM-VLA: Geometry-Aware Latent World Modeling for Vision-Language-Action Learning2026/8/1
- GeoWorldAD: Geometry World Action Model for Autonomous Driving2026/7/1
- ATHENA: Accelerated Multi-Task Heterogeneous Influence Functions for Robot Data Curation2026/6/1
- UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling2026/6/1
- Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning2026/6/1
- Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation2026/6/1
- ACSAC: Adaptive Chunk Size Actor-Critic with Causal Transformer Q-Network2026/5/1
- Beyond Imitation: Learning Safe End-to-End Autonomous Driving from Hard Negatives2026/5/1
- Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation2026/4/1
- UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving2026/4/1
- DriveVA: Video Action Models are Zero-Shot Drivers2026/4/1
- DeCoNav: Dialog enhanced Long-Horizon Collaborative Vision-Language Navigation2026/4/1
- XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments2026/4/1
- PerlAD: Towards Enhanced Closed-loop End-to-end Autonomous Driving with Pseudo-simulation-based Reinforcement Learning2026/3/1
- Unleashing the Potential of Diffusion Models for End-to-End Autonomous Driving2026/2/1
- MeanFuser: Fast One-Step Multi-Modal Trajectory Generation and Adaptive Reconstruction via MeanFlow for End-to-End Autonomous Driving2026/2/1
- Towards Intelligible Human-Robot Interaction: An Active Inference Approach to Occluded Pedestrian Scenarios2026/2/1
- Learning Geometrically-Grounded 3D Visual Representations for View-Generalizable Robotic Manipulation2026/1/1
- Dichotomous Diffusion Policy Optimization2026/1/1
- Dichotomous Diffusion Policy Optimization2025/12/31
- Point What You Mean: Visually Grounded Instruction Policy2025/12/1
- MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning2025/12/1
- MiMo-Embodied: X-Embodied Foundation Model Technical Report2025/11/1
- DriveMRP: Enhancing Vision-Language Models with Synthetic Motion Data for Motion Risk Prediction2025/7/1
- ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving2025/6/1
- AgentThink: A Unified Framework for Tool-Augmented Chain-of-Thought Reasoning in Vision-Language Models for Autonomous Driving2025/5/1
- GSGTrack: Gaussian Splatting-Guided Object Pose Tracking from RGB Videos2024/12/1
- Multi-Agent Reinforcement Learning for Autonomous Driving: A Survey2024/8/1
- Embracing Events and Frames with Hierarchical Feature Refinement Network for Object Detection2024/7/1
- GarchingSim: An Autonomous Driving Simulator with Photorealistic Scenes and Minimalist Workflow2024/1/1
- SUPS: A Simulated Underground Parking Scenario Dataset for Autonomous Driving2023/2/1
- A Human-Centered Safe Robot Reinforcement Learning Framework with Interactive Behaviors2023/2/1
- Gaussian Process-Based Model Predictive Control for Overtaking2021/1/1
- Efficient Pig Counting in Crowds with Keypoints Tracking and Spatial-aware Temporal Response Filtering2020/5/1
- Neuromorphic Visual Odometry System for Intelligent Vehicle Application with Bio-inspired Vision Sensor2019/9/1
- Globally optimal vertical direction estimation in Atlanta World2019/4/1
- Self-Localization of Parking Robots Using Square-Like Landmarks2018/12/1
- An Efficient L-Shape Fitting Method for Vehicle Pose Detection with 2D LiDAR2018/12/1