Kai Chen
収録論文 63本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution2026/7/1
- Closing the Loop in Humanoid VLA: Persistent 3D Object Tokens for Verifiable Loco-Manipulation2026/7/1
- SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models2026/7/1
- EgoPriMo: Egocentric Motion Generation for Interactive Humanoid Control2026/6/1
- Frequency-Aware Flow Matching for Continuous and Consistent Robotic Action Generation2026/6/1
- RoboSemanticBench: Diagnosing Semantic Grounding in Action Prediction for VLA Models2026/6/1
- Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments2026/6/1
- PhysBrain 1.0 Technical Report2026/5/1
- IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation2026/5/1
- EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields2026/5/1
- FrameSkip: Learning from Fewer but More Informative Frames in VLA Training2026/5/1
- STARRY: Spatial-Temporal Action-Centric World Modeling for Robotic Manipulation2026/4/1
- Safe Navigation in Unknown and Cluttered Environments via Direction-Aware Convex Free-Region Generation2026/4/1
- CrashSight: A Phase-Aware, Infrastructure-Centric Video Benchmark for Traffic Crash Scene Understanding and Reasoning2026/4/1
- 3D-Mix for VLA: A Plug-and-Play Module for Integrating VGGT-based 3D Information into Vision-Language-Action Models2026/3/1
- CyboRacket: A Perception-to-Action Framework for Humanoid Racket Sports2026/3/1
- Cybo-Waiter: A Physical Agentic Framework for Humanoid Whole-Body Locomotion-Manipulation2026/3/1
- Towards Intelligible Human-Robot Interaction: An Active Inference Approach to Occluded Pedestrian Scenarios2026/2/1
- Real-time Monocular 2D and 3D Perception of Endoluminal Scenes for Controlling Flexible Robotic Endoscopic Instruments2026/2/1
- ALORE: Autonomous Large-Object Rearrangement with a Legged Manipulator2026/2/1
- TwinBrainVLA: Unleashing the Potential of Generalist VLMs for Embodied Tasks via Asymmetric Mixture-of-Transformers2026/1/1
- Fast and Safe Trajectory Optimization for Mobile Manipulators With Neural Configuration Space Distance Field2026/1/1
- LangForce: Bayesian Decomposition of Vision Language Action Models via Latent Action Queries2026/1/1
- PhysBrain: Human Egocentric Data as a Bridge from Vision Language Models to Physical Intelligence2025/12/1
- Contact Map Transfer with Conditional Diffusion Model for Generalizable Dexterous Grasp Generation2025/11/1
- RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations2025/10/1
- Embracing Bulky Objects with Humanoid Robots: Whole-Body Manipulation with Reinforcement Learning2025/9/1
- Decision-Driven Semantic Object Exploration for Legged Robots via Confidence-Calibrated Perception and Topological Subgoal Selection2025/9/1
- SAMP: Spatial Anchor-based Motion Policy for Collision-Aware Robotic Manipulators2025/9/1
- Enhanced Spatiotemporal Consistency for Image-to-LiDAR Data Pretraining2025/3/1
- Interactive Navigation for Legged Manipulators with Learned Arm-Pushing Controller2025/3/1
- LargeAD: Large-Scale Cross-Sensor Data Pretraining for Autonomous Driving2025/1/1
- UDMC: Unified Decision-Making and Control Framework for Urban Autonomous Driving with Motion Prediction of Traffic Participants2025/1/1
- FRTree Planner: Robot Navigation in Cluttered and Unknown Environments with Tree of Free Regions2024/10/1
- Enhanced Scale-aware Depth Estimation for Monocular Endoscopic Scenes with Geometric Modeling2024/8/1
- 4D Contrastive Superflows are Dense 3D Representation Learners2024/7/1
- An Empirical Study of Training State-of-the-Art LiDAR Segmentation Models2024/5/1
- A Large Language Model-based multi-agent manufacturing system for intelligent shopfloor2024/5/1
- Benchmarking and Improving Bird's Eye View Perception Robustness in Autonomous Driving2024/5/1
- SimEndoGS: Efficient Data-driven Scene Simulation using Robotic Surgery Videos via Physics-embedded 3D Gaussians2024/5/1
- The RoboDrive Challenge: Drive Anytime Anywhere in Any Condition2024/5/1
- Multi-Modal Data-Efficient 3D Scene Understanding for Autonomous Driving2024/5/1
- Multi-objective Cross-task Learning via Goal-conditioned GPT-based Decision Transformers for Surgical Robot Task Automation2024/5/1
- MCGMapper: Light-Weight Incremental Structure from Motion and Visual Localization With Planar Markers and Camera Groups2024/5/1
- Collision-Free Trajectory Optimization in Cluttered Environments Using Sums-of-Squares Programming2024/4/1
- Calib3D: Calibrating Model Preferences for Reliable 3D Scene Understanding2024/3/1
- Robot Navigation in Unknown and Cluttered Workspace with Dynamical System Modulation in Starshaped Roadmap2024/3/1
- Efficient Physically-based Simulation of Soft Bodies in Embodied Environment for Surgical Robot2024/2/1
- Any-point Trajectory Modeling for Policy Learning2024/1/1
- EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI2023/12/1
- Geometry-Aware Safety-Critical Local Reactive Controller for Robot Navigation in Unknown and Cluttered Environments2023/10/1
- RGBManip: Monocular Image-based Robotic Manipulation through Active Object Pose Estimation2023/10/1
- Visual-Kinematics Graph Learning for Procedure-agnostic Instrument Tip Segmentation in Robotic Surgeries2023/9/1
- Value-Informed Skill Chaining for Policy Learning of Long-Horizon Tasks with Surgical Robot2023/7/1
- Segment Any Point Cloud Sequences by Distilling Vision Foundation Models2023/6/1
- Integrated Behavior Planning and Motion Control for Autonomous Vehicles with Traffic Rules Compliance2023/4/1
- RoboBEV: Towards Robust Bird's Eye View Perception under Corruptions2023/4/1
- Robo3D: Towards Robust and Reliable 3D Perception against Corruptions2023/3/1
- Demonstration-Guided Reinforcement Learning with Efficient Exploration for Task Automation of Surgical Robot2023/2/1
- StereoPose: Category-Level 6D Transparent Object Pose Estimation from Stereo Images via Back-View NOCS2022/11/1
- Sim-to-Real 6D Object Pose Estimation via Iterative Self-training for Robotic Bin Picking2022/4/1
- CODA: A Real-World Road Corner Case Dataset for Object Detection in Autonomous Driving2022/3/1
- Self-Localization of Parking Robots Using Square-Like Landmarks2018/12/1