Yilun Chen
Renmin University of China
収録論文 38本 ・ フィジカルAI/ロボット学習
所属歴(論文より): Renmin University of China(〜2026) / TARS Robotics(〜2026)
マニピュレーション操作
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- JEPA-WAM: ロボット操作のためのワールドアクションモデルにおける段階レベル結合埋め込み予測マニピュレーション2026/8/11
ロボット操作タスクにおいて、短期的な物理的未来と段階的な意味的未来を区別し、段階レベルの潜在目標を予測するJEPA-WAMを提案。50のタスクで成功率90.25%を達成し、実行ステップ数を削減した。
- StageWAM: ロボット操作におけるワールドアクションモデルのためのジョイント埋め込みステージ予測操作2026/8/11
ロボット操作タスクにおいて、短期的な物理的未来に加えて、タスクの進行段階を表すセマンティックな未来を予測するStageWAMを提案し、成功率と実行効率を向上させた。
- JEPA-WAM: Stage-Level Joint-Embedding Prediction for World-Action Models in Robot Manipulation2026/8/1
- RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation2026/7/1
- VistaBot: View-Robust Robot Manipulation via Spatiotemporal-Aware View Synthesis2026/4/1
- Unveiling the Surprising Efficacy of Navigation Understanding in End-to-End Autonomous Driving2026/4/1
- StarVLA-$\alpha$: Reducing Complexity in Vision-Language-Action Systems2026/4/1
- PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance2026/4/1
- Rhythm: Learning Interactive Whole-Body Control for Dual Humanoids2026/3/1
- OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation2026/3/1
- FutureVLA: Joint Visuomotor Prediction for Vision-Language-Action Model2026/3/1
- ST4VLA: Spatially Guided Training for Vision-Language-Action Models2026/2/1
- RoboInter: A Holistic Intermediate Representation Suite Towards Robotic Manipulation2026/2/1
- InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation2026/1/1
- Nimbus: A Unified Embodied Synthetic Data Generation Framework2026/1/1
- MM-ACT: Learn from Multimodal Parallel Generation to Act2025/12/1
- World In Your Hands: A Large-Scale and Open-Source Ecosystem for Learning Human-Centric Manipulation in the Wild2025/12/1
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model2025/10/1
- InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy2025/10/1
- Learning Primitive Embodied World Models: Towards Scalable Robotic Learning2025/8/1
- StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling2025/7/1
- InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation2025/7/1
- Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities2025/7/1
- GENMANIP: LLM-driven Simulation for Generalizable Instruction-Following Manipulation2025/6/1
- CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling2025/6/1
- LiloDriver: A Lifelong Learning Framework for Closed-loop Motion Planning in Long-tail Autonomous Driving Scenarios2025/5/1
- NavDP: Learning Sim-to-Real Navigation Diffusion Policy with Privileged Information Guidance2025/5/1
- RoboGround: Robotic Manipulation with Grounded Vision-Language Priors2025/4/1
- A Data-Centric Revisit of Pre-Trained Vision Models for Robot Learning2025/3/1
- Re$^3$Sim: Generating High-Fidelity Simulation Data via 3D-Photorealistic Real-to-Sim for Robotic Manipulation2025/2/1
- Dual-AEB: Synergizing Rule-Based and Multimodal Large Language Models for Effective Emergency Braking2024/10/1
- Bench4Merge: A Comprehensive Benchmark for Merging in Realistic Dense Traffic with Micro-Interactive Vehicles2024/10/1
- VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding2024/10/1
- Open-Vocabulary Object-Goal Navigation by Generalizing Semantic Mapping with Dense CLIP2024/7/1
- GRUtopia: Dream General Robots in a City at Scale2024/7/1
- MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations2024/6/1
- RoadMap: A Light-Weight Semantic Map for Visual Localization towards Autonomous Driving2021/6/1
- AVP-SLAM: Semantic Visual Mapping and Localization for Autonomous Vehicles in the Parking Lot2020/7/1