Yao Mu
Shanghai Jiao Tong University
収録論文 98本 ・ フィジカルAI/ロボット学習
評価指標ビデオ生成/ベンチマークロボットポリシー評価評価基盤
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PRM-as-a-Judge 1.5: ロボットプロセス評価のためのツールキット評価指標2026/8/14
ロボットの動作動画から詳細な進捗曲線を生成し、失敗側の進捗や回復能力、成功側の実行品質など複数の細かい指標を導出する評価ツールキットを提案した。
- H2R-Bench: 世界モデルにおける人間からロボットへの操作ビデオ生成のベンチマークビデオ生成/ベンチマーク2026/8/13
人間の操作ビデオをロボットの操作ビデオに変換する能力を評価するベンチマークを提案し、既存のビデオ生成モデルの限界を明らかにした。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステムロボットポリシー評価2026/8/10
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減した。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステム評価基盤2026/8/10
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減する。
- H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World Models2026/8/1
- XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment2026/8/1
- DenseReward: Dense Reward Learning via Failure Synthesis for Robotic Manipulation2026/7/1
- Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation2026/7/1
- RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination2026/7/1
- RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies2026/7/1
- Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels2026/7/1
- Data Pyramid for Embodied Manipulation: A Survey2026/7/1
- Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control2026/7/1
- InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization2026/7/1
- ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning2026/6/15
- SynManDex: Synthesizing Human-like Dexterous Grasps from Synthetic Human Pre-Grasps2026/6/1
- Implicit Drifting Policy: One-Step Action Generation via Conditional Expert Geometry2026/6/1
- RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation2026/6/1
- Q-VGM: Q-Value-Gradient Matching for Off-Policy Reinforcement Learning of Flow-Matching VLA2026/6/1
- Enforcing Human-like Kinematics in Dexterous Piano Playing via Adversarial Posture Regularization2026/6/1
- EBench: Elemental Diagnosis of Generalist Mobile Manipulation Policies2026/6/1
- dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models2026/6/1
- ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?2026/6/1
- V2P-Manip: Learning Dexterous Manipulation from Monocular Human Videos2026/6/1
- ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning2026/6/1
- AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing2026/6/1
- SA-VLA: State-aware tokenizer for improving Vision-Language-Action Models' performance2026/6/1
- LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models2026/6/1
- DeformGen: Dynamics-Based Topology Augmentation for Deformable Manipulation Policy Learning2026/6/1
- HyperSim: A Holistic Sim-To-Real Framework For Robust Robotic Manipulation2026/5/1
- BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models2026/5/1
- $\pi_0$-EqM: Equilibrium Matching for Closed-Loop Vision-Language-Action Control2026/5/1
- Dexora: Open-source VLA for High-DoF Bimanual Dexterity2026/5/1
- DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo2026/5/1
- HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System2026/4/1
- JailWAM: Jailbreaking World Action Models in Robot Control2026/4/1
- RMBench: Memory-Dependent Robotic Manipulation Benchmark with Insights into Policy Design2026/3/1
- From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation2026/3/1
- RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks2026/3/1
- R3DP: Real-Time 3D-Aware Policy for Embodied Manipulation2026/3/1
- ManiTwin: Scaling Data-Generation-Ready Digital Object Dataset to 100K2026/3/1
- SldprtNet: A Large-Scale Multimodal Dataset for CAD Generation in Language-Driven 3D Design2026/3/1
- DexHiL: A Human-in-the-Loop Framework for Vision-Language-Action Model Post-Training in Dexterous Manipulation2026/3/1
- ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments2026/3/1
- UniVTAC: A Unified Simulation Platform for Visuo-Tactile Manipulation Data Generation, Learning, and Benchmarking2026/2/1
- CLOT: Closed-Loop Global Motion Tracking for Whole-Body Humanoid Teleoperation2026/2/1
- Advances and Innovations in the Multi-Agent Robotic System (MARS) Challenge2026/1/1
- MM-ACT: Learn from Multimodal Parallel Generation to Act2025/12/1
- FieldGen: From Teleoperated Pre-Manipulation Trajectories to Field-Guided Data Generation2025/10/1
- Expertise need not monopolize: Action-Specialized Mixture of Experts for Vision-Language-Action Learning2025/10/1
- InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy2025/10/1
- SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning2025/9/1
- PASG: A Closed-Loop Framework for Automated Geometric Primitive Extraction and Semantic Anchoring in Robotic Manipulation2025/8/1
- HyCodePolicy: Hybrid Language Controllers for Multimodal Monitoring and Decision in Embodied Agents2025/8/1
- Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies2025/8/1
- Research Challenges and Progress in the End-to-End V2X Cooperative Autonomous Driving Competition2025/7/1
- FMimic: Foundation Models are Fine-grained Action Learners from Human Videos2025/7/1
- ArtGS:3D Gaussian Splatting for Interactive Visual-Physical Modeling and Manipulation of Articulated Objects2025/7/1
- RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation2025/6/1
- OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis2025/6/1
- Benchmarking Generalizable Bimanual Manipulation: RoboTwin Dual-Arm Collaboration Challenge at CVPR 2025 MEIS Workshop2025/6/1
- RADE: Learning Risk-Adjustable Driving Environment via Multi-Agent Conditional Diffusion2025/5/1
- AutoBio: A Simulation and Benchmark for Robotic Automation in Digital Biology Laboratory2025/5/1
- SwarmDiff: Swarm Robotic Trajectory Planning in Cluttered Environments via Diffusion Transformer2025/5/1
- Dexterous Manipulation through Imitation Learning: A Survey2025/4/1
- RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins2025/4/1
- AINav: Large Language Model-Based Adaptive Interactive Navigation2025/3/1
- AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems2025/3/1
- AVR: Active Vision-Driven Precise Robot Manipulation with Viewpoint and Focal Length Optimization2025/3/1
- RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete2025/2/1
- SafeDrive: Knowledge- and Data-Driven Risk-Sensitive Decision-Making for Autonomous Vehicles with Large Language Models2024/12/1
- M$^3$PC: Test-time Model Predictive Control for Pretrained Masked Trajectory Model2024/12/1
- G3Flow: Generative 3D Semantic Flow for Pose-aware and Generalizable Object Manipulation2024/11/1
- DexHandDiff: Interaction-aware Diffusion Planning for Adaptive Dexterous Manipulation2024/11/1
- EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents2024/10/1
- VLMimic: Vision Language Models are Visual Imitation Learner for Fine-grained Actions2024/10/1
- RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins (early version)2024/9/1
- Cog-GA: A Large Language Models-based Generative Agent for Vision-Language Navigation in Continuous Environments2024/9/1
- Articulated Object Manipulation using Online Axis Estimation with SAM2-Based Tracking2024/9/1
- HiAgent: Hierarchical Working Memory Management for Solving Long-Horizon Agent Tasks with Large Language Model2024/8/1
- CAMON: Cooperative Agents for Multi-Object Navigation with LLM-based Conversations2024/7/1
- DAG-Plan: Generating Directed Acyclic Dependency Graphs for Dual-Arm Cooperative Planning2024/6/1
- Learning Reward for Robot Skills Using Large Language Models via Self-Alignment2024/5/1
- ManiPose: A Comprehensive Benchmark for Pose-aware Object Manipulation in Robotics2024/3/1
- RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis2024/2/1
- RoboScript: Code Generation for Free-Form Manipulation Tasks across Real and Simulation2024/2/1
- DOZE: A Dataset for Open-Vocabulary Zero-Shot Object Navigation in Dynamic Environments2024/2/1
- VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language Model2024/1/1
- SkillDiffuser: Interpretable Hierarchical Planning via Skill Abstractions in Diffusion-Based Task Execution2023/12/1
- Human-oriented Representation Learning for Robotic Manipulation2023/10/1
- LanguageMPC: Large Language Models as Decision Makers for Autonomous Driving2023/10/1
- Tree-Planner: Efficient Close-loop Task Planning with Large Language Models2023/10/1
- EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought2023/5/1
- EUCLID: Towards Efficient Unsupervised Reinforcement Learning with Multi-choice Dynamics Model2022/10/1
- CO^3: Cooperative Unsupervised 3D Representation Learning for Autonomous Driving2022/6/1
- Model-based Chance-Constrained Reinforcement Learning via Separated Proportional-Integral Lagrangian2021/8/1
- Steadily Learn to Drive with Virtual Memory2021/2/1
- Mixed Reinforcement Learning with Additive Stochastic Uncertainty2020/3/1