Shanghang Zhang
Peking University
収録論文 100本 ・ フィジカルAI/ロボット学習
所属歴(論文より): Peking University(〜2026) / PKU(〜2026)
ヒューマノイド/VLA/強化学習マニピュレーションシミュレータ評価全身制御
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HAF: 階層的アクションフローとスペクトル潜在RLによる汎用VLAのヒューマノイド全身移動操作への適応ヒューマノイド/VLA/強化学習2026/8/17
汎用VLA基盤モデルをヒューマノイドの全身移動操作に適応させるための2部構成フレームワークHAFを提案。階層的なアクション生成とオンラインRLによるポリシー改善を実現する。
- ロボ・ドーパミン2.0:ロボット操作のための履歴条件付き・OOD認識プロセス報酬モデリングマニピュレーション2026/8/16
VLAモデルのロボット操作における報酬設計を改善するため、履歴とOOD(分布外)を考慮したプロセス報酬モデルを提案し、ペアワイズ予測インターフェースとSigned-Hopカリキュラムで学習精度を向上させた。
- WorldSimProbe: 身体的操作のための行動条件付きワールドモデルにおけるシミュレータ忠実度の診断シミュレータ評価2026/8/10
行動条件付きワールドモデル(ACWM)が物理シミュレータとして忠実に機能するかを検証するための評価手法WorldSimProbeを提案し、複数のベンチマークで既存モデルの系統的な欠陥を明らかにした。
- ω-0: 人間型ロボットの同時移動操作のための潜在予測世界行動モデル全身制御2026/8/6
人間型ロボットが移動と操作を同時に行うための、言語指示と視覚・状態情報から全身の行動潜在変数を直接予測する世界行動モデルを提案し、実世界の家事タスクで有効性を示した。
- $\omega$-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-Manipulation2026/8/1
- WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation2026/8/1
- TACO: TActile World Model as a Self-COrrector forScalable VLA Post-Training2026/7/1
- FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution2026/7/1
- Data Pyramid for Embodied Manipulation: A Survey2026/7/1
- Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation2026/7/1
- Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation2026/6/1
- WAM4D: Fast 4D World Action Model via Spatial Register Tokens2026/6/1
- FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation2026/6/1
- SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model2026/6/1
- MV-WAM: Manifold-Aware World Action Model with Value Augmentation2026/6/1
- IOI: Decoupling Kinematics and Physics for Interactive World Models2026/6/1
- LaST-HD: Learning Latent Physical Reasoning from Scalable Human Data for Robot Manipulation2026/6/1
- WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT2026/6/1
- Efficient-WAM: A 1B-Parameter World-Action Model with Low-Cost Future Imagination2026/6/1
- World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks2026/5/1
- Demo-JEPA: Joint-Embedding Predictive Architecture for One-shot Cross-Embodiment Imitation2026/5/1
- HarmoWAM: Harmonizing Generalizable and Precise Manipulation via Adaptive World Action Models2026/5/1
- VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models2026/5/1
- Dexora: Open-source VLA for High-DoF Bimanual Dexterity2026/5/1
- LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning2026/4/1
- Mask World Model: Predicting What Matters for Robust Robot Policy Learning2026/4/1
- HEX: Humanoid-Aligned Experts for Cross-Embodiment Whole-Body Manipulation2026/4/1
- Hi-WM: Human-in-the-World-Model for Scalable Robot Post-Training2026/4/1
- PRM-as-a-Judge: A Dense Evaluation Paradigm for Fine-Grained Robotic Auditing2026/3/1
- SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics2026/3/1
- URDF-Anything+: End-to-End Generation for Simulation-Ready Articulated Assets2026/3/1
- AoE: Always-on Egocentric Human Video Collection for Embodied AI2026/2/1
- Reshaping Action Error Distributions for Reliable Vision-Language-Action Models2026/2/1
- TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation2026/2/1
- Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models2026/2/1
- Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation2026/1/1
- TC-IDM: Grounding Video Generation for Executable Zero-shot Robot Motion2026/1/1
- From Digital to Physical: Digital Agents as Autonomous Coaches for Physical Intelligence2026/1/1
- RoboBrain 2.5: Depth in Sight, Time in Mind2026/1/1
- LaST$_{0}$: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model2026/1/1
- Wow, wo, val! A Comprehensive Embodied World Model Evaluation Turing Test2026/1/1
- ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation2025/12/1
- Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics2025/12/1
- Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio-Motional Modeling2025/12/1
- RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence2025/12/1
- RoboMirror: Understand Before You Imitate for Video to Humanoid Locomotion2025/12/1
- Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control2025/12/1
- Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives2025/12/1
- Robo-Dopamine: General Process Reward Modeling for High-Precision Robotic Manipulation2025/12/1
- METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model2025/11/1
- RoboCOIN: An Open-Sourced Bimanual Robotic Data Collection for Integrated Manipulation2025/11/1
- RoboArmGS: High-Quality Robotic Arm Splatting via B\'ezier Curve Refinement2025/11/1
- PIGEON: VLM-Driven Object Navigation via Points of Interest Selection2025/11/1
- URDF-Anything: Constructing Articulated Objects with 3D Multimodal Language Model2025/11/1
- XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations2025/11/1
- DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action2025/11/1
- Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain2025/10/1
- OmniSAT: Compact Action Token, Faster Auto Regression2025/10/1
- From Language to Locomotion: Retargeting-free Humanoid Control via Motion Latent Guidance2025/10/1
- TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics2025/10/1
- RoboOS-NeXT: A Unified Memory-based Framework for Lifelong, Scalable, and Robust Multi-Robot Collaboration2025/10/1
- WristWorld: Generating Wrist-Views via 4D World Models for Robotic Manipulation2025/10/1
- Towards a Unified Understanding of Robot Manipulation: A Comprehensive Survey2025/10/1
- SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning2025/9/11
- dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought2025/9/1
- ManipDreamer3D : Synthesizing Plausible Robotic Manipulation Video with Occupancy-aware 3D Trajectory2025/9/1
- PoseDiff: A Unified Diffusion Model Bridging Robot Pose Estimation and Video-to-Action Control2025/9/1
- WoW: Towards a World omniscient World model Through Embodied Interaction2025/9/1
- MotionTrans: Human VR Data Enable Motion-Level Learning for Robotic Manipulation Policies2025/9/1
- SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning2025/9/1
- MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation2025/9/1
- LHM-Humanoid: Long-Horizon Human Motion Control for Continuous Object Transport in Cluttered Scenes2025/8/1
- $NavA^3$: Understanding Any Instruction, Navigating Anywhere, Finding Anything2025/8/1
- AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation2025/7/1
- Research Challenges and Progress in the End-to-End V2X Cooperative Autonomous Driving Competition2025/7/1
- RwoR: Generating Robot Demonstrations from Human Hand Collection for Policy Learning without Robot2025/7/1
- RoboBrain 2.0 Technical Report2025/7/1
- Fast-in-Slow: A Dual-System Foundation Model Unifying Fast Manipulation within Slow Reasoning2025/6/1
- SpikePingpong: Spike Vision-based Fast-Slow Pingpong Robot System2025/6/1
- RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics2025/6/1
- MinD: Learning A Dual-System World Model for Real-Time Planning and Implicit Risk Analysis2025/6/1
- CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation2025/5/1
- OmniIndoor3D: Comprehensive Indoor 3D Reconstruction2025/5/1
- H2R: A Human-to-Robot Data Augmentation for Robot Pre-training from Videos2025/5/1
- RoboOS: A Hierarchical Embodied Framework for Cross-Embodiment and Multi-Agent Collaboration2025/5/1
- GeoDrive: 3D Geometry-Informed Driving World Model with Precise Action Control2025/5/1
- ManipDreamer: Boosting Robotic Manipulation World Model with Action Tree and Visual Guidance2025/4/1
- MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation2025/3/1
- AffordGrasp: In-Context Affordance Reasoning for Open-Vocabulary Task-Oriented Grasping in Clutter2025/3/1
- HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model2025/3/1
- CordViP: Correspondence-based Visuomotor Policy for Dexterous Manipulation in Real-World2025/2/1
- MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation2025/2/1
- RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete2025/2/1
- GaussianAD: Gaussian-Centric End-to-End Autonomous Driving2024/12/1
- RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation2024/12/1
- GPD-1: Generative Pre-training for Driving2024/12/1
- EVA: An Embodied World Model for Future Video Anticipation2024/10/1
- DAG-Plan: Generating Directed Acyclic Dependency Graphs for Dual-Arm Cooperative Planning2024/6/1
- DOZE: A Dataset for Open-Vocabulary Zero-Shot Object Navigation in Dynamic Environments2024/2/1
- VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language Model2024/1/1