Pengwei Wang
Beijing Academy of Artificial Intelligence
収録論文 37本 ・ フィジカルAI/ロボット学習
所属歴(論文より): Beijing Academy of Artificial Intelligence(〜2026) / BAAI(〜2026)
評価指標VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PRM-as-a-Judge 1.5: ロボットプロセス評価のためのツールキット評価指標2026/8/14
ロボットの動作動画から詳細な進捗曲線を生成し、失敗側の進捗や回復能力、成功側の実行品質など複数の細かい指標を導出する評価ツールキットを提案した。
- SLIM-0.5B: ロボット操作のための行動基盤予測潜在表現の学習VLA2026/8/10
小型の0.5Bパラメータの潜在相互作用ポリシーを提案し、行動に基づく予測潜在表現を自己教師ありで学習することで、大規模VLAモデルと同等以上の性能を少ないパラメータで達成した。
- 4D-WAM: 軌跡フィールドによる世界行動モデルへの時空間認識の注入VLA2026/8/8
ロボットの行動生成と動画予測を統合する世界行動モデルに、3次元軌跡フィールドの時空間知識を表現整合で注入する訓練戦略を提案。局所的な動き整合と長期的な目的地整合の2つの目的関数により、軌跡レベルの時空間表現を学習し、空間理解や実行精度、汎化性を向上させる。
- 4D-WAM: Infusing Spatiotemporal Awareness into World Action Models through Trajectory Fields2026/8/1
- SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation2026/8/1
- FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation2026/6/1
- Dexora: Open-source VLA for High-DoF Bimanual Dexterity2026/5/1
- Mask World Model: Predicting What Matters for Robust Robot Policy Learning2026/4/1
- SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics2026/3/1
- PRM-as-a-Judge: A Dense Evaluation Paradigm for Fine-Grained Robotic Auditing2026/3/1
- AnyTouch 2: General Optical Tactile Representation Learning For Dynamic Tactile Perception2026/2/1
- Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models2026/2/1
- AoE: Always-on Egocentric Human Video Collection for Embodied AI2026/2/1
- Reshaping Action Error Distributions for Reliable Vision-Language-Action Models2026/2/1
- RoboBrain 2.5: Depth in Sight, Time in Mind2026/1/1
- Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation2026/1/1
- Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics2025/12/1
- Robo-Dopamine: General Process Reward Modeling for High-Precision Robotic Manipulation2025/12/1
- Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control2025/12/1
- RoboMirror: Understand Before You Imitate for Video to Humanoid Locomotion2025/12/1
- RoboCOIN: An Open-Sourced Bimanual Robotic Data Collection for Integrated Manipulation2025/11/1
- METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model2025/11/1
- PIGEON: VLM-Driven Object Navigation via Points of Interest Selection2025/11/1
- OmniSAT: Compact Action Token, Faster Auto Regression2025/10/1
- TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics2025/10/1
- Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain2025/10/1
- RoboOS-NeXT: A Unified Memory-based Framework for Lifelong, Scalable, and Robust Multi-Robot Collaboration2025/10/1
- From Language to Locomotion: Retargeting-free Humanoid Control via Motion Latent Guidance2025/10/1
- $NavA^3$: Understanding Any Instruction, Navigating Anywhere, Finding Anything2025/8/1
- RoboBrain 2.0 Technical Report2025/7/1
- AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation2025/7/1
- RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics2025/6/1
- RoboOS: A Hierarchical Embodied Framework for Cross-Embodiment and Multi-Agent Collaboration2025/5/1
- AffordGrasp: In-Context Affordance Reasoning for Open-Vocabulary Task-Oriented Grasping in Clutter2025/3/1
- RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete2025/2/1
- MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation2025/2/1
- Beyond Gait: Learning Knee Angle for Seamless Prosthesis Control in Multiple Scenarios2024/4/1