Jing Zhang
Renmin University of China
収録論文 36本 ・ フィジカルAI/ロボット学習
VLA/世界モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- JEPA-WAM: 共同埋め込み世界モデリングによる視覚・言語・行動ポリシーの学習VLA/世界モデル2026/8/10
事前学習済みV-JEPA空間に基づく潜在世界モデルを導入し、遷移予測と行動生成を共有予測器で結合することで、ロボット制御の性能と汎化を向上させた。
- JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling2026/8/1
- A Unified Benchmark for RCM-Constrained Visual Servoing: Modeling-Controller Interaction and Robustness Analysis in Laparoscopic Robots2026/7/1
- Cosmos 3: Omnimodal World Models for Physical AI2026/6/1
- Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision2026/6/1
- ProcVLM: Learning Procedure-Grounded Progress Rewards for Robotic Manipulation2026/5/1
- MAGS-SLAM: Monocular Multi-Agent Gaussian Splatting SLAM for Geometrically and Photometrically Consistent Reconstruction2026/5/1
- From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models2026/5/1
- Walk With Me: Long-Horizon Social Navigation for Human-Centric Outdoor Assistance2026/4/1
- SAMe: A Semantic Anatomy Mapping Engine for Robotic Ultrasound2026/4/1
- Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model2026/3/1
- EgoPush: Learning End-to-End Egocentric Multi-Object Rearrangement for Mobile Robots2026/2/1
- AdaWorldPolicy: World-Model-Driven Diffusion Policy with Online Adaptive Learning for Robotic Manipulation2026/2/1
- AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention2025/11/24
- Compressor-VLA: Instruction-Guided Visual Token Compression for Efficient Robotic Manipulation2025/11/24
- Wanderland: Geometrically Grounded Simulation for Open-World Embodied AI2025/11/1
- Compressor-VLA: Instruction-Guided Visual Token Compression for Efficient Robotic Manipulation2025/11/1
- AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention2025/11/1
- World Simulation with Video Foundation Models for Physical AI2025/11/1
- A novel gesture interaction control method for rehabilitation lower extremity exoskeleton2025/4/1
- MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation2025/2/1
- Cosmos World Foundation Model Platform for Physical AI2025/1/1
- Adversarial Exploitation of Data Diversity Improves Visual Localization2024/12/1
- CityWalker: Learning Embodied Urban Navigation from Web-Scale Videos2024/11/1
- FusionSense: Bridging Common Sense, Vision, and Touch for Robust Sparse-View Reconstruction2024/10/1
- BEVNav: Robot Autonomous Navigation Via Spatial-Temporal Contrastive Learning in Bird's-Eye View2024/9/1
- Is Your HD Map Constructor Reliable under Sensor Corruptions?2024/6/1
- The RoboDrive Challenge: Drive Anytime Anywhere in Any Condition2024/5/1
- SurgicalPart-SAM: Part-to-Whole Collaborative Prompting for Surgical Instrument Segmentation2023/12/1
- Hierarchical Reinforcement Learning Based on Planning Operators2023/9/1
- SurgicalSAM: Efficient Class Promptable Surgical Instrument Segmentation2023/8/1
- Event-based Simultaneous Localization and Mapping: A Comprehensive Survey2023/4/1
- Localizing Scan Targets from Human Pose for Autonomous Lung Ultrasound Imaging2022/12/1
- 1st Workshop on Maritime Computer Vision (MaCVi) 2023: Challenge Results2022/11/1
- Center-of-Mass-based Robust Grasp Pose Adaptation Using RGBD Camera and Force/Torque Sensing2022/5/1
- SerialTrack: ScalE and Rotation Invariant Augmented Lagrangian Particle Tracking2022/3/1