Jian Tang
Beijing Innovation Center of Humanoid Robotics
収録論文 62本 ・ フィジカルAI/ロボット学習
ヒューマノイド/VLA/強化学習介入学習/強化学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HAF: 階層的アクションフローとスペクトル潜在RLによる汎用VLAのヒューマノイド全身移動操作への適応ヒューマノイド/VLA/強化学習2026/8/17
汎用VLA基盤モデルをヒューマノイドの全身移動操作に適応させるための2部構成フレームワークHAFを提案。階層的なアクション生成とオンラインRLによるポリシー改善を実現する。
- GAINS: 強化学習における不整合な人間介入信号の活用介入学習/強化学習2026/8/16
人間の介入信号の遅延や不整合性を扱うため、分布強化学習と悲観的探索を用いた介入ベースのロボット操作学習フレームワークを提案し、シミュレーションと実機で高い成功率を達成した。
- Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning2026/7/1
- Pelican-VLA 0.5: Attending Before Acting Benefits Generalization2026/7/1
- MV-WAM: Manifold-Aware World Action Model with Value Augmentation2026/6/1
- SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model2026/6/1
- IOI: Decoupling Kinematics and Physics for Interactive World Models2026/6/1
- WAM4D: Fast 4D World Action Model via Spatial Register Tokens2026/6/1
- Labimus: A Simulation and Benchmark for Humanoid Dexterous Manipulation in Chemical Laboratory2026/6/1
- Pelican-Unify 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action2026/5/1
- VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models2026/5/1
- RobotPan: A 360$^\circ$ Surround-View Robotic Vision System for Embodied Perception2026/4/1
- HEX: Humanoid-Aligned Experts for Cross-Embodiment Whole-Body Manipulation2026/4/1
- Load-Aware Locomotion Control for Humanoid Robots in Industrial Transportation Tasks2026/3/1
- Heracles: Bridging Precise Tracking and Generative Synthesis for General Humanoid Control2026/3/1
- RoboGene: Boosting VLA Pre-training via Diversity-Driven Agentic Framework for Real-World Task Generation2026/2/1
- MeshMimic: Geometry-Aware Humanoid Motion Learning through 3D Scene Reconstruction2026/2/1
- RoboAug: One Annotation to Hundreds of Scenes via Region-Contrastive Data Augmentation for Robotic Manipulation2026/2/1
- CRAFT: Adapting VLA Models to Contact-rich Manipulation via Force-aware Curriculum Fine-tuning2026/2/1
- Wow, wo, val! A Comprehensive Embodied World Model Evaluation Turing Test2026/1/1
- LaST$_{0}$: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model2026/1/1
- TC-IDM: Grounding Video Generation for Executable Zero-shot Robot Motion2026/1/1
- Bridging Simulation and Reality: Cross-Domain Transfer with Semantic 2D Gaussian Splatting2025/12/1
- Real-world Reinforcement Learning from Suboptimal Interventions2025/12/1
- RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence2025/12/1
- Pelican-VL 1.0: A Foundation Brain Model for Embodied Intelligence2025/11/1
- XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations2025/11/1
- PoseDiff: A Unified Diffusion Model Bridging Robot Pose Estimation and Video-to-Action Control2025/9/1
- MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation2025/9/1
- WoW: Towards a World omniscient World model Through Embodied Interaction2025/9/1
- LHM-Humanoid: Long-Horizon Human Motion Control for Continuous Object Transport in Cluttered Scenes2025/8/1
- Training-free Generation of Temporally Consistent Rewards from VLMs2025/7/1
- Humanoid Occupancy: Enabling A Generalized Multimodal Occupancy Perception System on Humanoid Robots2025/7/1
- RoboPARA: Dual-Arm Robot Planning with Parallel Allocation and Recomposition Across Tasks2025/6/1
- FreqPolicy: Efficient Flow-based Visuomotor Policy via Frequency Consistency2025/6/1
- ArtVIP: Articulated Digital Assets of Visual Realism, Modular Interaction, and Physical Fidelity for Robot Learning2025/6/1
- SwitchVLA: Execution-Aware Task Switching for Vision-Language-Action Models2025/6/1
- Occupancy World Model for Robots2025/5/1
- RoboOcc: Enhancing the Geometric and Semantic Scene Understanding for Robots2025/4/1
- HACTS: a Human-As-Copilot Teleoperation System for Robot Learning2025/3/1
- HumanoidPano: Hybrid Spherical Panoramic-LiDAR Cross-Modal Perception for Humanoid Robots2025/3/1
- EmbodiedVSR: Dynamic Scene Graph-Guided Chain-of-Thought Reasoning for Visual Spatial Tasks2025/3/1
- ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning2024/12/1
- RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation2024/12/1
- REGNet V2: End-to-End REgion-based Grasp Detection Network for Grippers of Different Sizes in Point Clouds2024/10/1
- Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation2024/9/1
- DexDiff: Towards Extrinsic Dexterity Manipulation of Ungraspable Objects in Unrestricted Environments2024/9/1
- Scaling Diffusion Policy in Transformer to 1 Billion Parameters for Robotic Manipulation2024/9/1
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation2024/9/1
- MMRo: Are Multimodal LLMs Eligible as the Brain for In-Home Robotics?2024/6/1
- Retrieval-Augmented Embodied Agents2024/4/1
- A Survey on Robotics with Foundation Models: toward Embodied AI2024/2/1
- Language-Conditioned Robotic Manipulation with Fast and Slow Thinking2024/1/1
- Visual Robotic Manipulation with Depth-Aware Pretraining2024/1/1
- SM$^3$: Self-Supervised Multi-task Modeling with Multi-view 2D Images for Articulated Objects2024/1/1
- Efficient Training of Generalizable Visuomotor Policies via Control-Aware Augmentation2024/1/1
- Learning from Imperfect Demonstrations with Self-Supervision for Robotic Manipulation2024/1/1
- Object-Centric Instruction Augmentation for Robotic Manipulation2024/1/1
- DTF-Net: Category-Level Pose Estimation and Shape Reconstruction via Deformable Template Field2023/8/1
- Prioritized Planning for Target-Oriented Manipulation via Hierarchical Stacking Relationship Prediction2023/3/1
- CMG-Net: An End-to-End Contact-Based Multi-Finger Dexterous Grasping Network2023/3/1
- Robotic Grasping from Classical to Modern: A Survey2022/2/1