Tao Kong
収録論文 30本 ・ フィジカルAI/ロボット学習
VLA/操作
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- BridgeVLA++: データ効率的で汎化性が高く、メモリ拡張された3D操作のための視覚-言語-行動フレームワークVLA/操作2026/8/5
事前学習済み視覚言語モデルを活用した3Dロボット操作フレームワークBridgeVLAを拡張し、空間的・時間的メモリを統合することで、データ効率と汎化性を保ちつつ、記憶依存の操作タスクで最先端の性能を達成した。
- BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation2026/8/1
- SpatialVAM:Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy2026/4/1
- GR-RL: Going Dexterous and Precise for Long-Horizon Robotic Manipulation2025/12/1
- Manipulation as in Simulation: Enabling Accurate Geometry Perception in Robots2025/9/1
- GR-3 Technical Report2025/7/1
- BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models2025/6/1
- Chain-of-Action: Trajectory Autoregressive Modeling for Robotic Manipulation2025/6/1
- Human-assisted Robotic Policy Refinement via Action Preference Optimization2025/6/1
- What Matters in Building Vision-Language-Action Models for Generalist Robots2024/12/1
- GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation2024/10/1
- World Model-based Perception for Visual Legged Locomotion2024/9/1
- GR-MG: Leveraging Partially Annotated Data via Multi-Modal Goal-Conditioned Policy2024/8/1
- IRASim: A Fine-Grained World Model for Robot Manipulation2024/6/1
- SInViG: A Self-Evolving Interactive Visual Agent for Human-Robot Interaction2024/2/1
- Towards Unified Interactive Visual Grounding in The Wild2024/1/1
- Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation2023/12/1
- Vision-Language Foundation Models as Effective Robot Imitators2023/11/1
- InViG: Benchmarking Interactive Visual Grounding with 500K Human-Robot Interactions2023/10/1
- Exploring Visual Pre-training for Robot Manipulation: Datasets, Models and Methods2023/8/1
- MOMA-Force: Visual-Force Imitation for Real-World Mobile Manipulation2023/8/1
- Learning to Explore Informative Trajectories and Samples for Embodied Perception2023/3/1
- Generative Category-Level Shape and Pose Estimation with Semantic Primitives2022/10/1
- 3D Part Assembly Generation with Instance Encoded Transformer2022/7/1
- Learning Design and Construction with Varying-Sized Materials via Prioritized Memory Resets2022/4/1
- Navigating to Objects in Unseen Environments by Distance Prediction2022/2/1
- Simultaneous Semantic and Collision Learning for 6-DoF Grasp Pose Estimation2021/8/1
- ICM-3D: Instantiated Category Modeling for 3D Instance Segmentation2021/8/1
- Learning to Design and Construct Bridge without Blueprint2021/8/1
- Adversarial Option-Aware Hierarchical Imitation Learning2021/6/1