Tongtong Cao
Department of Foundation Model, 2012 Labs
収録論文 17本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Faster-WAM: 世界行動モデルに深い行動モジュールは必要か?VLA2026/8/3
ビデオ世界モデルと行動予測を組み合わせた世界行動モデル(WAM)において、行動モジュールの深さをビデオバックボーンから切り離し、軽量な単層ヘッドをドッキングする設計(DoT)を提案。推論速度を3.2倍高速化しつつ、性能と汎化を維持した。
- Faster-WAM: Do World Action Models Need Deep Action Modules?2026/8/1
- RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning2026/7/1
- KAM-WM: Kinematic Affordance Maps from Latent World Models for Robot Manipulation2026/7/1
- Decoupling Semantics and Geometric Grounding: Spatial Visual Prompts for Language-Conditioned Imitation Learning2026/6/1
- Anticipation-VLA: Solving Long-Horizon Embodied Tasks via Anticipation-based Subgoal Generation2026/5/3
- Anticipation-VLA: Solving Long-Horizon Embodied Tasks via Anticipation-based Subgoal Generation2026/5/1
- RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models2026/5/1
- Do World Action Models Generalize Better than VLAs? A Robustness Study2026/3/1
- Efficient Camera Pose Augmentation for View Generalization in Robotic Policy Learning2026/3/1
- H-WM: Robotic Task and Motion Planning Guided by Hierarchical World Model2026/2/1
- CAPE: Context-Aware Diffusion Policy Via Proximal Mode Expansion for Collision Avoidance2025/11/1
- UnPose: Uncertainty-Guided Diffusion Priors for Zero-Shot Pose Estimation2025/8/1
- HIPPo: Harnessing Image-to-3D Priors for Model-free Zero-shot 6D Pose Estimation2025/2/1
- Mem2Ego: Empowering Vision-Language Models with Global-to-Ego Memory for Long-Horizon Embodied Navigation2025/2/1
- SpatialCoT: Advancing Spatial Reasoning through Coordinate Alignment and Chain-of-Thought for Embodied Task Planning2025/1/1
- ET-Plan-Bench: Embodied Task-level Planning Benchmark Towards Spatial-Temporal Cognition with Foundation Models2024/10/1