Haitao Lin
Tencent Robotics X
収録論文 18本 ・ フィジカルAI/ロボット学習
ワールドモデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GeniWorld: 視覚的アクションによるロボット操作のための汎化可能なインタラクティブワールドモデルワールドモデル2026/8/6
事前学習済みビデオ生成モデルとURDFベースのレンダリングを組み合わせ、数値アクションを視覚的アクション表現に変換することで、未見環境へのロバストな汎化を実現するインタラクティブワールドモデルを提案した。
- GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions2026/8/1
- MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models2026/6/1
- Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack2026/6/1
- ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?2026/6/1
- PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies2026/2/23
- PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies2026/2/1
- Human-in-the-loop Online Rejection Sampling for Robotic Manipulation2025/10/1
- You Only Estimate Once: Unified, One-stage, Real-Time Category-level Articulated Object 6D Pose Estimation for Robotic Grasping2025/6/1
- CAP-Net: A Unified Network for 6D Pose and Size Estimation of Categorical Articulated Parts from a Single RGB-D Image2025/4/1
- SparseGrasp: Robotic Grasping via 3D Semantic Gaussian Splatting from Sparse Multi-View RGB Images2024/12/1
- LAC-Net: Linear-Fusion Attention-Guided Convolutional Network for Accurate Robotic Grasping Under the Occlusion2024/8/1
- Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models2024/8/1
- WALL-E: Embodied Robotic WAiter Load Lifting with Large Language Model2023/8/1
- PourIt!: Weakly-supervised Liquid Perception from a Single Image for Visual Closed-Loop Robotic Pouring2023/7/1
- I Know What You Draw: Learning Grasp Detection Conditioned on a Few Freehand Sketches2022/5/1
- Learning 6-DoF Object Poses to Grasp Category-level Objects by Language Instructions2022/5/1
- SAR-Net: Shape Alignment and Recovery Network for Category-level 6D Object Pose and Size Estimation2021/6/1