Yanwei Fu
Fudan University
収録論文 35本 ・ フィジカルAI/ロボット学習
VLA/強化学習VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- StructRL: フローベースVLAのための構造化アクション空間探索VLA/強化学習2026/8/15
フローベースの視覚言語行動モデル(VLA)のオンライン強化学習において、ノイズをアクション空間に直接注入する構造化探索手法StructRLを提案し、シミュレーションと実世界タスクで性能を向上させた。
- Vid2WAM: ビデオ拡散事前知識を世界行動モデルへ蒸留するVLA2026/8/9
大規模ビデオ基盤モデルの拡散事前知識をコンパクトな世界行動モデルに蒸留し、専門家デモの少ない環境でもロボットの汎化性能とデータ効率を向上させる手法を提案した。
- Vid2WAM: Distilling Video Diffusion Priors into World Action Models2026/8/1
- $\tau_0$-WM: A Unified Video-Action World Model for Robotic Manipulation2026/6/1
- Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance2026/5/1
- STABLE: Simulation-Ready Tabletop Layout Generation via a Semantics-Physics Dual System2026/5/1
- VADF: Vision-Adaptive Diffusion Policy Framework for Efficient Robotic Manipulation2026/4/1
- OFlow: Injecting Object-Aware Temporal Flow Matching for Robust Robotic Manipulation2026/4/1
- Robotic Grasping and Placement Controlled by EEG-Based Hybrid Visual and Motor Imagery2026/3/1
- OCRA: Object-Centric Learning with 3D and Tactile Priors for Human-to-Robot Action Transfer2026/3/1
- PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies2026/2/23
- PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies2026/2/1
- Say, Dream, and Act: Learning Video World Models for Instruction-Driven Robot Manipulation2026/2/1
- ST4VLA: Spatially Guided Training for Vision-Language-Action Models2026/2/1
- ActiveVLA: Injecting Active Perception into Vision-Language-Action Models for Precise 3D Robotic Manipulation2026/1/1
- DST-Calib: A Dual-Path, Self-Supervised, Target-Free LiDAR-Camera Extrinsic Calibration Network2026/1/1
- Schr\"odinger's Navigator: Imagining an Ensemble of Futures for Zero-Shot Object Navigation2025/12/1
- TP-MDDN: Task-Preferenced Multi-Demand-Driven Navigation with Autonomous Decision-Making2025/11/1
- SCOOP'D: Learning Mixed-Liquid-Solid Scooping via Sim2Real Generative Policy2025/10/1
- InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy2025/10/1
- TriVLA: A Triple-System-Based Unified Vision-Language-Action Model with Episodic World Modeling for General Robot Control2025/7/1
- Diffusion-Based Imaginative Coordination for Bimanual Manipulation2025/7/1
- Spatial-Temporal Aware Visuomotor Diffusion Policy Learning2025/7/1
- A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding2025/7/1
- You Only Estimate Once: Unified, One-stage, Real-Time Category-level Articulated Object 6D Pose Estimation for Robotic Grasping2025/6/1
- CAP-Net: A Unified Network for 6D Pose and Size Estimation of Categorical Articulated Parts from a Single RGB-D Image2025/4/1
- Sequential Multi-Object Grasping with One Dexterous Hand2025/3/1
- SparseGrasp: Robotic Grasping via 3D Semantic Gaussian Splatting from Sparse Multi-View RGB Images2024/12/1
- LAC-Net: Linear-Fusion Attention-Guided Convolutional Network for Accurate Robotic Grasping Under the Occlusion2024/8/1
- Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models2024/8/1
- WALL-E: Embodied Robotic WAiter Load Lifting with Large Language Model2023/8/1
- PourIt!: Weakly-supervised Liquid Perception from a Single Image for Visual Closed-Loop Robotic Pouring2023/7/1
- I Know What You Draw: Learning Grasp Detection Conditioned on a Few Freehand Sketches2022/5/1
- Learning 6-DoF Object Poses to Grasp Category-level Objects by Language Instructions2022/5/1
- SAR-Net: Shape Alignment and Recovery Network for Category-level 6D Object Pose and Size Estimation2021/6/1