Yonatan Bisk
Carnegie Mellon University
収録論文 41本 ・ フィジカルAI/ロボット学習
VLA/行動表現
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 再構築の迷子:視覚-言語-行動モデルにおける行動表現と言語の整合VLA/行動表現2026/8/11
行動軌跡には言語的意味情報が含まれるが、再構築のみのトークン化で失われるため、凍結VLMで指示を復元する補助損失を持つセマンティック整合トークナイザSALTを提案し、言語条件付き制御の成功率を大幅に向上させた。
- Lost in Reconstruction: Aligning Action Representations with Language in Vision-Language-Action Models2026/8/1
- Inductive Generalization for Robotic Manipulation2026/6/19
- ELASTIC: Efficiently Learning to Adaptively Scale Test-Time Compute for Generative Control Policies2026/6/1
- Inductive Generalization for Robotic Manipulation2026/6/1
- Flatness Preserves Instruction Following in Vision-Language-Action Models2026/6/1
- IndoorR2X: Indoor Robot-to-Everything Coordination with LLM-Driven Planning2026/3/1
- Affordance RAG: Hierarchical Multimodal Retrieval with Affordance-Aware Embodied Memory for Mobile Manipulation2025/12/1
- RobotArena $\infty$: Scalable Robot Benchmarking via Real-to-Sim Translation2025/10/27
- RobotArena $\infty$: Scalable Robot Benchmarking via Real-to-Sim Translation2025/10/1
- High Torque Density PCB Axial Flux Permanent Magnet Motor for Micro Robots2025/9/1
- RAVEN: Resilient Aerial Navigation via Open-Set Semantic Memory and Behavior Adaptation2025/9/1
- Casper: Inferring Diverse Intents for Assistive Teleoperation with Vision Language Models2025/6/1
- ANAVI: Audio Noise Awareness using Visuals of Indoor environments for NAVIgation2024/10/1
- MotIF: Motion Instruction Fine-tuning2024/9/1
- Embodied-RAG: General Non-parametric Embodied Memory for Retrieval and Generation2024/9/1
- DegustaBot: Zero-Shot Visual Preference Estimation for Personalized Multi-Object Rearrangement2024/7/1
- Situated Instruction Following2024/7/1
- Towards Open-World Mobile Manipulation in Homes: Lessons from the Neurips 2023 HomeRobot Open Vocabulary Mobile Manipulation Challenge2024/7/1
- Dialogue with Robots: Proposals for Broadening Participation and Research in the SLIVAR Community2024/4/1
- Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers2024/3/1
- Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis2023/12/1
- Bridging Language and Action: A Survey of Language-Conditioned Robot Manipulation2023/12/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- MOSAIC: Learning Unified Multi-Sensory Object Property Representations for Robot Learning via Interactive Perception2023/9/1
- Reasoning about the Unseen for Efficient Outdoor Object Navigation2023/9/1
- MAEA: Multimodal Attribution for Embodied AI2023/7/1
- HomeRobot: Open-Vocabulary Mobile Manipulation2023/6/1
- Spatial-Language Attention Policies for Efficient Robot Learning2023/4/1
- Self-Supervised Object Goal Navigation with In-Situ Finetuning2022/12/1
- Transformers are Adaptable Task Planners2022/7/1
- A Framework for Learning to Request Rich and Contextually Useful Information from Humans2021/10/1
- Language Grounding with 3D Objects2021/7/1
- ALFWorld: Aligning Text and Embodied Environments for Interactive Learning2020/10/1
- RMM: A Recursive Mental Model for Dialog Navigation2020/5/1
- ALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday Tasks2019/12/1
- Improving Robot Success Detection using Static Object Data2019/4/1
- Prospection: Interpretable Plans From Language By Predicting the Future2019/3/1
- Tactical Rewind: Self-Correction via Backtracking in Vision-and-Language Navigation2019/3/1
- Early Fusion for Goal Directed Robotic Vision2018/11/1
- Balancing Shared Autonomy with Human-Robot Communication2018/5/1