Fei Xia
収録論文 62本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- アフォーダンスを活用したLLMによる部分的世界モデリングVLA2026/2/11
大規模言語モデルを部分的世界モデルとして捉え、アフォーダンスに基づく予測を抽出することで探索効率とタスク性能を向上させる手法を提案した論文。
- VeoワールドシミュレータによるGeminiロボティクスポリシーの評価sim2real2025/12/1
最先端の動画生成モデルVeoを基盤とした生成評価システムを構築し、ロボットポリシーの通常性能から分布外汎化、物理・意味的安全性までをシミュレーションで評価できることを示した。
- Gemini Robotics 1.5:高度な身体性推論・思考・動作転移で汎用ロボットの最前線を押し広げるVLA2025/10/1
異種ロボットデータから学ぶ動作転移機構と自然言語での多段階推論を組み合わせたVLAモデルと、身体性推論に特化したモデルを発表し、複雑な多段階タスクの実行と解釈性を向上させた。
- 知覚と行動をつなぐ:ロボットの汎化のための空間的に接地された中間表現マニピュレーション2025/6/1
物体中心性・姿勢認識・深度認識という中間表現を専門家エンコーダで学習し、その混合専門家ポリシーで実世界の両手巧み操作タスクの汎化性能を向上させた研究。
- Chain-of-Modality: マルチモーダル人間動画と視覚言語モデルによる操作プログラムの学習VLA2025/4/1
筋電アームバンドやマイクなどで計測した人間の操作動画から、視覚言語モデルがタスク計画と力などの制御パラメータを抽出し、ロボットに操作タスクを実行させる手法を提案した。
- Gemini Robotics:AIを物理世界へVLA2025/3/1
Gemini 2.0を基盤に、ロボットを直接制御できる汎用VLAモデル「Gemini Robotics」と、空間・時間理解を強化した推論モデル「Gemini Robotics-ER」を提案した論文。
- 視覚言語モデルは文脈内価値学習器であるVLA2024/11/1
視覚言語モデルにシャッフルした動画フレームの時系列順序を予測させることで、ロボットやタスク固有の訓練なしに300以上の実世界タスクの進捗を推定できる汎用価値関数を実現した。
- IPPON: 常識に導かれた情報経路計画による物体目標ナビゲーション物体目標ナビゲーション2024/10/1
大規模言語モデルの常識事前知識と3D物体確率マッピングを組み合わせ、未知環境で対象物体へ効率的に到達するゼロショットの経路計画手法を提案し、実機でも検証した。
- Gen2Act: 人間動画生成を活用した汎用ロボットマニピュレーションマニピュレーション2024/9/1
ウェブデータで学習した人間動画生成モデルを使い、生成された動画を条件にロボット方策を学習することで、未見物体や新規動作への汎化を実現した。
- Mobility VLA:長文脈VLMとトポロジカルグラフによるマルチモーダル指示ナビゲーションナビゲーション/VLA2024/7/1
デモ動画と自然言語・画像の指示を入力とし、長文脈VLMで目標フレームを特定、トポロジカルグラフに基づく低レベル方策で実環境をナビゲートする階層型VLAを提案した。
- VADER: マルチロボット・人間協調のための視覚的アフォーダンス検出とエラー回復VLA2024/5/1
視覚的アフォーダンス検出とエラー認識を行い、他ロボットや人間への助け要請を新たなスキルとして組み込むことで、長期的タスクの中断から回復して完遂するフレームワークVADERを提案した。
- GenCHiP: 高精度・接触リッチなマニピュレーションタスクのためのロボットポリシーコード生成マニピュレーション2024/4/1
LLMによるロボットポリシーコード生成を、接触力や剛性の制約を考慮した行動空間の再パラメータ化により高精度・接触リッチなタスクへ拡張し、FMBやNISTタスクボードで成功率を大幅に改善した。
- BEHAVIOR-1K:1000の日常活動とリアルなシミュレーションによる人間中心の身体性AIベンチマークsim2real2024/3/1
人間がロボットにやってほしいと望む1000の日常活動を、50のシーンと9000以上の物体を含む物理シミュレーション環境OMNIGIBSONで再現し、実世界への転移も検証したベンチマークを提案した。
- CoNVOI: 視覚言語モデルを用いた屋内・屋外環境における文脈認識ナビゲーションナビゲーション2024/3/1
視覚言語モデルを活用し、周囲の状況をゼロショットで分類して文脈に応じた行動指示を生成し、障害物のない領域を番号で注釈した画像から経路を選択することで、屋内・屋外での自律ナビゲーションを実現する手法。
- PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs2024/2/1
- Learning to Learn Faster from Human Feedback with Language Model Predictive Control2024/2/1
- AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents2024/1/1
- SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities2024/1/1
- Generative Expressive Robot Behaviors using Large Language Models2024/1/1
- Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis2023/12/1
- Chain of Code: Reasoning with a Language Model-Augmented Code Emulator2023/12/1
- Distilling and Retrieving Generalizable Knowledge for Robot Manipulation via Language Corrections2023/11/1
- RoboVQA: Multimodal Long-Horizon Reasoning for Robotics2023/11/1
- Video Language Planning2023/10/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Creative Robot Tool Use with Large Language Models2023/10/1
- Navigation with Large Language Models: Semantic Guesswork as a Heuristic for Planning2023/10/1
- Physically Grounded Vision-Language Models for Robotic Manipulation2023/9/1
- Q-Transformer: Scalable Offline Reinforcement Learning via Autoregressive Q-Functions2023/9/1
- Gesture-Informed Robot Assistance via Foundation Models2023/9/1
- Robots That Ask For Help: Uncertainty Alignment for Large Language Model Planners2023/7/1
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control2023/7/1
- Large Language Models as General Pattern Machines2023/7/1
- Sonicverse: A Multisensory Simulation Platform for Embodied Household Agents that See and Hear2023/6/1
- Principles and Guidelines for Evaluating Social Robot Navigation Algorithms2023/6/1
- Language to Rewards for Robotic Skill Synthesis2023/6/1
- Open-World Object Manipulation using Pre-trained Vision-Language Models2023/3/1
- PaLM-E: An Embodied Multimodal Language Model2023/3/1
- Grounded Decoding: Guiding Text Generation with Grounded Models for Embodied Agents2023/3/1
- Scaling Robot Learning with Semantically Imagined Experience2023/2/1
- RT-1: Robotics Transformer for Real-World Control at Scale2022/12/1
- A Contextual Bandit Approach for Learning to Plan in Environments with Probabilistic Goal Configurations2022/11/1
- Robotic Table Wiping via Reinforcement Learning and Whole-body Trajectory Optimization2022/10/1
- Code as Policies: Language Model Programs for Embodied Control2022/9/1
- Learning Model Predictive Controllers with Real-Time Attention for Real-World Navigation2022/9/1
- Open-vocabulary Queryable Scene Representations for Real World Planning2022/9/1
- Inner Monologue: Embodied Reasoning through Planning with Language Models2022/7/1
- BEHAVIOR in Habitat 2.0: Simulator-Independent Logical Task Description for Benchmarking Embodied AI Agents2022/6/1
- Do As I Can, Not As I Say: Grounding Language in Robotic Affordances2022/4/1
- Multi-Robot Active Mapping via Neural Bipartite Graph Matching2022/3/1
- BEHAVIOR: Benchmark for Everyday Household Activities in Virtual, Interactive, and Ecological Environments2021/8/1
- iGibson 2.0: Object-Centric Simulation for Robot Learning of Everyday Household Tasks2021/8/1
- iGibson 1.0: a Simulation Environment for Interactive Tasks in Large Realistic Scenes2020/12/1
- ReLMoGen: Leveraging Motion Generation in Reinforcement Learning for Mobile Manipulation2020/8/1
- Probabilistic Visual Navigation with Bidirectional Image Prediction2020/3/1
- HRL4IN: Hierarchical Reinforcement Learning for Interactive Navigation with Mobile Manipulators2019/10/1
- Interactive Gibson Benchmark (iGibson 0.5): A Benchmark for Interactive Navigation in Cluttered Environments2019/10/1
- PoseRBPF: A Rao-Blackwellized Particle Filter for 6D Object Pose Tracking2019/5/1
- A Behavioral Approach to Visual Navigation with Graph Localization Networks2019/3/1
- Deep Visual MPC-Policy Learning for Navigation2019/3/1
- Gibson Env: Real-World Perception for Embodied Agents2018/8/1
- VUNet: Dynamic Scene View Synthesis for Traversability Estimation using an RGB Camera2018/6/1