Chuyuan Fu
収録論文 14本 ・ フィジカルAI/ロボット学習
模倣学習VLAsim2real
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- BPP: 重要な履歴フレームに注目した長文脈ロボット模倣学習模倣学習2026/2/1
視覚言語モデルで検出したタスクに関連するキーフレームのみを条件とすることで、履歴に依存するロボットタスクの模倣学習を安定化させ、実世界タスクで成功率を大幅に向上させた。
- Gemini Robotics 1.5:高度な身体性推論・思考・動作転移で汎用ロボットの最前線を押し広げるVLA2025/10/1
異種ロボットデータから学ぶ動作転移機構と自然言語での多段階推論を組み合わせたVLAモデルと、身体性推論に特化したモデルを発表し、複雑な多段階タスクの実行と解釈性を向上させた。
- Gemini Robotics:AIを物理世界へVLA2025/3/1
Gemini 2.0を基盤に、ロボットを直接制御できる汎用VLAモデル「Gemini Robotics」と、空間・時間理解を強化した推論モデル「Gemini Robotics-ER」を提案した論文。
- RoPEを超えて:STRINGによる2D・3D位置エンコーディングの改善VLA2025/2/1
大規模言語モデルで広く使われるRotary Position Encodingsを統一的な理論枠組みで拡張し、任意次元のトークン座標に対して厳密な並進不変性を保ちつつ低計算コストで2D・3D位置エンコーディングを実現するSTRINGを提案。Vision Transformerに統合し、オープンボキャブラリ物体検出やロボティクス制御で性能向上を示した。
- 視覚言語モデルは文脈内価値学習器であるVLA2024/11/1
視覚言語モデルにシャッフルした動画フレームの時系列順序を予測させることで、ロボットやタスク固有の訓練なしに300以上の実世界タスクの進捗を推定できる汎用価値関数を実現した。
- 実世界ロボットマニピュレーションポリシーのシミュレーション評価sim2real2024/5/1
実環境とシミュレーションの制御・視覚ギャップを緩和し、実機セットアップに対応した評価環境SIMPLERを構築。実機とシミュレーションの性能が強く相関することを示した。
- RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches2023/11/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control2023/7/1
- Language to Rewards for Robotic Skill Synthesis2023/6/1
- On Designing a Learning Robot: Improving Morphology for Enhanced Task Performance and Learning2023/3/1
- Midas: A Multi-Joint Robotics Simulator with Intersection-Free Frictional Contact2022/10/1
- Do As I Can, Not As I Say: Grounding Language in Robotic Affordances2022/4/1
- COCOI: Contact-aware Online Context Inference for Generalizable Non-planar Pushing2020/11/1