Zhuo Xu
収録論文 25本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboChrono:ストリーミングタスク理解のための実ロボットベンチマークベンチマーク2026/9/29
実ロボットと人手の記録からなる39シナリオ・34,713件のベンチマークを構築し、18の視覚言語モデルのゼロショット性能を評価して、視覚照合と時間順序理解の能力差を明らかにした。
- ガウススプラッティングによる軟体相互作用のReal-to-Simロボット方策評価sim2real2025/11/1
実世界の動画から軟体のデジタルツインを構築し、3Dガウススプラッティングでフォトリアルに描画するReal-to-Sim評価フレームワークを提案。ぬいぐるみ詰め込みやロープ通しなどの変形操作タスクで、シミュレーション結果が実機性能と強く相関することを示した。
- Gemini Robotics 1.5:高度な身体性推論・思考・動作転移で汎用ロボットの最前線を押し広げるVLA2025/10/1
異種ロボットデータから学ぶ動作転移機構と自然言語での多段階推論を組み合わせたVLAモデルと、身体性推論に特化したモデルを発表し、複雑な多段階タスクの実行と解釈性を向上させた。
- Gemini Robotics:AIを物理世界へVLA2025/3/1
Gemini 2.0を基盤に、ロボットを直接制御できる汎用VLAモデル「Gemini Robotics」と、空間・時間理解を強化した推論モデル「Gemini Robotics-ER」を提案した論文。
- EDENet: 地中レーダーに基づく場所認識のためのエコー方向符号化ネットワーク地中レーダー位置認識2025/2/1
地中レーダーのエコー系列と地下構造の幾何関係を利用し、学習可能なガボールフィルタと方向注意機構で大規模地図での場所認識を高精度・軽量に実現した。
- PO-GVINS: 姿勢のみ表現によるGNSS・視覚・慣性の密結合統合VLA2025/1/1
視覚慣性システムに姿勢のみ表現を導入し、3D特徴点を状態から除外することで線形化誤差と次元爆発を回避し、GNSS生測定と整数アンビギュイティ解を統合したドリフトフリーな測位フレームワークを提案。
- 視覚言語モデルは文脈内価値学習器であるVLA2024/11/1
視覚言語モデルにシャッフルした動画フレームの時系列順序を予測させることで、ロボットやタスク固有の訓練なしに300以上の実世界タスクの進捗を推定できる汎用価値関数を実現した。
- 想像的ポテンシャルゲーム:対話的行動のシミュレーション・学習・評価のためのフレームワークソーシャルナビゲーション2024/11/1
各エージェントが他者との仮想的な協力ゲームを想像する分散ポテンシャルゲームで人間らしい相互作用をシミュレートし、対話型ナビゲーションの学習・評価環境を提供する。
- Mobility VLA:長文脈VLMとトポロジカルグラフによるマルチモーダル指示ナビゲーションナビゲーション/VLA2024/7/1
デモ動画と自然言語・画像の指示を入力とし、長文脈VLMで目標フレームを特定、トポロジカルグラフに基づく低レベル方策で実環境をナビゲートする階層型VLAを提案した。
- MATRIX: 多様なコンテキストを持つマルチエージェント軌道生成軌道生成2024/3/1
人間同士や人間-ロボットのインタラクション場面で、目的地や行動特性の多様性を考慮してリアルな軌道データを自動生成する学習ベースモデルMATRIXを提案し、模倣学習のデータ拡張にも有効性を示した。
- PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs2024/2/1
- AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents2024/1/1
- On State Estimation in Multi-Sensor Fusion Navigation: Optimization and Filtering2024/1/1
- Generative Expressive Robot Behaviors using Large Language Models2024/1/1
- SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities2024/1/1
- RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches2023/11/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Distributed Multi-agent Interaction Generation with Imagined Potential Games2023/10/1
- Online Learning Based Mobile Robot Controller Adaptation for Slip Reduction2023/1/1
- Grouptron: Dynamic Multi-Scale Graph Convolutional Networks for Group-Aware Dense Crowd Trajectory Forecasting2021/9/1
- COCOI: Contact-aware Online Context Inference for Generalizable Non-planar Pushing2020/11/1
- RetinaGAN: An Object-aware Approach to Sim-to-Real Transfer2020/11/1
- Cascade Attribute Network: Decomposing Reinforcement Learning Control Policies using Hierarchical Neural Networks2020/5/1
- Guided Policy Search Model-based Reinforcement Learning for Urban Autonomous Driving2020/5/1
- Zero-shot Deep Reinforcement Learning Driving Policy Transfer for Autonomous Vehicles based on Robust Control2018/12/1