Qiao Gu
収録論文 9本 ・ フィジカルAI/ロボット学習
VLAビデオ生成群衆ナビゲーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RL^2-VLA: テスト時スケーリングによる適応的RL潜在構成ステアリングと視覚言語行動モデルVLA2026/7/1
視覚言語行動モデルの性能低下を改善するため、オフラインRLで学習した軽量ポリシーをVLAの潜在表現に基づいて構成し、失敗が予測される時のみ介入する適応的推論時ステアリング手法を提案した。
- E^3C: 3D環境メモリと自己・他者視点の人体ポーズ制御によるビデオ生成ビデオ生成2026/5/25
エージェントの自己中心視点ビデオ生成のための拡散フレームワークで、点群ベースの3Dメモリと自己・他者視点の人体ポーズ制御を組み合わせ、シーン構造と人間の動きを分離して高品質な生成を実現した。
- MomaGraph: 視覚言語モデルによる状態認識統合シーングラフと身体性タスクプランニングVLA2025/12/1
家庭内の移動マニピュレータ向けに、空間的・機能的関係と物体状態を統合したシーングラフ表現MomaGraphと、大規模データセット・評価ベンチマーク・強化学習で訓練した7B視覚言語モデルMomaGraph-R1を提案し、ゼロショットタスクプランニングで最先端性能を達成した。
- SAFE: 視覚言語行動モデル向けマルチタスク故障検知VLA2025/6/1
VLAの内部特徴からタスク失敗の可能性を予測する汎用的な故障検知器SAFEを提案し、未見タスクでも高精度・早期検知を実現した。
- SICNav-Diffusion: 拡散モデルによる軌道予測を用いた安全でインタラクティブな群衆ナビゲーション群衆ナビゲーション2025/3/1
拡散モデルで人間の将来軌道を予測し、二層MPCでロボット計画と予測の安全な整合を同時に解く群衆ナビゲーション手法を提案した。
- ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and Planning2023/9/1
- ConceptFusion: Open-set Multimodal 3D Mapping2023/2/1
- OSSID: Online Self-Supervised Instance Detection by (and for) Pose Estimation2022/1/1
- ZePHyR: Zero-shot Pose Hypothesis Rating2021/4/1