Longteng Guo
Institute of Automation, Chinese Academy of Sciences
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- AtlasVLA: 視覚言語行動モデルのための持続的な世界・自我状態モデリングVLA2026/8/1
単眼カメラのみで長期的なタスクを遂行できるよう、視覚言語行動モデルに持続的な世界状態メモリと自我作業メモリを導入し、空間推論とタスク進行の追跡を可能にした。
- ワールドトークン:訓練時ワールドモデリングによる身体化ポリシーの強化VLA2026/8/1
視覚言語行動モデルに、訓練時に未来ビデオのノイズ除去を条件付けるワールドアダプタを導入し、推論時にはビデオモデルを除去して効率的な行動生成を実現する新しいアーキテクチャを提案した。
- LongSpace: ビデオにおける知覚から想起までの長期的空間記憶の探求空間記憶/ビデオ理解2026/6/4
長期的な空間記憶を評価するベンチマークLongSpace-Benchを導入し、3D構造的手がかりと層認識メモリを用いた空間推論フレームワークLongSpaceを提案した。
- VeriSpace: 視覚言語行動モデルのための空間基盤型行動検証VLA/操作2026/6/1
VLAモデルのテスト時行動選択を改善するため、3D認識の行動検証器を提案し、候補行動の空間的関係と幾何学的妥当性を評価して信頼性を高めた。
- NavWM: 先読み計画のための統合ナビゲーションワールドモデルナビゲーション2026/6/1
ナビゲーションのための統合ワールドモデルを提案し、潜在世界トークンによる幾何・意味理解と、多様な行動予測による閉ループ計画を実現した。
- SurveilNav: ロボットと監視システムの協調による物体目標ナビゲーションナビゲーション2026/6/1
監視カメラとロボットを協調させ、大規模環境での物体探索ナビゲーションを効率化するフレームワークを提案した論文。
- UrbanNav: ウェブ規模の人間軌跡から学ぶ言語誘導型都市ナビゲーションナビゲーション2025/12/1
ウェブ上の街歩き動画1500時間以上と300万組の指示・軌跡・ランドマークデータを用い、自由な言語指示に従って実都市を移動する具現化エージェントを訓練するフレームワークを提案した。
- FlexVLN: 多様な視覚言語ナビゲーションタスクへの柔軟な適応VLA2025/3/1
視覚言語ナビゲーションにおいて、教師あり学習ベースの指示追従器とLLMプランナーを階層的に統合し、検証機構とマルチモデル統合機構で幻覚を抑え、未知データセットへの汎化性能を大幅に向上させた。