Chen Gao
Tsinghua University
収録論文 36本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HiWE: 視覚キーポイント強化による階層的ワールド知識モデルを用いたゼロショット3D経路計画VLA2026/9/30
視覚的グラウンディングと言語ベースの計画を点ベースのインターフェースで結び、ゼロショットで3D操作経路を計画する階層的フレームワークを提案。
- 遠くへ届くには近くを狙え:凍結世界モデルは思うより賢く計画できるモデルベース計画2026/9/24
凍結した視覚世界モデルでも、最終ゴールではなく経験から取得した中間目標を狙うことで、長距離タスクの計画性能が大幅に向上することを示した研究。
- 因果的作用効果の再重み付けによるワールドモデル学習の改善ワールドモデル2026/8/31
アクション条件付きビデオ生成のワールドモデル学習において、背景トークンに偏った損失を避け、アクションの影響を受けるトークンに重点を置く再重み付け手法を提案した。
- IMPACT: 注意はスケーラブルな相互作用認識ワールドモデル学習のための相互作用マップワールドモデル2026/8/31
ワールドモデルの学習において、静的領域が支配的なMSE損失により動的物体の相互作用が過小評価される問題を指摘し、注意マップを用いて損失を再重み付けするフレームワークIMPACTを提案した。
- EmbodiedVAE: 効率的で制御可能な身体化操作のための分離型ビデオVAE操作2026/8/1
ロボット操作の世界モデル向けに、ロボットアームの動きと背景を分離して圧縮する新しいビデオVAEを提案し、高圧縮率で高品質な再構成と精密な動作制御を実現した。
- ActiveFly-Bench: 空中身体知覚のための身体化質問応答と視覚言語行動の統合UAV/身体化知覚2026/7/1
UAVの能動的知覚を評価する初のベンチマークを提案し、高次タスク理解から低次制御までを階層的に評価するエージェントを開発した。
- TacWAM: 力学を考慮した触覚予測を備えたアンカー誘導型ワールドアクションモデル触覚/操作2026/7/1
接触を伴う操作タスクにおいて、視覚だけでなく触覚の未来予測を活用し、力や変形などの物理情報を捉えつつ、アクション生成に特権的な手がかりとして使わないようにする新しいワールドアクションモデルを提案した。
- WorldScape Policy 2.0:推論強化メモリによる操縦可能なワールドアクションモデリングの実現操作2026/7/1
ロボット操作のためのワールドアクションモデルを拡張し、長期・短期メモリと推論強化により、タスク進行の追跡と細かい言語-映像-行動の対応付けを可能にした。
- Worldscape-MoE: スケーラブルな異種行動制御のための統一Mixture-of-Experts世界モデル世界モデル2026/7/1
異なる行動モダリティ(カメラ軌道、ロボット動作、手の関節信号など)を統一的に扱える拡張可能な世界モデルを提案し、MoEアーキテクチャにより異種の行動制御を共有の世界ダイナミクスに統合する。
- AeroVerse-SatAgent: 認知神経科学の二重視覚経路理論に着想を得たUAV-衛星協調空間推論空間推論2026/6/30
UAVと衛星の協調による空間推論モデルSatAgentを提案し、幾何認識3D再構成エンコーダと多視点トポロジー意味アライメントで視点変化に頑健な推論を実現した。
- TouchThinker:大規模データと行動認識表現による触覚常識推論のオープンワールドへの拡張触覚2026/6/10
触覚常識推論をオープンワールドに拡張するため、大規模データセットと行動認識表現を備えた触覚言語フレームワークTouchThinkerを提案した。
- WorldFly: UAVナビゲーションのためのワールドモデル基盤の視覚言語行動モデルナビゲーション2026/6/4
UAVナビゲーションのための新しいVLAフレームワークで、将来の映像予測と行動を同時生成するデュアルブランチ結合フローマッチング機構を導入し、空間想像による意思決定を強化する。
- 生き残るものを監視せよ:合成ロボット動画からの幾何学誘導VLA適応VLA/シミュレーション2026/6/1
合成ロボット動画から幾何学情報(2Dエンドエフェクタ経路点)を抽出し、VLAモデルの視覚バックボーンを補助タスクで調整する手法を提案。制御は実デモのみで学習し、幾何学情報で表現の崩壊を防ぐ。
- TacForeSight: 接触豊富な操作のための力誘導型触覚ワールドモデル触覚/操作2026/6/1
接触を伴う操作タスクにおいて、力覚と触覚の非対称な時空間的役割を考慮し、触覚潜在ダイナミクスを予測する軽量な触覚ワールドモデルと、予測結果を活用するポリシーを提案。実機実験で動的接触外乱下での優位性を示した。
- 必要なときに夢を見る:適応的マルチモーダル推論による世界行動モデルの進化VLA2026/6/1
世界行動モデル(WAM)の性能を高めるため、タスクの切り替え時にはテキスト推論、細かい操作時には視覚推論を動的に切り替える軽量ルータを導入したAdaWAMを提案した。シミュレーションと実世界のタスクで効率と性能が向上した。
- ManiSoft: ソフト連続体ロボットのための視覚言語操作に向けてソフトロボティクス/操作2026/5/1
ソフトロボットアームの視覚言語操作を研究するためのベンチマークとシミュレータを提案し、変形制御の課題を評価する。
- WorldArena 2.0:モダリティ・機能・プラットフォームにわたる身体化ワールドモデルベンチマークの拡張ベンチマーク2026/5/1
身体化ワールドモデルの評価を、視覚のみから視触覚へ、政策評価から強化学習環境としての利用へ、シミュレータから実ロボットへと拡張したベンチマークを提案した。
- 多様性の罠を回避するアンカー中心適応によるロボット操作マニピュレーション2026/5/1
ロボット操作におけるVLAモデルの実機適応で、多様なデモ収集が逆効果になる「多様性の罠」を特定し、アンカー中心適応(ACA)という2段階フレームワークを提案。実機実験で成功率を向上させた。
- GE-Sim 2.0: ロボット操作のための包括的クローズドループ映像世界シミュレータへのロードマップシミュレーション2026/5/1
ロボット操作のためのクローズドループ映像世界シミュレータGE-Sim 2.0を提案。実ロボットデータで再学習し、状態デコーダ、世界判定器、高速化モジュールを追加して、映像シミュレーションからポリシー学習へのループを閉じる。
- WorldVLN: 空中視覚言語ナビゲーションのための自己回帰的世界行動モデルVLA2026/5/1
空中VLNを予測駆動の世界行動問題として捉え、自己回帰ビデオバックボーンで世界状態遷移を予測し、実行可能なウェイポイント行動に直接デコードする初のモデルWorldVLNを提案。2段階訓練と強化学習により、ベンチマークで12%以上の成功率向上を達成し、実ドローンへのゼロショット転送も実証。
- WorldMAP: 生成的世界モデルを用いた視覚言語ナビゲーション軌道予測のブートストラップナビゲーション2026/4/1
生成的世界モデルが生成した未来映像から教師信号を作り、視覚言語入力から直接ナビゲーション軌道を予測する軽量モデルを訓練する教師-学生フレームワークを提案した。
- BiCoord: 長時間・空間時間的協調を目指す両腕操作ベンチマーク両腕操作/ベンチマーク2026/4/1
両腕操作のための長時間かつ密に協調したタスクを含む新しいベンチマークを提案し、既存のポリシーが困難を抱えることを示した。
- OmniVTA: 接触を伴うロボット操作のための視覚-触覚世界モデル操作2026/3/1
接触を伴う操作タスクのために、大規模な視覚-触覚-行動データセットと、触覚信号を予測・閉ループ制御に活用する世界モデルベースのフレームワークを提案した論文。
- WorldArena:身体性世界モデルの知覚と機能的実用性を評価する統合ベンチマーク世界モデル2026/2/1
身体性世界モデルを映像知覚品質と下流タスクでの機能的実用性の両面から評価する統合ベンチマークWorldArenaを提案し、14モデルの実験から知覚と機能の間に大きなギャップがあることを示した。
- RoboScape-R: 報酬と観測を統合したワールドモデルによる汎化可能なロボティクス強化学習強化学習/ワールドモデル2025/12/1
ワールドモデルを汎用環境プロキシとして用い、状態遷移の理解から報酬を生成する強化学習フレームワークを提案し、多様なシーンへの汎化性能を向上させた。
- 3D空間における長期的視覚生成とナビゲーションのための航空世界モデルナビゲーション2025/12/1
UAVのナビゲーション向けに、過去のフレームと行動から将来の視覚観測を予測する世界モデルANWMを提案し、候補軌道を意味的妥当性で評価することで大規模3D環境での自律飛行性能を向上させた。
- EVOLVE-VLA: 環境フィードバックによるテスト時訓練で視覚言語行動モデルを適応させるVLA2025/12/1
テスト時に環境との相互作用から学習し、ノイズの多い進捗推定を平滑化して方策を進化的に改善するVLA向けテスト時訓練フレームワークを提案。
- SDA-PLANNER: 状態依存性を考慮した適応型身体性タスクプランナータスクプランニング2025/9/1
LLMベースの身体性タスクプランニングにおいて、状態依存グラフとエラー適応型再計画を導入し、実行エラーに頑健な適応的プランニングを実現した。
- AirScape: 運動制御可能な空中生成ワールドモデル世界モデル2025/7/1
6自由度ドローンの視覚入力と運動意図から将来の観測を予測する世界モデルを構築し、運動意図に沿った3D空間想像力で既存モデルを大幅に上回った。
- RoboScape: 物理情報を組み込んだ身体性世界モデル世界モデル2025/6/1
RGB動画生成と物理知識を統合して学習する世界モデルを提案し、3D形状や運動ダイナミクスを考慮した物理的に妥当なロボット動画生成を実現した。
- RoboCerebra:長期的ロボットマニピュレーション評価のための大規模ベンチマークマニピュレーション2025/6/1
家庭環境での長期的なロボット操作タスクを評価する大規模ベンチマークを提案し、VLMによる高レベル計画とVLAによる低レベル制御を組み合わせた階層的フレームワークと評価プロトコルを構築した。
- OctoNav: 汎用身体性ナビゲーションに向けてナビゲーション2025/6/1
マルチモーダルで多能力な自由形式指示に従える汎用ナビゲーションエージェントのための大規模ベンチマークOctoNav-Benchと、MLLMをVLA化したOctoNav-R1を提案。
- CityNavAgent:階層的意味計画とグローバルメモリによる都市空中ビジョン言語ナビゲーション空中VLN2025/5/1
ドローンが自然言語指示に従って都市環境をナビゲートする空中VLNタスクに対し、LLMを活用した階層的意味計画と履歴をトポロジカルグラフで保持するグローバルメモリを組み合わせたエージェントを提案し、最先端性能を達成した。
- GeoNav: 二重スケール地理空間推論による言語目標航空ナビゲーションのためのMLLM活用航空ナビゲーション2025/4/1
都市部での言語指示に基づくUAVナビゲーションのため、粗から細への空間推論を行うマルチモーダルエージェントGeoNavを提案し、CityNavベンチマークで成功率を最大18.4%向上させた。
- TopV-Nav: マルチモーダル大規模言語モデルの俯瞰視点空間推論能力を活用したゼロショット物体ナビゲーションナビゲーション2024/11/1
マルチモーダル大規模言語モデルが俯瞰地図を直接推論できるようにする手法を提案し、未知環境でのゼロショット物体ナビゲーション精度を向上させた。
- EmbodiedCity:実世界都市環境における身体性エージェントのためのベンチマークプラットフォーム身体性AI/都市シミュレーション2024/10/1
実在都市の建物や道路を再現した高精細3Dシミュレータ上で、歩行者・車両の流れを再現し、身体性AIの評価タスクと入出力インターフェースを提供するベンチマークを構築した。