Yong Li
Tsinghua University
収録論文 28本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 遠くへ届くには近くを狙え:凍結世界モデルは思うより賢く計画できるモデルベース計画2026/9/24
凍結した視覚世界モデルでも、最終ゴールではなく経験から取得した中間目標を狙うことで、長距離タスクの計画性能が大幅に向上することを示した研究。
- IMPACT: 注意はスケーラブルな相互作用認識ワールドモデル学習のための相互作用マップワールドモデル2026/8/31
ワールドモデルの学習において、静的領域が支配的なMSE損失により動的物体の相互作用が過小評価される問題を指摘し、注意マップを用いて損失を再重み付けするフレームワークIMPACTを提案した。
- 因果的作用効果の再重み付けによるワールドモデル学習の改善ワールドモデル2026/8/31
アクション条件付きビデオ生成のワールドモデル学習において、背景トークンに偏った損失を避け、アクションの影響を受けるトークンに重点を置く再重み付け手法を提案した。
- ActiveFly-Bench: 空中身体知覚のための身体化質問応答と視覚言語行動の統合UAV/身体化知覚2026/7/1
UAVの能動的知覚を評価する初のベンチマークを提案し、高次タスク理解から低次制御までを階層的に評価するエージェントを開発した。
- TacWAM: 力学を考慮した触覚予測を備えたアンカー誘導型ワールドアクションモデル触覚/操作2026/7/1
接触を伴う操作タスクにおいて、視覚だけでなく触覚の未来予測を活用し、力や変形などの物理情報を捉えつつ、アクション生成に特権的な手がかりとして使わないようにする新しいワールドアクションモデルを提案した。
- Worldscape-MoE: スケーラブルな異種行動制御のための統一Mixture-of-Experts世界モデル世界モデル2026/7/1
異なる行動モダリティ(カメラ軌道、ロボット動作、手の関節信号など)を統一的に扱える拡張可能な世界モデルを提案し、MoEアーキテクチャにより異種の行動制御を共有の世界ダイナミクスに統合する。
- WorldScape Policy 2.0:推論強化メモリによる操縦可能なワールドアクションモデリングの実現操作2026/7/1
ロボット操作のためのワールドアクションモデルを拡張し、長期・短期メモリと推論強化により、タスク進行の追跡と細かい言語-映像-行動の対応付けを可能にした。
- WorldFly: UAVナビゲーションのためのワールドモデル基盤の視覚言語行動モデルナビゲーション2026/6/4
UAVナビゲーションのための新しいVLAフレームワークで、将来の映像予測と行動を同時生成するデュアルブランチ結合フローマッチング機構を導入し、空間想像による意思決定を強化する。
- 必要なときに夢を見る:適応的マルチモーダル推論による世界行動モデルの進化VLA2026/6/1
世界行動モデル(WAM)の性能を高めるため、タスクの切り替え時にはテキスト推論、細かい操作時には視覚推論を動的に切り替える軽量ルータを導入したAdaWAMを提案した。シミュレーションと実世界のタスクで効率と性能が向上した。
- WorldVLN: 空中視覚言語ナビゲーションのための自己回帰的世界行動モデルVLA2026/5/1
空中VLNを予測駆動の世界行動問題として捉え、自己回帰ビデオバックボーンで世界状態遷移を予測し、実行可能なウェイポイント行動に直接デコードする初のモデルWorldVLNを提案。2段階訓練と強化学習により、ベンチマークで12%以上の成功率向上を達成し、実ドローンへのゼロショット転送も実証。
- WorldArena 2.0:モダリティ・機能・プラットフォームにわたる身体化ワールドモデルベンチマークの拡張ベンチマーク2026/5/1
身体化ワールドモデルの評価を、視覚のみから視触覚へ、政策評価から強化学習環境としての利用へ、シミュレータから実ロボットへと拡張したベンチマークを提案した。
- 混合不確実性下でのリソース制約付きロボット計画計画2026/5/1
ロボットの行動計画において、定量化可能なノイズと定量化不能な不確実性を扱い、リソース枯渇を防ぎながらタスクを達成する戦略を合成する問題を解決した。
- WorldMAP: 生成的世界モデルを用いた視覚言語ナビゲーション軌道予測のブートストラップナビゲーション2026/4/1
生成的世界モデルが生成した未来映像から教師信号を作り、視覚言語入力から直接ナビゲーション軌道を予測する軽量モデルを訓練する教師-学生フレームワークを提案した。
- WorldArena:身体性世界モデルの知覚と機能的実用性を評価する統合ベンチマーク世界モデル2026/2/1
身体性世界モデルを映像知覚品質と下流タスクでの機能的実用性の両面から評価する統合ベンチマークWorldArenaを提案し、14モデルの実験から知覚と機能の間に大きなギャップがあることを示した。
- RoboScape-R: 報酬と観測を統合したワールドモデルによる汎化可能なロボティクス強化学習強化学習/ワールドモデル2025/12/1
ワールドモデルを汎用環境プロキシとして用い、状態遷移の理解から報酬を生成する強化学習フレームワークを提案し、多様なシーンへの汎化性能を向上させた。
- 3D空間における長期的視覚生成とナビゲーションのための航空世界モデルナビゲーション2025/12/1
UAVのナビゲーション向けに、過去のフレームと行動から将来の視覚観測を予測する世界モデルANWMを提案し、候補軌道を意味的妥当性で評価することで大規模3D環境での自律飛行性能を向上させた。
- TOPP-DWR: 区分的に一定な角速度制約を考慮した差動駆動車輪ロボットの時間最適経路パラメータ化移動ロボット/経路計画2025/11/1
差動駆動車輪ロボット向けに、角速度・関節速度・線速度・線加速度の制約を組み込んだ時間最適経路パラメータ化アルゴリズムを提案し、SOCPで効率的に解く手法を実証した。
- APP: 双方向ショートカットと経路摂動を用いたロボット向けA*後処理アルゴリズム経路計画2025/11/1
A*などのグラフ探索プランナが生成する経路の不要な方向転換や非最短性を改善するため、双方向頂点削減と反復的な経路摂動による後処理アルゴリズムAPPを提案し、実機ナビゲーションで有効性を検証した。
- 半構造化環境における清掃ロボットのための単方向道路ネットワークに基づく大域経路計画経路計画2025/11/1
半構造化環境での清掃ロボット向けに、単方向道路ネットワークと二層ポテンシャルマップを組み合わせ、経路長と交通規則の整合性を両立させる大域経路計画手法を提案した。
- KeyWorld: キーフレーム推論による効率的で実用的な世界モデル世界モデル2025/9/1
テキスト条件付きロボット世界モデルにおいて、意味的に重要なキーフレームのみをTransformerで生成し、中間フレームを軽量補間モデルで埋めることで、5.68倍の高速化と物理的妥当性の向上を実現した。
- AirScape: 運動制御可能な空中生成ワールドモデル世界モデル2025/7/1
6自由度ドローンの視覚入力と運動意図から将来の観測を予測する世界モデルを構築し、運動意図に沿った3D空間想像力で既存モデルを大幅に上回った。
- V-JEPA 2: 自己教師あり動画モデルによる理解・予測・計画VLA2025/6/1
大規模動画データで自己教師あり事前学習したV-JEPA 2を提案し、ロボット軌道で微調整した世界モデルにより、未知環境でのゼロショット物体操作を実現した。
- RoboScape: 物理情報を組み込んだ身体性世界モデル世界モデル2025/6/1
RGB動画生成と物理知識を統合して学習する世界モデルを提案し、3D形状や運動ダイナミクスを考慮した物理的に妥当なロボット動画生成を実現した。
- CityNavAgent:階層的意味計画とグローバルメモリによる都市空中ビジョン言語ナビゲーション空中VLN2025/5/1
ドローンが自然言語指示に従って都市環境をナビゲートする空中VLNタスクに対し、LLMを活用した階層的意味計画と履歴をトポロジカルグラフで保持するグローバルメモリを組み合わせたエージェントを提案し、最先端性能を達成した。
- GeoNav: 二重スケール地理空間推論による言語目標航空ナビゲーションのためのMLLM活用航空ナビゲーション2025/4/1
都市部での言語指示に基づくUAVナビゲーションのため、粗から細への空間推論を行うマルチモーダルエージェントGeoNavを提案し、CityNavベンチマークで成功率を最大18.4%向上させた。
- 線形時相論理仕様に基づく計画:定量化可能・不可能な不確実性への対処計画・LTL2025/2/1
定量化可能・不可能な不確実性を統一的に扱うMDPST上で、LTL仕様を最適に満たすロボット計画手法を提案し、勝利領域の計算とロバスト価値反復で解く。
- EmbodiedCity:実世界都市環境における身体性エージェントのためのベンチマークプラットフォーム身体性AI/都市シミュレーション2024/10/1
実在都市の建物や道路を再現した高精細3Dシミュレータ上で、歩行者・車両の流れを再現し、身体性AIの評価タスクと入出力インターフェースを提供するベンチマークを構築した。
- LCSim: 大規模で制御可能な交通シミュレータ交通シミュレーション2024/6/1
拡散モデルベースの車両運動プランナを組み込み、多様な運転スタイルを再現できる大規模交通シミュレータLCSimを提案した。