Yu Shang
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Worldscape-MoE: スケーラブルな異種行動制御のための統一Mixture-of-Experts世界モデル世界モデル2026/7/1
異なる行動モダリティ(カメラ軌道、ロボット動作、手の関節信号など)を統一的に扱える拡張可能な世界モデルを提案し、MoEアーキテクチャにより異種の行動制御を共有の世界ダイナミクスに統合する。
- 必要なときに夢を見る:適応的マルチモーダル推論による世界行動モデルの進化VLA2026/6/1
世界行動モデル(WAM)の性能を高めるため、タスクの切り替え時にはテキスト推論、細かい操作時には視覚推論を動的に切り替える軽量ルータを導入したAdaWAMを提案した。シミュレーションと実世界のタスクで効率と性能が向上した。
- WorldVLN: 空中視覚言語ナビゲーションのための自己回帰的世界行動モデルVLA2026/5/1
空中VLNを予測駆動の世界行動問題として捉え、自己回帰ビデオバックボーンで世界状態遷移を予測し、実行可能なウェイポイント行動に直接デコードする初のモデルWorldVLNを提案。2段階訓練と強化学習により、ベンチマークで12%以上の成功率向上を達成し、実ドローンへのゼロショット転送も実証。
- WorldArena 2.0:モダリティ・機能・プラットフォームにわたる身体化ワールドモデルベンチマークの拡張ベンチマーク2026/5/1
身体化ワールドモデルの評価を、視覚のみから視触覚へ、政策評価から強化学習環境としての利用へ、シミュレータから実ロボットへと拡張したベンチマークを提案した。
- WorldArena:身体性世界モデルの知覚と機能的実用性を評価する統合ベンチマーク世界モデル2026/2/1
身体性世界モデルを映像知覚品質と下流タスクでの機能的実用性の両面から評価する統合ベンチマークWorldArenaを提案し、14モデルの実験から知覚と機能の間に大きなギャップがあることを示した。
- 3D空間における長期的視覚生成とナビゲーションのための航空世界モデルナビゲーション2025/12/1
UAVのナビゲーション向けに、過去のフレームと行動から将来の視覚観測を予測する世界モデルANWMを提案し、候補軌道を意味的妥当性で評価することで大規模3D環境での自律飛行性能を向上させた。
- RoboScape-R: 報酬と観測を統合したワールドモデルによる汎化可能なロボティクス強化学習強化学習/ワールドモデル2025/12/1
ワールドモデルを汎用環境プロキシとして用い、状態遷移の理解から報酬を生成する強化学習フレームワークを提案し、多様なシーンへの汎化性能を向上させた。
- KeyWorld: キーフレーム推論による効率的で実用的な世界モデル世界モデル2025/9/1
テキスト条件付きロボット世界モデルにおいて、意味的に重要なキーフレームのみをTransformerで生成し、中間フレームを軽量補間モデルで埋めることで、5.68倍の高速化と物理的妥当性の向上を実現した。
- AirScape: 運動制御可能な空中生成ワールドモデル世界モデル2025/7/1
6自由度ドローンの視覚入力と運動意図から将来の観測を予測する世界モデルを構築し、運動意図に沿った3D空間想像力で既存モデルを大幅に上回った。
- RoboScape: 物理情報を組み込んだ身体性世界モデル世界モデル2025/6/1
RGB動画生成と物理知識を統合して学習する世界モデルを提案し、3D形状や運動ダイナミクスを考慮した物理的に妥当なロボット動画生成を実現した。