Zhibo Chen
University of Science and Technology of China
収録論文 15本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- IMPACT: 注意はスケーラブルな相互作用認識ワールドモデル学習のための相互作用マップワールドモデル2026/8/31
ワールドモデルの学習において、静的領域が支配的なMSE損失により動的物体の相互作用が過小評価される問題を指摘し、注意マップを用いて損失を再重み付けするフレームワークIMPACTを提案した。
- EmbodiedVAE: 効率的で制御可能な身体化操作のための分離型ビデオVAE操作2026/8/1
ロボット操作の世界モデル向けに、ロボットアームの動きと背景を分離して圧縮する新しいビデオVAEを提案し、高圧縮率で高品質な再構成と精密な動作制御を実現した。
- Goku: 命令ベース動画編集のための100万規模のユニバーサルデータセットとベンチマーク動画編集2026/6/29
複雑な編集指示に応えるため、200万ペアの大規模データセットと、マスク分岐と外観レンダリング分岐を分離したデュアルブランチモデルを構築し、新ベンチマークで性能を検証した論文。
- DeformGen: 変形操作ポリシー学習のための動力学に基づくトポロジー拡張変形操作2026/6/1
変形物体の操作学習において、物理的に妥当な状態と軌道を生成する動力学ベースのデータ拡張フレームワークを提案した。
- GTA: 幾何学から外観へのビデオ拡散による画像から3Dワールド生成の高度化3D生成2026/5/13
単一画像から3Dシーンを生成する際、まず粗い幾何構造を生成し、その後に外観を生成する二段階のビデオ拡散モデルを提案し、構造の忠実性と視点間の一貫性を向上させた。
- Embody4D: 身体化された4D世界モデリングのための汎用データエンジン世界モデル2026/5/3
単眼ロボット映像を任意の視点からの新規ビュー映像に変換するビデオ間世界モデルを提案し、データ不足を合成パイプラインで補い、幾何学的安定性と操作領域の忠実度を高める手法を導入した。
- WorldArena 2.0:モダリティ・機能・プラットフォームにわたる身体化ワールドモデルベンチマークの拡張ベンチマーク2026/5/1
身体化ワールドモデルの評価を、視覚のみから視触覚へ、政策評価から強化学習環境としての利用へ、シミュレータから実ロボットへと拡張したベンチマークを提案した。
- MemCompiler: コンパイルする、注入しない -- 身体化エージェントのための状態条件付きメモリ身体化エージェント/メモリ管理2026/5/1
エージェントの現在の状態に応じて関連メモリのみを動的に選択・コンパイルするメモリシステムを提案し、静的メモリ注入を上回る性能と低遅延を実現した。
- WorldMAP: 生成的世界モデルを用いた視覚言語ナビゲーション軌道予測のブートストラップナビゲーション2026/4/1
生成的世界モデルが生成した未来映像から教師信号を作り、視覚言語入力から直接ナビゲーション軌道を予測する軽量モデルを訓練する教師-学生フレームワークを提案した。
- VLA-JEPA:潜在世界モデルで視覚-言語-行動モデルを強化VLA2026/2/1
未来のフレームを教師信号に使い、現在の観測だけから潜在空間で状態予測を学習するJEPA型事前学習で、VLAポリシーの汎化とロバスト性を高めた。
- WorldArena:身体性世界モデルの知覚と機能的実用性を評価する統合ベンチマーク世界モデル2026/2/1
身体性世界モデルを映像知覚品質と下流タスクでの機能的実用性の両面から評価する統合ベンチマークWorldArenaを提案し、14モデルの実験から知覚と機能の間に大きなギャップがあることを示した。
- UrbanVLA:都市マイクロモビリティのための視覚-言語-行動モデルVLA2025/10/1
都市環境での配達ロボットなどのナビゲーションに向け、経路指示と視覚情報を統合して行動を計画するVLAフレームワークを提案し、シミュレーションと実世界データで二段階学習することで大規模都市ナビゲーションを実現した。
- TrackVLA++:具現化視覚追跡のための推論と記憶能力を引き出すVLAモデルVLA2025/10/1
移動する対象を追跡する具現化視覚追跡において、空間推論と長期記憶のモジュールを導入し、遮蔽や類似物体に強いVLAモデルを提案した。
- AdaNav: 不確実性に基づく適応的推論による視覚言語ナビゲーションVLA2025/9/1
視覚言語ナビゲーションにおいて、不確実性に応じて推論を動的に発動する軽量プラグインを提案し、少ない学習データで大幅な性能向上を実現した。
- 身体性ナビゲーション基盤モデルナビゲーション基盤モデル2025/9/1
四足歩行・ドローン・車輪ロボット・車両にまたがる800万件のナビゲーションサンプルで学習し、視覚言語ナビゲーションや物体探索、追跡、自動運転など多様なタスクを単一アーキテクチャでこなす基盤モデルを提案。