Jun Zhu
収録論文 23本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Motus2: 巧みな操作のための自己進化型汎用世界モデルマニピュレーション2026/8/31
Motus2は、ポリシー・シミュレータ・評価器を統合した自己進化型の世界モデルで、巧みな操作を実現する。モデルとデータのスケーリングにより、意思決定と学習の閉ループを形成する。
- Causal-rCM: ストリーミング動画生成と対話型ワールドモデルのための自己回帰拡散蒸留における教師強制と自己強制の統一的オープンレシピビデオ生成/拡散蒸留2026/6/24
自己回帰ビデオ拡散モデルに対して、拡散蒸留フレームワークrCMを拡張し、教師強制と自己強制の相補性を活用した統一的な蒸留手法Causal-rCMを提案。カスタムマスクFlashAttention-2 JVPカーネルにより連続時間CMを実装し、10倍の収束高速化と最先端のストリーミング動画生成性能を達成した。
- PACT: 拡散ポリシーの身体的操作における自己進化型物理安全性アライメントマニピュレーション2026/6/7
事前学習済みの拡散ポリシーを、デモデータや報酬なしで制約適合領域に投影する自己進化型の後処理フレームワークを提案し、安全性違反を平均31.0%削減しつつタスク成功率を30.7%向上させた。
- GEM: 生成的監視が身体化知能を強化するVLA2026/5/27
視覚言語モデルの事前学習に深度マップ生成タスクを統合し、身体化環境での空間・物理理解を向上させるGEMを提案。大規模データセットGEM-4Mを公開し、シミュレーションと実世界で高い性能を実証した。
- WorldArena 2.0:モダリティ・機能・プラットフォームにわたる身体化ワールドモデルベンチマークの拡張ベンチマーク2026/5/1
身体化ワールドモデルの評価を、視覚のみから視触覚へ、政策評価から強化学習環境としての利用へ、シミュレータから実ロボットへと拡張したベンチマークを提案した。
- LatentUM: 潜在空間統合モデルによるインターリーブ型クロスモーダル推論の可能性を解き放つVLA2026/4/2
視覚理解と生成を共通の潜在空間で表現する統合モデルLatentUMを提案し、ピクセル空間を介さずに柔軟なクロスモーダル推論と生成を実現した。
- Motubrain: ロボット制御のための高度な世界行動モデルVLA/世界モデル2026/4/1
視覚・言語・行動を統合した世界行動モデルMotubrainを提案し、動画と行動の同時予測や多様なロボットデータへの対応、高速な実時間推論を実現した。
- RDT2:UMIデータのスケーリング限界を探り、ゼロショットのクロスエンボディメント汎化を実現VLA2026/2/1
7BパラメータのVLMを基盤とし、1万時間超のUMIデータと3段階学習で、未知の物体・シーン・指示・ロボット機体にゼロショットで汎化するロボット基盤モデルを構築した。
- WorldArena:身体性世界モデルの知覚と機能的実用性を評価する統合ベンチマーク世界モデル2026/2/1
身体性世界モデルを映像知覚品質と下流タスクでの機能的実用性の両面から評価する統合ベンチマークWorldArenaを提案し、14モデルの実験から知覚と機能の間に大きなギャップがあることを示した。
- ナイトメア・ドリーマー:危険状態を夢見て先回りする安全強化学習安全強化学習2026/1/1
学習した世界モデルで将来の安全違反を予測し、それを避けるように行動計画を立てるモデルベース安全強化学習手法を提案。画像入力のみで安全性と効率を大幅に改善した。
- Motus: 統合潜在行動ワールドモデルVLA2025/12/1
理解・映像生成・行動の3エキスパートをMixture-of-Transformerで統合し、光流から潜在行動を学習する統一ワールドモデルを提案。シミュレーションと実世界で既存手法を上回る性能を示した。
- Vidarc: 閉ループ制御のための身体性ビデオ拡散モデルVLA2025/12/1
マスク付き逆動力学モデルを組み合わせた自己回帰的な身体性ビデオ拡散モデルにより、低遅延で高精度なロボットアームの閉ループ制御を実現した研究。
- H-RDT: 人間の操作データで強化した両腕ロボットマニピュレーションマニピュレーション2025/7/1
大規模な一人称視点の人間操作動画と3D手姿勢を事前学習に活用し、拡散トランスフォーマーとフローマッチングでロボットの両腕操作ポリシーを学習する手法を提案。シミュレーションと実機で既存手法を上回る性能を示した。
- AnyPos: 双腕マニピュレーションのためのタスク非依存動作の自動生成マニピュレーション2025/7/1
タスクに依存しない動作データを大規模に自動収集し、逆動力学学習で身体ダイナミクスをモデル化することで、様々なタスクやプラットフォームに転用可能な双腕マニピュレーション基盤を構築した研究。
- Vidar: 汎用マニピュレーションのための身体性ビデオ拡散モデルマニピュレーション2025/7/1
インターネット規模で事前学習したビデオ拡散モデルを実機ロボットの軌道で追加学習し、マスク付き逆動力学モデルで適応させることで、未知のロボットでも20分の実演だけで新タスクや背景・視点変化に汎化する手法を提案。
- ManiBox: スケーラブルなシミュレーションデータ生成による身体性空間汎化の強化sim2real2024/11/1
バウンディングボックスを入力とする学生ポリシーを強化学習教師から蒸留し、シミュレーションでスケールしたデータで実機へのゼロショット転移を実現したフレームワーク。
- RDT-1B:双腕マニピュレーションのための拡散基盤モデルマニピュレーション2024/10/1
双腕ロボット操作のための12億パラメータの拡散ベース基盤モデルRDTを提案し、統一行動空間と大規模マルチロボットデータで事前学習することで、未知物体へのゼロショット汎化や言語指示追従、少数デモからの新スキル学習を実現した。
- 動的オープンボキャブラリ3Dシーングラフによる長期言語誘導型モバイルマニピュレーションモバイルマニピュレーション2024/10/1
RGB-D入力と視覚言語モデルを用いて動的に更新可能な3Dシーングラフを構築し、言語指示に基づく長期モバイルマニピュレーションを実現するフレームワークDovSGを提案した。
- Navi2Gaze: 基盤モデルを活用したナビゲーションと対象物注視ナビゲーション2024/7/1
視覚言語モデル(VLM)を使い、タスク記述に基づいてロボットが対象物に対して適切な位置と向きを自動で選び、効率的に移動・注視する手法を提案した論文。
- PEAC: クロスエンボディメント強化学習のための教師なし事前学習クロスエンボディメントRL2024/5/23
報酬なし環境でのオンライン相互作用を通じて、身体性に依存しない汎用的な知識を獲得するクロスエンボディメント教師なし強化学習(CEURL)を定式化し、そのための新しいアルゴリズムPEACを提案した。
- 周波数領域で動くロボット制御ネットワークFCNet模倣学習/制御2024/5/1
ロボット軌道の特徴が低周波に集中することに着目し、短時間フーリエ変換で時変特徴を符号化する制御ネットワークFCNetを提案。Transformerより高効率・低遅延で実時間意思決定を実現した。
- Score Regularized Policy Optimization through Diffusion Behavior2023/10/11
- i-Octree: A Fast, Lightweight, and Dynamic Octree for Proximity Search2023/9/1