Jisong Cai
Shanghai AI Laboratory
収録論文 8本 ・ フィジカルAI/ロボット学習
世界モデルsim2realロボットポリシー評価VLA操作学習マニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- InternW0: 効率的な実世界インタラクションのための基盤的物理世界モデル世界モデル2026/9/23
上海AI Labが、視覚予測とロボット制御を非対称なvideo-actionアーキテクチャで統合した物理世界モデルInternW0を提案。約7,200時間のデータで学習し、化学合成やピペッティングなどの実世界タスクで評価した。
- Uranus: 身体性AIのための次世代シミュレーション基盤の構築sim2real2026/9/21
関節軌道条件付き自己回帰拡散モデルを用いたデータ駆動型ロボットシミュレータUranusを提案し、ストリーミング生成、低遅延、多様なロボット制御に対応した。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステムロボットポリシー評価2026/8/1
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減した。
- Enfold: 世界モデルの想像力を予測表現に折り畳み、超効率的な身体制御を実現VLA2026/7/1
生成モデルが未来を構築する過程で得られる中間計算を、現在の視覚と言語指示のみから予測される表現に転移させる手法を提案。推論時に生成器を実行せずに行動予測が可能となり、遅延を大幅削減。
- AHA-WAM:非同期・地平線適応型ワールドアクションモデルと観測誘導コンテキストルーティング操作学習2026/6/8
世界予測と行動実行を異なる時間解像度で行う非同期ワールドアクションモデルを提案し、ロボット操作タスクで性能を向上させた。
- UniVLA:タスク中心の潜在行動でどこでも行動を学習するVLA2025/5/1
動画からタスク中心の潜在行動表現を学習し、異なるロボットや環境に展開可能な汎用視覚言語行動ポリシーを実現した研究。
- AgiBot World Colosseo:スケーラブルで知能的な身体性システムのための大規模マニピュレーションプラットフォームマニピュレーション2025/3/1
100万以上の軌道と217タスクを含む大規模ロボット操作データセットと、潜在行動表現を活用した汎用方策GO-1を提案し、データ規模の拡大に伴う性能向上と実世界での巧みな長期的タスクの成功率向上を示した。
- ロボット操作のための相乗的・汎用的・効率的なデュアルシステムに向けてマニピュレーション2024/10/1
汎用ポリシーと専門ポリシーを組み合わせたデュアルシステムRoboDualを提案し、少ない学習データで高精度・高効率なロボット操作を実現した。