Jingbo Zhang
Tencent Robotics X
収録論文 3本 ・ フィジカルAI/ロボット学習
ワールドモデルVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GeniWorld: 視覚的アクションによるロボット操作のための汎化可能なインタラクティブワールドモデルワールドモデル2026/8/1
事前学習済みビデオ生成モデルとURDFベースのレンダリングを組み合わせ、数値アクションを視覚的アクション表現に変換することで、未見環境へのロバストなゼロショット汎化を実現するインタラクティブワールドモデルを提案した。
- MaskWAM: マスクプロンプトと予測を統合したワールドアクションモデルVLA2026/6/11
ロボット制御のためのワールドアクションモデルに、マスクを入力と予測の両方に統合する手法を提案し、言語の曖昧さを低減して汎化性能を向上させた。
- ImageWAM: 世界行動モデルは本当にビデオ生成が必要か、それとも画像編集だけで十分か?VLA2026/6/1
ビデオ生成に依存する世界行動モデル(WAM)の課題を指摘し、代わりに画像編集モデルを利用したImageWAMを提案。推論時に画像編集のKVキャッシュを行動予測に活用し、計算コストを大幅削減しつつ性能を向上させた。