Ningya Feng
収録論文 2本 ・ フィジカルAI/ロボット学習
VLA世界モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- JEPA-VLA:VLAモデルに動画予測埋め込みが必要な理由VLA2026/2/1
動画で事前学習した予測埋め込み(V-JEPA 2)をVLAモデルに適応的に統合し、サンプル効率と汎化性能を大幅に向上させる手法を提案。
- iVideoGPT:インタラクティブな動画生成モデルによるスケーラブルな世界モデル世界モデル2024/5/1
視覚・行動・報酬をトークン列に統合した自己回帰型Transformerで、次トークン予測によりエージェントが想像環境内で対話的に行動できる世界モデルを構築し、大規模な操作軌跡で事前学習した。