Lvmin Zhang
収録論文 2本 ・ フィジカルAI/ロボット学習
視覚推論世界モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VBVR-Pro: ネイティブ視覚推論のためのスケーラブルで検証可能なスイート視覚推論2026/8/26
視覚生成を推論の媒体として扱うネイティブ視覚推論の研究を進めるため、300の手続き生成タスクからなる閉ループテストベッドVBVR-Proを導入し、検証可能な報酬スコアラと制御されたモダリティ比較を提供する。
- マスク視覚アクションによる統一世界モデリング世界モデル2026/7/1
ロボットの行動をビデオのピクセル空間で表現する新しいインターフェースを導入し、少量のデータで学習したモデルが将来予測や逆モデリングを実現する。