Xiangyu Fan
収録論文 3本 ・ フィジカルAI/ロボット学習
視覚推論VLA空間知能評価
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VBVR-Pro: ネイティブ視覚推論のためのスケーラブルで検証可能なスイート視覚推論2026/8/26
視覚生成を推論の媒体として扱うネイティブ視覚推論の研究を進めるため、300の手続き生成タスクからなる閉ループテストベッドVBVR-Proを導入し、検証可能な報酬スコアラと制御されたモダリティ比較を提供する。
- マルチモーダル基盤モデルによる空間知能のスケーリングVLA2025/11/1
800万件の多様な空間データでマルチモーダル基盤モデルを訓練し、空間知能ベンチマークで大幅な性能向上を達成するとともに、データスケーリングや創発的汎化の兆候を分析した。
- マルチモーダルLLMの空間知能を包括的に評価するEASI空間知能評価2025/8/1
GPT-5など最先端マルチモーダルモデルの空間理解・推論能力を、統一的なタスク分類に基づく8つのベンチマークで大規模に評価し、人間との差や限界を明らかにした。