Yanan Jian
収録論文 3本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- VISTA: 視覚条件付けを強化する追従選好最適化によるVLAモデルVLA2026/2/1
VLAモデルが視覚状態に弱く依存してしまう問題に対し、追従タスクでの選好最適化と潜在蒸留で視覚条件付けを強化し、タスク性能を向上させた。
- スキーマ誘導シーングラフ推論:マルチエージェントLLMシステムによるSG²VLA2025/2/1
シーングラフのスキーマを手がかりに、計画立案エージェントと情報検索エージェントが反復協調して空間推論を行うマルチエージェントLLMフレームワークを提案し、Q&Aや計画タスクで既存手法を上回る性能を示した。