Yuqian Yuan
Zhejiang University
収録論文 7本 ・ フィジカルAI/ロボット学習
VLA/ベンチマークVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboSPA: VLAモデルは単純なシーンと短期的なタスクを超えられるか?VLA/ベンチマーク2026/9/4
VLAモデルの空間的・手続き的複雑さに対する推論能力を診断する大規模ロボット操作ベンチマークRoboSPAを提案し、既存モデルの限界を明らかにした。
- EmbodiedSkills: VLAエージェントの統合フレームワークVLA2026/9/1
VLAモデルを長期的タスクに適用するための、実行提案としてのスキル判断を検証する統合フレームワークを提案。
- VisualThink-VLA: 視覚的推論による効率的で低遅延な視覚言語行動ポリシーVLA2026/5/28
テキストの思考連鎖に代わる視覚的推論を導入し、行動予測の精度を保ちつつ推論遅延を大幅に削減したVLAポリシーを提案。
- RynnBrain: オープンな身体性基盤モデルVLA2026/2/1
知覚・推論・計画を統合した時空間基盤モデルRynnBrainを提案し、2B/8B/30B-A3B MoEの3規模と下流タスク向け4変種を公開、20の身体性ベンチマークで既存モデルを大幅に上回った。
- RynnVLA-002:視覚言語行動と世界モデルの統合VLA2025/11/1
視覚言語行動モデルと世界モデルを統合し、環境の物理を学習して行動生成を洗練させるフレームワークを提案。シミュレーションと実機で性能向上を実証。
- RynnEC:MLLMを身体性認知の世界へVLA2025/8/1
汎用視覚言語モデルに領域エンコーダとマスクデコーダを組み込み、領域中心の動画理解で物体属性・セグメンテーション・空間推論を高精度化した身体性認知向けMLLMを提案。
- ECBench:マルチモーダル基盤モデルは自己中心的世界を理解できるか?包括的身体認知ベンチマークVLA2025/1/1
ロボットの自己認知や動的シーン知覚、幻覚といった身体認知能力を体系的に評価するため、30次元の認知軸を持つベンチマークECBenchと評価システムECEvaluを提案し、各種LVLMを評価した。