Zhangquan Chen
Tsinghua University
収録論文 4本 ・ フィジカルAI/ロボット学習
VLA空間推論
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Spatial-OPSD: ラベル不要の自己蒸留による空間推論の自己改善VLA2026/9/29
深度や3D再構成などの知覚ツールから得られる空間事前情報を特権教師が与え、ラベルなしで学生モデルの空間推論を自己蒸留により反復改善するフレームワーク。
- LLaVA-OneVision-2:次世代知覚知能に向けてVLA2026/5/25
動画を圧縮ビットストリームとして扱い、適応的な時間グループと空間的証拠の選択によりトークン予算を効率的に配分する新しい視覚言語モデルを提案。大規模なオープン監視データで学習し、動画理解や時間的・空間的接地、操作トレース推論などで高性能を達成。
- SpaMEM: 身体化環境における知覚-記憶統合による動的空間推論のベンチマーク空間推論2026/4/24
マルチモーダル大規模言語モデルの身体化環境での長期的空間推論能力を評価する大規模ベンチマークSpaMEMを提案し、行動系列による空間状態変化を伴うタスクでモデルの限界を明らかにした。
- Reasoning-VLA:自動運転向けの高速で汎用的な視覚-言語-行動推論モデルVLA2025/11/1
学習可能な行動クエリと推論強化された視覚言語特徴を並列に用いて連続行動軌道を生成するVLAフレームワークを提案し、8つの自動運転データセットを統合して学習・強化学習微調整を行い、最先端の性能と汎化性、高速推論を実現した。