Wenqiao Zhang
Zhejiang University
収録論文 7本 ・ フィジカルAI/ロボット学習
ナビゲーションVLA/ベンチマークVLA計画/シンボリック推論ベンチマーク/一人称視点/推論
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 記憶を超えて:変化する世界での持続的ナビゲーションのための予測的4D信念ナビゲーション2026/9/30
観測が途切れても対象が移動し続ける環境で、3D物体履歴から時間インデックス付きの信念を構築し、イベント駆動フィルタで対象位置を予測・更新しながらナビゲーションする手法EvolvingNavを提案。
- RoboSPA: VLAモデルは単純なシーンと短期的なタスクを超えられるか?VLA/ベンチマーク2026/9/4
VLAモデルの空間的・手続き的複雑さに対する推論能力を診断する大規模ロボット操作ベンチマークRoboSPAを提案し、既存モデルの限界を明らかにした。
- EmbodiedSkills: VLAエージェントの統合フレームワークVLA2026/9/1
VLAモデルを長期的タスクに適用するための、実行提案としてのスキル判断を検証する統合フレームワークを提案。
- SCOPE: オープンエンド環境における計画のためのシンボリック世界の進化計画/シンボリック推論2026/6/21
視覚言語モデルと古典的プランナーを統合した計画手法において、不完全なシンボリック表現を自己適応的に進化させるフレームワークSCOPEを提案し、環境摂動下での計画成功率と適応性を向上させた。
- VisualThink-VLA: 視覚的推論による効率的で低遅延な視覚言語行動ポリシーVLA2026/5/28
テキストの思考連鎖に代わる視覚的推論を導入し、行動予測の精度を保ちつつ推論遅延を大幅に削減したVLAポリシーを提案。
- EgoCoT-Bench:MLLMの接地・検証可能な操作中心推論のベンチマークベンチマーク/一人称視点/推論2026/5/19
一人称視点の動画における操作中心の推論を評価する新しいベンチマークを提案し、時空間シーングラフを用いて接地された推論根拠を生成・検証する。
- RynnBrain: オープンな身体性基盤モデルVLA2026/2/1
知覚・推論・計画を統合した時空間基盤モデルRynnBrainを提案し、2B/8B/30B-A3B MoEの3規模と下流タスク向け4変種を公開、20の身体性ベンチマークで既存モデルを大幅に上回った。