Zhipeng Zhang
Shanghai Jiao Tong University
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboFollow:身体性エージェントにおける指示追従の幻想を暴くVLA2026/9/22
視覚シーンが一つのタスクしか許さない「低シーンエントロピー」問題を指摘し、言語理解を厳密に診断する4段階ベンチマークRoboFollowを提案。9つのVLA/WAMポリシーを評価し、指示追従能力が実は脆弱であることを示した。
- 接地された意味的再結合による視覚言語行動モデルの指示一般化の堅牢化VLA2026/8/3
VLAモデルが言い換え指示で性能低下する原因を、アーキテクチャ上の問題として特定し、タスク意味と視覚特徴を明示的に融合する介入(GSR)を提案して、パラフレーズ不変性を大幅に改善した。
- CasaMaestro: 住宅規模の3次元再構成のためのマルチビューパノラマ3次元再構成2026/6/30
この論文は、少数のパノラマ画像から住宅全体の3次元再構成を行うフィードフォワードモデルCasaMaestroを提案している。
- GASE: ガウススプラッティングに基づく身体化シミュレーション環境再構築の自動化システムシミュレーション環境構築2026/6/16
パノラマカメラアレイを用いて環境を高速スキャンし、高品質な前景抽出とインペインティングを経て、物理シミュレータにそのまま使える高忠実度シーンを自動構築するシステムを提案した。実ロボット実験で、実データのみで訓練したポリシーとの性能差が10%未満であることを示した。
- RoboMemArena:ロボット記憶のための包括的で挑戦的なベンチマークベンチマーク/VLA/記憶2026/5/1
ロボットの長期タスクにおける記憶能力を評価するため、26タスク・平均1000ステップ超の大規模ベンチマークRoboMemArenaを構築し、VLMによるサブタスク生成と実世界評価を備えた。さらに、記憶管理と予測符号化を統合したVLAモデルPrediMemを提案し、既存手法を上回る性能を示した。
- ツール整合型視覚言語行動モデルによる長期的身体エージェントの実現VLA/長期タスク2026/5/1
高レベルのVLMエージェントが計画を、専門化されたVLAツール群が局所操作を分担し、長期的タスクを効率的に実行する枠組みを提案した。
- 隔離を超えて:汎用ナビゲーションのための統一ベンチマークナビゲーション2026/5/1
多様なロボット形態と複合的なナビゲーションタスクを統合したベンチマークOmniNavBenchを提案し、既存手法の汎用ナビゲーション能力の限界を明らかにした。
- QVLA: 視覚-言語-行動モデルの量子化におけるチャネルごとの重要度割り当てVLA2026/2/1
VLAモデルの量子化を行動空間の感度に基づいてチャネル単位でビット幅を割り当てる手法を提案し、メモリ削減とタスク成功率の両立を実現した。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- FlowDrive: エンドツーエンド自動運転のためのエネルギーフローフィールド自動運転/プランニング2025/9/1
リスクポテンシャルと車線引力場という物理的に解釈可能なエネルギーフローフィールドをBEV空間に導入し、拡散プランナで軌道生成する自動運転フレームワーク。NAVSIM v2でEPDMS 86.3のSOTAを達成。