Zhanguang Zhang
Huawei Noah's Ark Lab
収録論文 13本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- StageGuard: エージェント蒸留による長期的ロボットタスクの段階遷移学習VLA2026/9/17
大規模VLMの推論を蒸留した軽量モデルで、長期ロボットタスクにおけるサブタスク完了判定とスキル切替を高精度かつ低遅延で行うフレームワークを提案。
- Faster-WAM: 世界行動モデルに深い行動モジュールは必要か?VLA2026/8/1
ビデオ世界モデルと行動予測を組み合わせたWorld Action Models (WAMs)の計算負荷を減らすため、事前学習済みビデオTransformerを表現ハブとし、軽量な出力ヘッドをドッキングする新しい設計原理DoTを提案し、単層行動ヘッドを30層ビデオバックボーンに接続したFaster-WAMを実装。低遅延で競争力のある性能と汎化を実証した。
- RoboHarness: メモリ駆動による異種ロボットポリシーの統合オーケストレーションによる長期的計画長期計画/ポリシー統合2026/7/1
複数の異なるロボット制御システム(VLA、RL、TAMPなど)を再利用可能なスキルとして統合し、実行メモリとオンライン証拠を用いて能力境界を推定し、長期的タスクを能力に応じて分解・ルーティングするフレームワークを提案。ポリシー切り替え時の分布ミスマッチをメモリブリッジで緩和し、ゼロショット長期計画とOOD堅牢性を向上させた。
- 世界行動モデルはVLAより汎化するのか?ロバスト性の比較研究VLA2026/3/1
VLAと世界行動モデル(WAM)をLIBERO-PlusやRoboTwin 2.0-Plusで視覚・言語の摂動下に比較し、WAMの高いロバスト性を示した研究。
- H-WM:階層型ワールドモデルによるロボットのタスク・動作計画タスク・動作計画2026/2/1
論理空間と視覚空間の状態遷移を統合的に予測する階層型ワールドモデルを提案し、長期的なロボットタスクの計画と実行を安定化させる。
- 気が散るロボット:視覚的 clutter がロボットマニピュレーションを損なう仕組みマニピュレーション2025/11/1
視覚的 clutter がロボットマニピュレーションに与える影響を心理物理学的指標で評価し、VLA モデルの性能低下や脆弱性を明らかにした。
- Self-CriTeach:自動ドメイン生成によるロボット計画改善のためのLLM自己教授・自己批評フレームワークロボット計画2025/9/1
LLMが記号計画ドメインを自動生成し、それを大規模なCoT教師データ生成と強化学習の報酬関数の両方に活用することで、ロボット計画性能を高める自己教授・自己批評手法を提案した。
- Embodied Arena:具現化AIのための包括的・統合・進化型評価プラットフォーム評価基盤2025/9/1
具現化AIの能力を3階層・7能力・25次元で体系化し、22のベンチマークと30以上のモデルを統合評価する進化型プラットフォームを構築した。
- OmniEVA: タスク適応型3Dグラウンディングと身体性考慮推論による汎用エンボディドプランナーVLA2025/9/1
タスクに応じて3D情報の融合を切り替えるゲート付き機構と、ロボットの身体制約を推論に組み込む枠組みにより、実機で実行可能な計画を立てるエンボディドAIプランナーを提案。
- 実演1回で計画ドメインを自動生成:LLMによる長期ロボット計画の高信頼化タスク・モーション計画2025/5/1
1回の実演軌道からLLMと物理シミュレーションを用いて記号述語と行動を自動生成し、運動計画と統合して長期タスク計画を実行可能にするフレームワークPDDLLMを提案。
- Mem2Ego: グローバル記憶と自己中心視点を統合した長期的身体性ナビゲーションナビゲーション2025/2/1
グローバルな記憶モジュールからタスク関連情報を適応的に取得し、エージェントの自己中心的な視覚入力と統合することで、長期的な物体ナビゲーションの性能を向上させるVLMベースのフレームワークを提案した。
- SpatialCoT:座標アライメントと思考連鎖による身体性タスク計画の空間推論強化VLA2025/1/1
視覚言語モデルの空間推論能力を高めるため、座標の双方向アライメントと思考連鎖に基づく空間グラウンディングを組み合わせたSpatialCoTを提案し、ナビゲーションとマニピュレーションのタスクで従来手法を上回る性能を示した。
- ET-Plan-Bench: 基盤モデルによる時空間認知に向けた身体性タスクレベル計画ベンチマークタスク計画2024/10/1
LLMによる身体性タスク計画を評価するベンチマークET-Plan-Benchを提案し、空間・時間・因果理解を要するタスクで最先端モデルの性能が大きく低下することを示した。