Zixuan Wang
Tsinghua University
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- データスケーリングを超えて:視覚言語行動モデルのための表現中心の継続事前学習VLA2026/8/27
ロボットデータの不足を補うため、多様なロボットデータでVLMバックボーンを継続事前学習し、下流タスクの性能を向上させるVLActを提案した。
- Zetta ζ: 自己進化する物理知能のための効率的な閉ループ具現化ハーネス具現化エージェント/自己進化2026/8/17
ロボットの実行中にコードベースの批評家と回復スキルをオンラインで進化させる閉ループハーネスを提案し、LIBERO-ProとRoboCasaで高い成功率と高速化を達成した。
- PolicyTrim: 視覚言語行動モデルの本質的なポリシー効率を高めるVLA2026/6/21
VLAモデルの実行効率を、推論遅延ではなく行動チャンクの有効長と物理ステップ数に着目して改善する強化学習ベースの後訓練フレームワークを提案した。
- SAFE-Pruner: 意味的注意に基づく未来予測型トークンプルーニングによる効率的な視覚言語行動操作VLA/効率化2026/5/1
視覚言語行動モデルの推論を高速化するため、将来の層の注意情報を予測して重要でない視覚トークンを刈り込むプラグアンドプレイ手法を提案した。
- SpatialEvo: 決定論的幾何環境による自己進化型空間知能空間推論2026/4/15
3次元空間推論の自己進化学習において、モデル合意ではなく幾何学的検証に基づく擬似ラベル生成を提案し、誤りを増幅せずに空間知能を向上させるフレームワークを構築した。
- StarVLA-α: 視覚言語行動システムの複雑さを低減するVLA2026/4/1
VLAモデルの設計選択を制御条件下で研究するため、複雑さを最小限に抑えたシンプルなベースラインStarVLA-αを提案し、複数ベンチマークで高い性能を達成した。
- VP-VLA: 視覚プロンプトをインターフェースとする視覚言語行動モデルVLA2026/3/1
VLAモデルのブラックボックス的な制御を改善するため、高次推論と低次実行を分離し、視覚プロンプト(十字線やバウンディングボックス)を介して指示を伝える二重システムフレームワークを提案した。
- Hydra-Nav: 適応的二重プロセス推論による物体ナビゲーション物体ナビゲーション2026/2/1
VLMを用いた物体探索ナビゲーションにおいて、熟考型の遅い推論と反応型の速い実行を状況に応じて切り替える統合アーキテクチャを提案し、探索成功率と効率を大幅に改善した。
- ANNIE: ロボットの安全性に注意せよVLA2025/9/1
視覚言語行動モデルを搭載した身体性AIロボットへの敵対的攻撃の安全性リスクを初めて体系的に研究し、ISO規格に基づく違反分類、評価ベンチマークANNIEBench、攻撃フレームワークANNIE-Attackを提案した。
- Robix: ロボットの対話・推論・計画を統合する統一モデルVLA2025/9/1
視覚言語モデル1つでロボットの高レベル推論・タスク計画・自然言語対話を担い、低レベル制御への指令生成と人間との対話を統合的に実現するモデルを提案。
- DaDu-E:ロボット計算パイプラインにおける大規模言語モデルの役割を再考するVLA2024/12/1
軽量LLMとスキル命令・フィードバック・記憶拡張を組み合わせた閉ループ計画フレームワークDaDu-Eを提案し、大規模モデル並みの成功率を6.6倍少ない計算量で実現した。
- KARMA:長期・短期記憶システムで身体性AIエージェントを強化VLA2024/9/1
長期記憶に3Dシーングラフ、短期記憶に物体の位置・状態変化を記録する二重記憶構造をLLMに組み込み、家庭内の長系列タスク計画の成功率と効率を大幅に改善した。
- COLA: Characterizing and Optimizing the Tail Latency for Safe Level-4 Autonomous Vehicle Systems2023/5/1
- Patterns for Representing Knowledge Graphs to Communicate Situational Knowledge of Service Robots2021/1/1