Pushi Zhang
収録論文 5本 ・ フィジカルAI/ロボット学習
VLAナビゲーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- X-Tokenizer: 視覚・言語・行動事前学習のためのマルチモーダル行動トークナイザーVLA2026/6/1
ロボットの行動を離散コードに変換する際、単なる再構成ではなく意味的なインターフェースとして学習する新しいトークナイザーを提案。マスク行動モデリングと対照学習により、行動コードが視覚言語の意味と整合するようにした。
- Wall-OSS-0.5 技術報告書VLA2026/5/1
大規模VLA事前学習がロボットの実行可能な行動を直接生み出すかを検証し、ゼロショットで実ロボット動作を達成するオープンソース4Bモデルを提案した。
- PIG-Nav: 事前学習済み画像ゴールナビゲーションモデルのための重要知見ナビゲーション2025/7/1
視覚ベースのロボットナビゲーションのための事前学習戦略を検討し、早期融合ネットワーク構造と補助タスクの導入、ゲーム動画データセットの効率的なラベリング手法を提案することで、ゼロショットおよびファインチューニング性能を大幅に向上させた。
- villa-X:Vision-Language-Actionモデルにおける潜在行動モデリングの強化VLA2025/7/1
VLA事前学習に潜在行動(2フレーム間の動きの抽象表現)を組み込み、その学習方法と統合方法を改善したViLLAフレームワークvilla-Xを提案。未見の身体でもゼロショットで潜在行動計画を生成でき、シミュレーションと実機のグリッパー・多指ハンド操作で高性能を示した。
- IGOR: 身体性AI基盤モデルのための画像ゴール表現による原子的制御単位VLA2024/11/1
画像間の変化を潜在行動に圧縮し、人間と多様なロボットに共通する意味的に一貫した行動空間を学習することで、知識転移や言語との整合、ロボット制御を可能にする基盤モデルを提案した。