Wenjie Zhang
HKUST(GZ)
収録論文 9本 ・ フィジカルAI/ロボット学習
VLAエージェントヒューマノイド移動操作/VLAマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ActiveScale:モデル・データ・ハードウェアを横断したロボットの能動的知覚のスケーリングVLA2026/9/16
視点変更を伴う操作タスクのための能動的知覚フレームワークを提案し、カメラ姿勢を考慮したVLAモデル、1000時間の一人称視点データによる中間学習、単一操作者で遠隔操作可能な移動マニピュレーションプラットフォームを統合した。
- SkillZip: 契約保存型グラフ圧縮によるスケーラブルなエージェントスキルライブラリエージェント2026/8/6
大規模言語モデルエージェントのスキルライブラリを、実行可能なまま圧縮するフレームワークSkillZipを提案。セクションレベルのグラフを契約を保って圧縮し、推論時に展開することで、圧縮率と依存関係の保持を両立する。
- ω-0: 人間型ロボットの同時移動操作のための潜在予測世界行動モデルヒューマノイド2026/8/1
言語指示と視覚・状態入力から、移動と操作を同時に行う全身行動を直接予測する世界行動モデルを提案し、実機で11種類の家庭タスクを達成した。
- DreamTrajectory: ワールドモデル整合による軌道誘導型行動生成による移動操作移動操作/VLA2026/8/1
移動操作ロボットのための軌道誘導型フレームワークを提案し、意図レベルの軌道予測と全身行動生成を統合、テスト時探索で計画軌道との整合性を高め成功率を向上させた。
- Rule-VLN:意味推論と幾何補正による知覚とコンプライアンスの橋渡しVLA2026/4/1
ルール遵守ナビゲーションのための大規模都市ベンチマークRule-VLNを構築し、事前学習済みエージェントに安全意識を付与するゼロショットモジュールSNRMを提案した。
- 視点汎化を超えて:多視点デモがもたらすものとロボット操作のためのその合成方法マニピュレーション2026/3/1
多視点デモデータがロボット操作の性能と汎化に与える影響を体系的に分析し、単眼入力から新視点ビデオを合成する自己教師ありフレームワークRoboNVSを提案した。
- QUART-Online: 四足歩行ロボット学習のための遅延フリー大規模マルチモーダル言語モデルVLA2024/12/1
四足歩行ロボットの視覚-言語-行動タスクにおいて、推論遅延を解消するために行動チャンク離散化を導入し、言語基盤モデルの性能を落とさずにリアルタイム推論を実現した研究。
- Data-Centric Evolution in Autonomous Driving: A Comprehensive Survey of Big Data System, Data Mining, and Closed-Loop Technologies2024/1/1
- QUAR-VLA: Vision-Language-Action Model for Quadruped Robots2023/12/1