Qihang Zhang
収録論文 8本 ・ フィジカルAI/ロボット学習
VLA世界モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Zero-WAM: 人間のビデオからの文脈内世界行動モデリングによるオープンエンドなタスク汎化VLA2026/8/26
人間のビデオを文脈内の指示として用いることで、訓練時に見たことのない操作タスクをゼロショットで実行できるビデオ行動モデルを提案した。
- 汎用ロボット制御のためのネイティブなビデオ・アクション事前学習VLA2026/7/1
ロボット制御に特化したビデオ・アクション基盤モデルLingBot-VA 2.0を提案。意味的視覚・行動トークナイザ、因果事前学習、スパースMoE、非同期推論により、複雑な操作タスクでの数ショット汎化を実現した。
- RepWAM: 表現型ビジュアル・アクショントークナイザによるワールドアクションモデリングVLA2026/6/11
再構成ではなく意味的な視覚・行動の潜在空間を用いたワールドアクションモデルを提案し、実ロボット操作とシミュレーションで有効性を示した。
- ロボット制御のための因果的世界モデリング世界モデル2026/1/1
行動と視覚変化の因果関係を学習する自己回帰拡散フレームワークLingBot-VAを提案し、長期マニピュレーションや実環境での汎化性能を実証した。
- Generative Category-Level Shape and Pose Estimation with Semantic Primitives2022/10/1
- Learning to Drive by Watching YouTube Videos: Action-Conditioned Contrastive Policy Pretraining2022/4/1
- MetaDrive: Composing Diverse Driving Scenarios for Generalizable Reinforcement Learning2021/9/1
- Improving the Generalization of End-to-End Driving through Procedural Generation2020/12/1