Zesen Gan
収録論文 2本 ・ フィジカルAI/ロボット学習
VLA視覚表現学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- AR-WAM: 視覚条件付きエージェント対応ワールドアクションモデルによるロボットマニピュレーションVLA2026/9/20
言語指示の代わりにバウンディングボックスと操作トークンで条件付けする0.5Bパラメータの世界行動モデルを提案し、エージェント駆動のロボット制御を実現した。
- ロボット操作のための効率的な視覚表現を学習する構造的潜在点視覚表現学習2026/5/1
3D認識と操作のための事前学習フレームワークを提案し、点群オートエンコーダの潜在空間に点単位の変分オートエンコーダを挿入して、暗黙的表現の表現力と明示的表現の構造的先行知識を組み合わせたハイブリッド表現「構造的潜在点」を学習する。