Jingqun Tang
収録論文 2本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ProFocus: 視覚と言語によるナビゲーションにおける能動的知覚と焦点化推論VLA2026/3/1
VLNエージェントの非効率な視覚処理と無差別な履歴利用を改善するため、LLMとVLMの協調による訓練不要のフレームワークProFocusを提案。能動的知覚で必要な視覚情報を特定し、BD-MCTSで高価値な経路点に焦点を当てた推論を行う。
- DTP: 視覚言語行動モデルのための簡便かつ効果的な妨害トークン枝刈りフレームワークVLA2026/1/1
VLAモデルがタスク無関係領域の画像トークンに過剰に注意する問題を解決するため、動的に検出・枝刈りするプラグアンドプレイのDTPフレームワークを提案し、タスク成功率を改善した。