S P Sharan
The University of Texas at Austin
収録論文 2本 ・ フィジカルAI/ロボット学習
VLAビデオ理解
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- もし、ならば、そうでなければ:視覚言語ナビゲーションにおける条件分岐の診断VLA2026/8/18
視覚言語ナビゲーションエージェントの条件分岐能力を診断するためのベンチマークCondVLNを導入し、分岐条件をシーングラフに基づいて生成し、エージェントの失敗原因を分析した。
- CrossView: 視覚言語モデルはカメラをまたいで推論できるか?ビデオ理解2026/8/16
複数カメラ映像の質問応答ベンチマークCrossViewを新たに導入し、既存の視覚言語モデルが複数視点の統合推論に苦戦することを示した。