Adithya Hebbalae
収録論文 1本 ・ フィジカルAI/ロボット学習
ビデオ理解
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CrossView: 視覚言語モデルはカメラをまたいで推論できるか?ビデオ理解2026/8/16
複数カメラ映像の質問応答ベンチマークCrossViewを新たに導入し、既存の視覚言語モデルが複数視点の統合推論に苦戦することを示した。
世界のフィジカルAIを、日本語で。
収録論文 1本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
複数カメラ映像の質問応答ベンチマークCrossViewを新たに導入し、既存の視覚言語モデルが複数視点の統合推論に苦戦することを示した。