Animesh Maheshwari
収録論文 1本 ・ フィジカルAI/ロボット学習
VLM/空間理解
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 視覚言語モデルは3Dシーンを理解しているのか、それとも物体を列挙しているだけなのか?VLM/空間理解2026/5/19
視覚言語モデルの3D空間理解能力を評価するベンチマークを導入し、物体認識はできるが奥行きや反射などの空間推論に著しく弱いことを明らかにした。
世界のフィジカルAIを、日本語で。
収録論文 1本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
視覚言語モデルの3D空間理解能力を評価するベンチマークを導入し、物体認識はできるが奥行きや反射などの空間推論に著しく弱いことを明らかにした。