Abhay Mittal
収録論文 1本 ・ フィジカルAI/ロボット学習
VLA評価
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HumanCLAW: 視覚言語モデルは身体を通して行動できるか?VLA評価2026/7/1
視覚言語モデル(VLM)の身体を使った行動能力を評価するフレームワークを提案し、41の屋内シーンで1,218エピソードのベンチマークを構築。最先端のVLMでも成功率は最大16.8%にとどまり、物体認識ではなく身体の自己認識が欠如していることが課題と判明。