Bruce C. Hansen
収録論文 1本 ・ フィジカルAI/ロボット学習
VLM/シーン理解
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 画像とテキストから学ぶ限界:視覚言語モデルと身体化されたシーン理解VLM/シーン理解2026/3/27
視覚言語モデル(VLM)が人間のシーン理解をどの程度捉えられるかを、15種類のタスクで人間の回答と比較し、特にアフォーダンス(行為可能性)の理解に構造的な欠陥があることを示した論文。
世界のフィジカルAIを、日本語で。
収録論文 1本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
視覚言語モデル(VLM)が人間のシーン理解をどの程度捉えられるかを、15種類のタスクで人間の回答と比較し、特にアフォーダンス(行為可能性)の理解に構造的な欠陥があることを示した論文。