Tatul Danielyan
収録論文 1本 ・ フィジカルAI/ロボット学習
VLM評価/失敗検出
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FailBench: VLMはロボットタスクの成功判定をどこまで信頼できるか?VLM評価/失敗検出2026/9/3
ロボット操作の失敗検出を評価するベンチマークFailBenchを構築し、13種類のVLMベース検出器の性能を分析。最高性能でも平均バランス精度0.77にとどまり、接触を伴う組立タスクではほぼ偶然レベルに低下することを示した。