Pranav Guruprasad
収録論文 4本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 視覚言語行動モデルの汎用性を測る統一ベンチマークVLA2025/12/12
VLMとVLAの6つの能力領域にわたるクロスドメイン汎用性を評価する統一ベンチマークMultiNet v1.0を提案し、既存モデルが訓練分布外で大きく性能劣化することを示した。
- マルチモーダル行動モデル評価・適応のためのオープンソースツールキットとベンチマークスイートVLA2025/6/10
視覚・言語・行動を統合したマルチモーダル行動モデルを評価・適応するためのオープンソースベンチマーク「MultiNet」と関連ツールキットを提案し、1.3兆トークン超の複合データセットを提供する。
- 手続き生成されたオープンエンド行動環境における視覚・言語・行動モデルのベンチマークVLA2025/5/8
Procgenの多様な手続き的タスクでVLM/VLAモデルのゼロショット汎化性能を評価するベンチマークMultiNet v0.2を提案し、OODタスクでの限界やアーキテクチャ設計の重要性を明らかにした。
- ロボット学習タスクにおける視覚・言語・行動モデルのベンチマーク評価VLA2024/11/1
GPT-4oやOpenVLAなど3つのVLAモデルを20種類の操作タスクで評価し、性能のばらつきや多段階計画の難しさを明らかにした。