Jason J. Corso
収録論文 13本 ・ フィジカルAI/ロボット学習
VLAシーン理解
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Embodied4C:身体性を持つ視覚言語ナビゲーションの本質を測るベンチマークVLA2025/12/1
自動運転車・ドローン・ロボットアームの3つの身体性で視覚言語モデルの推論・制御能力を評価する閉ループベンチマークを提案し、空間・時間推論が最大のボトルネックであることを示した。
- R4: 4次元時空間における視覚言語モデルのための検索拡張推論VLA2025/12/1
視覚言語モデルに4次元時空間の構造化された生涯記憶を持たせ、訓練なしで検索拡張推論を行うフレームワークR4を提案。物体レベルの意味情報を空間と時間に紐づけて蓄積し、クエリを意味・空間・時間のキーに分解して検索することで、動的環境でのエピソード的・協調的推論を可能にする。
- SNOW: 世界知識を活用した時空間シーン理解によるオープンワールド身体性推論シーン理解2025/12/1
VLMの意味情報と点群幾何・時間的一貫性を統合し、4Dシーングラフを構築する学習不要のフレームワークを提案。動的環境での空間的・時間的理解を可能にする。
- 自動運転におけるマルチモーダル大規模言語モデルのシナリオ理解を能力駆動で評価する枠組みVLA2025/3/1
自動運転向けMLLMのシナリオ理解を、意味・空間・時間・物理の4能力軸で体系的に評価する枠組みを提案し、実交通シナリオで適用例を示した。
- Depth from Camera Motion and Object Detection2021/3/1
- The RobotSlang Benchmark: Dialog-guided Robot Localization and Navigation2020/10/1
- Robot-Supervised Learning for Object Segmentation2019/4/1
- Video Object Segmentation-based Visual Servo Control and Object Depth Estimation on a Mobile Robot2019/3/1
- Kinematically-Informed Interactive Perception: Robot-Generated 3D Models for Classification2019/1/1
- Learning Kinematic Descriptions using SPARE: Simulated and Physical ARticulated Extendable dataset2018/3/1
- Predicting Future Lane Changes of Other Highway Vehicles using RNN-based Deep Models2018/1/1
- Spatiotemporal Articulated Models for Dynamic SLAM2016/4/1
- Mutual Localization: Two Camera Relative 6-DOF Pose Estimation from Reciprocal Fiducial Observation2013/1/1