Maximilian Dillitzer
収録論文 4本 ・ フィジカルAI/ロボット学習
シーン理解VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SNOW: 世界知識を活用した時空間シーン理解によるオープンワールド身体性推論シーン理解2025/12/1
VLMの意味情報と点群幾何・時間的一貫性を統合し、4Dシーングラフを構築する学習不要のフレームワークを提案。動的環境での空間的・時間的理解を可能にする。
- R4: 4次元時空間における視覚言語モデルのための検索拡張推論VLA2025/12/1
視覚言語モデルに4次元時空間の構造化された生涯記憶を持たせ、訓練なしで検索拡張推論を行うフレームワークR4を提案。物体レベルの意味情報を空間と時間に紐づけて蓄積し、クエリを意味・空間・時間のキーに分解して検索することで、動的環境でのエピソード的・協調的推論を可能にする。
- Embodied4C:身体性を持つ視覚言語ナビゲーションの本質を測るベンチマークVLA2025/12/1
自動運転車・ドローン・ロボットアームの3つの身体性で視覚言語モデルの推論・制御能力を評価する閉ループベンチマークを提案し、空間・時間推論が最大のボトルネックであることを示した。
- 自動運転におけるマルチモーダル大規模言語モデルのシナリオ理解を能力駆動で評価する枠組みVLA2025/3/1
自動運転向けMLLMのシナリオ理解を、意味・空間・時間・物理の4能力軸で体系的に評価する枠組みを提案し、実交通シナリオで適用例を示した。