Pranav Saxena
収録論文 3本 ・ フィジカルAI/ロボット学習
3DシーングラフVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ZING-3D: 視覚言語モデルによるゼロショット漸進的3Dシーングラフ3Dシーングラフ2025/10/1
視覚言語モデルを活用し、追加学習なしで3D空間の物体と関係を漸進的にグラフ化するフレームワークを提案。深度情報で3D位置を接地し、ロボティクス応用に適した意味表現を生成する。
- LLM-RG: 大規模言語モデルを用いた屋外シーンにおける参照表現のグラウンディングVLA2025/9/1
屋外運転シーンで自然言語の参照表現(例:「右側の黒い車」)が指す物体を特定するため、視覚言語モデルで属性を抽出し、大規模言語モデルで推論するハイブリッド手法を提案。Talk2Carベンチマークで大幅な精度向上を達成。
- UAV-VLN: 無人航空機のためのエンドツーエンド視覚言語誘導ナビゲーションVLA2025/4/1
大規模言語モデルと視覚認識を統合し、自然言語指示に基づいて無人航空機が未知環境を自律飛行するエンドツーエンドの視覚言語ナビゲーション手法を提案した。