Vineet Bhat
NVIDIA
収録論文 6本 ・ フィジカルAI/ロボット学習
VQA/操作計画VLA把持
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PROBE: VLMエージェントによる操作基盤の視覚質問応答VQA/操作計画2026/8/17
ロボットが隠れた物体を探すために操作が必要な動的シーンでの視覚質問応答(MG-VQA)を提案し、シミュレータとベンチマークを構築、VLMエージェントの性能を評価・微調整する手法を示した。
- BOP-ASK:視覚言語モデルのための物体インタラクション推論VLA2025/11/1
6D物体姿勢データを活用し、把持姿勢や経路計画などの細かい空間推論を問う15万枚・3300万QAペアの大規模データセットBOP-ASKを構築し、VLMの物体インタラクション理解を評価・訓練する。
- MapleGrasp: マスク誘導特徴プーリングによる言語駆動型効率的ロボット把持把持2025/6/1
言語指示とRGB-D画像から把持姿勢を予測する際、CLIP特徴からセグメンテーションマスクを予測しその内部で特徴をプーリングすることで計算効率と精度を向上させ、大規模データセットRefGraspNetも提案した研究。
- 3D CAVLA: 奥行きと3Dコンテキストを活用した未見タスクへの汎化を実現する視覚言語行動モデルVLA2025/5/1
VLAモデルにChain-of-Thought推論、深度認識、関心領域検出を組み込み、未見タスクへの汎化性能を向上させたフレームワークを提案。
- HiFi-CS: 視覚言語モデルを用いたロボット把持のためのオープン語彙視覚的グラウンディングVLA2024/9/1
画像とテキストの埋め込みを階層的に融合する軽量デコーダで、複雑な指示文から把持対象を高精度に特定し、7自由度アームでの実機実験で90.33%の精度を達成した。
- Grounding LLMs For Robot Task Planning Using Closed-loop State Feedback2024/2/1