Sombit Dey
収録論文 6本 ・ フィジカルAI/ロボット学習
VLAシーン理解
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 2D VLMを3Dプログラマに変えるタスク適応型グラウンディングVLA2026/10/1
2Dの視覚言語モデルに座標系の統一とタスク適応フィードバックを組み合わせ、再学習なしで3D理解・操作・生成を可能にするフレームワーク3D-Progを提案。
- AR-VLA: 視覚言語行動モデルのための真の自己回帰型アクションエキスパートVLA2026/3/1
観測ごとに時間的文脈をリセットする従来のVLAや拡散ポリシーと異なり、長期記憶で履歴を保持し連続的な因果系列として行動を生成する自己回帰型アクションエキスパートを提案。再アンカリング機構で非同期な視覚・言語・行動を同期させ、滑らかで文脈認識型の行動生成を実現した。
- SPEAR-1: 3D理解によるロボット実演を超えるスケーリングVLA2025/11/1
非ロボット画像に3D注釈を付与してVLMを強化し、3D認識と言語指示制御を統合したロボット基盤モデルSPEAR-1を提案。ロボット実演を20分の1に抑えつつ最先端性能を達成。
- スキャンから行動へ:実世界スキャンを活用した身体性シーン理解シーン理解2025/7/1
実世界の3Dスキャンデータと注釈をUSDで統合し、LLMによるシーン編集とロボットシミュレーションでの政策学習に応用した研究。
- ReVLA: ロボット基盤モデルの視覚的ドメイン制限を回復するVLA2024/9/1
既存のロボット基盤モデルが視覚的なドメイン外シーンに弱い問題を分析し、モデルマージによる段階的バックボーン復元で視覚汎化性能を回復させる手法を提案した。
- Learning whom to trust in navigation: dynamically switching between classical and neural planning2023/7/1