Valts Blukis
NVIDIA
収録論文 26本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PROBE: VLMエージェントによる操作基盤の視覚質問応答VQA/操作計画2026/8/17
ロボットが隠れた物体を探すために操作が必要な動的シーンでの視覚質問応答(MG-VQA)を提案し、シミュレータとベンチマークを構築、VLMエージェントの性能を評価・微調整する手法を示した。
- VoLo: オープン語彙の長期的操作のための物理オーケストレータ操作/VLA2026/6/1
VLMがロボットの多様な能力を中断可能なツールとして統合し、長期的な操作タスクを計画・実行・監視・回復するエージェントループを提案。高忠実度ベンチマークRoboVoLoで評価し、既存手法を上回る性能を実証。
- Vesta: 汎用身体化推論モデルVLA2026/6/1
ロボットのための単一の基盤モデルで、位置推定・空間推論・ナビゲーション・長期計画を統合し、専門モデル群を上回る性能を示した。
- SpaceTools: 二重対話型強化学習によるツール拡張空間推論VLA2025/12/1
VLMが複数の視覚ツールを強化学習で協調利用できるよう訓練する二段階フレームワークDIRLを提案し、空間推論ベンチマークで最高性能と実機マニピュレーションを実現した。
- BOP-ASK:視覚言語モデルのための物体インタラクション推論VLA2025/11/1
6D物体姿勢データを活用し、把持姿勢や経路計画などの細かい空間推論を問う15万枚・3300万QAペアの大規模データセットBOP-ASKを構築し、VLMの物体インタラクション理解を評価・訓練する。
- VLA-0: ゼロ改変で最先端のVLAを構築するVLA2025/10/1
ロボット操作のための視覚-言語-行動モデルにおいて、行動をテキストとして直接表現する最も単純な戦略を検証し、複雑な手法を上回る性能を達成した。
- OG-VLA: 正投影画像生成による3D認識型視覚言語行動モデルVLA2025/6/1
多視点RGBD観測を正投影画像に変換し、LLMと拡散モデルでエンドエフェクタの次位置・姿勢を生成する3D認識型VLAを提案。未見環境への汎化性能を大幅に向上。
- RoboSpatial:ロボティクスのための2D・3D視覚言語モデルに空間理解を教えるVLA2024/11/1
ロボティクス向けの大規模空間理解データセットRoboSpatialを構築し、2D・3Dの視覚言語モデルに空間推論を学習させることで、空間アフォーダンス予測やロボット操作などのタスク性能を向上させた。
- 実世界画像からロボットシミュレーションタスクを生成するGRSsim2real2024/10/1
単一のRGB-D画像からデジタルツインシミュレーションを構築し、仮想エージェント訓練用のタスクを自動生成するシステムを提案。
- 3D-MVP: ロボットマニピュレーションのための3Dマルチビュー事前学習マニピュレーション2024/6/1
マスク付きオートエンコーダを用いて大規模3Dデータセットで視覚エンコーダを事前学習し、ロボットマニピュレーションの汎化性能を向上させる手法を提案した。
- RVT-2: 少数のデモンストレーションから精密なマニピュレーションを学習マニピュレーション2024/6/1
言語指示に基づく多タスク3Dマニピュレーションにおいて、アーキテクチャとシステムの改善により学習を6倍、推論を2倍高速化し、RLBenchで成功率82%を達成、実世界でも10回のデモで高精度タスクを学習可能にした。
- RoboPoint: ロボティクス向け空間アフォーダンス予測の視覚言語モデルVLA2024/6/1
合成データで視覚言語モデルをロボット向けに微調整し、言語指示から画像内のキーポイントアフォーダンスを予測するRoboPointを開発。実世界データ不要でスケーラブルに学習でき、ナビゲーションや操作などのタスクで既存手法を上回る。
- 未知の関節物体のデジタルツイン構築のためのニューラル陰的表現3D再構成2024/4/1
異なる関節状態の2つのRGBDスキャンから、未知の関節物体の形状と関節モデルを再構成し、デジタルツインを構築する手法を提案。
- タッチで拓く3Dガウシアンスプラッティング:光沢面を高精度に再構成触覚2024/3/1
触覚の局所深度マップと多視点画像を組み合わせ、光沢・反射面でも少ない画像枚数で高精度に3D再構成する手法を提案。
- Diff-DOPE: Differentiable Deep Object Pose Estimation2023/10/1
- cuRobo: Parallelized Collision-Free Minimum-Jerk Robot Motion Generation2023/10/1
- RVT: Robotic View Transformer for 3D Object Manipulation2023/6/1
- BundleSDF: Neural 6-DoF Tracking and 3D Reconstruction of Unknown Objects2023/3/1
- One-Shot Neural Fields for 3D Object Understanding2022/10/1
- ProgPrompt: Generating Situated Robot Task Plans using Large Language Models2022/9/1
- Correcting Robot Plans with Natural Language Feedback2022/4/1
- A Persistent Spatial Semantic Representation for High-level Natural Language Instruction Execution2021/7/1
- Few-shot Object Grounding and Mapping for Natural Language Robot Instruction Following2020/11/1
- Learning to Map Natural Language Instructions to Physical Quadcopter Control using Simulated Flight2019/10/1
- Mapping Navigation Instructions to Continuous Control Actions with Position-Visitation Prediction2018/11/1
- Following High-level Navigation Instructions on a Simulated Quadcopter with Imitation Learning2018/6/1