Jonathan Tremblay
NVIDIA
収録論文 39本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PROBE: VLMエージェントによる操作基盤の視覚質問応答VQA/操作計画2026/8/17
ロボットが隠れた物体を探すために操作が必要な動的シーンでの視覚質問応答(MG-VQA)を提案し、シミュレータとベンチマークを構築、VLMエージェントの性能を評価・微調整する手法を示した。
- 戦略的スケールアップ:バイアス認識評価とデータ収集によるロボット操作の構成的汎化学習マニピュレーション2026/7/1
事前学習済みポリシーが指示の一部の要素(色など)に過剰に依存する「指示因子バイアス」を定量化する診断フレームワークを提案し、その結果に基づいてデータ収集を再配分することで、少ないデモ数で汎化性能を向上させる手法を示した。
- Vesta: 汎用身体化推論モデルVLA2026/6/1
ロボットのための単一の基盤モデルで、位置推定・空間推論・ナビゲーション・長期計画を統合し、専門モデル群を上回る性能を示した。
- VoLo: オープン語彙の長期的操作のための物理オーケストレータ操作/VLA2026/6/1
VLMがロボットの多様な能力を中断可能なツールとして統合し、長期的な操作タスクを計画・実行・監視・回復するエージェントループを提案。高忠実度ベンチマークRoboVoLoで評価し、既存手法を上回る性能を実証。
- RoboLab: タスク汎用ポリシー解析のための高忠実度シミュレーションベンチマークベンチマーク2026/4/1
ロボット基盤モデルの真の汎化性能を評価するため、高忠実度シミュレーション環境でタスク生成と系統的解析を可能にするRoboLabフレームワークと、120タスクからなるRoboLab-120ベンチマークを提案した。
- 視覚言語行動モデルのための触覚モダリティ融合VLA2026/3/1
視覚言語行動モデルに触覚信号を軽量に統合するTacFiLMを提案し、接触を伴う挿入・引き出しタスクで成功率や力の安定性を改善した。
- SpaceTools: 二重対話型強化学習によるツール拡張空間推論VLA2025/12/1
VLMが複数の視覚ツールを強化学習で協調利用できるよう訓練する二段階フレームワークDIRLを提案し、空間推論ベンチマークで最高性能と実機マニピュレーションを実現した。
- BOP-ASK:視覚言語モデルのための物体インタラクション推論VLA2025/11/1
6D物体姿勢データを活用し、把持姿勢や経路計画などの細かい空間推論を問う15万枚・3300万QAペアの大規模データセットBOP-ASKを構築し、VLMの物体インタラクション理解を評価・訓練する。
- Sim-to-Real転送のためのロボット政策評価:ベンチマークの視点sim2real2025/8/1
本論文は、汎用ロボットマニピュレーション政策のsim-to-real転送を目的としたベンチマーク設計の課題と要件を議論し、高視覚忠実度シミュレーションの活用、タスク複雑性とシナリオ摂動を段階的に増やす評価、実世界性能とシミュレーション性能の整合性の定量化を提案する。
- RoboArena:汎用ロボットポリシーの分散型実世界評価ロボット評価/ベンチマーク2025/6/1
評価者ネットワークが自由にタスクと環境を選び、ペア比較の二重盲検評価を集約することで、汎用ロボットポリシーをスケーラブルかつ公平にランキングする手法を提案し、7機関・600以上の実機評価で有効性を示した。
- RoboSpatial:ロボティクスのための2D・3D視覚言語モデルに空間理解を教えるVLA2024/11/1
ロボティクス向けの大規模空間理解データセットRoboSpatialを構築し、2D・3Dの視覚言語モデルに空間推論を学習させることで、空間アフォーダンス予測やロボット操作などのタスク性能を向上させた。
- ロボティクスにおけるニューラルフィールド:サーベイニューラルフィールド2024/10/1
ニューラルフィールドのロボティクス応用を200本以上の論文に基づき、4つの主要フレームワークと5つの応用領域(姿勢推定、マニピュレーション、ナビゲーション、物理、自動運転)に分類してレビューしたサーベイ論文。
- 実世界画像からロボットシミュレーションタスクを生成するGRSsim2real2024/10/1
単一のRGB-D画像からデジタルツインシミュレーションを構築し、仮想エージェント訓練用のタスクを自動生成するシステムを提案。
- FactorSim: 因子分解表現による生成的シミュレーションsim2real2024/9/1
自然言語入力からエージェント訓練用の完全なシミュレーションコードを生成する手法を提案し、因子分解POMDP表現で文脈依存を低減、ゼロショット転移性能で既存手法を上回ることを示した。
- 未知の関節物体のデジタルツイン構築のためのニューラル陰的表現3D再構成2024/4/1
異なる関節状態の2つのRGBDスキャンから、未知の関節物体の形状と関節モデルを再構成し、デジタルツインを構築する手法を提案。
- タッチで拓く3Dガウシアンスプラッティング:光沢面を高精度に再構成触覚2024/3/1
触覚の局所深度マップと多視点画像を組み合わせ、光沢・反射面でも少ない画像枚数で高精度に3D再構成する手法を提案。
- Diff-DOPE: Differentiable Deep Object Pose Estimation2023/10/1
- HANDAL: A Dataset of Real-World Manipulable Object Categories with Pose Annotations, Affordances, and Reconstructions2023/8/1
- BundleSDF: Neural 6-DoF Tracking and 3D Reconstruction of Unknown Objects2023/3/1
- MegaPose: 6D Pose Estimation of Novel Objects via Render & Compare2022/12/1
- One-Shot Neural Fields for 3D Object Understanding2022/10/1
- Parallel Inversion of Neural Radiance Fields for Robust Pose Estimation2022/10/1
- RGB-Only Reconstruction of Tabletop Scenes for Collision-Free Manipulator Control2022/10/1
- ProgPrompt: Generating Situated Robot Task Plans using Large Language Models2022/9/1
- Keypoint-Based Category-Level Object Pose Tracking from an RGB Sequence with Uncertainty Estimation2022/5/1
- 6-DoF Pose Estimation of Household Objects for Robotic Manipulation: An Accessible Dataset and Benchmark2022/3/1
- Single-Stage Keypoint-Based Category-Level Object Pose Estimation from an RGB Image2021/9/1
- NViSII: A Scriptable Tool for Photorealistic Image Generation2021/5/1
- Multi-View Fusion for Multi-Level Robotic Scene Understanding2021/3/1
- Hierarchical Planning for Long-Horizon Manipulation with Geometric and Symbolic Scene Graphs2020/12/1
- Fast Uncertainty Quantification for Deep Object Pose Estimation2020/11/1
- Joint Space Control via Deep Reinforcement Learning2020/11/1
- Indirect Object-to-Robot Pose Estimation from an External Monocular RGB Camera2020/8/1
- Guided Uncertainty-Aware Policy Optimization: Combining Learning and Model-Based Strategies for Sample-Efficient Policy Learning2020/5/1
- Contextual Reinforcement Learning of Visuo-tactile Multi-fingered Grasping Policies2019/11/1
- Camera-to-Robot Pose Estimation from a Single Image2019/11/1
- Toward Sim-to-Real Directional Semantic Grasping2019/9/1
- Deep Object Pose Estimation for Semantic Robotic Grasping of Household Objects2018/9/1
- Synthetically Trained Neural Networks for Learning Human-Readable Plans from Real-World Demonstrations2018/5/1