Stan Birchfield
NVIDIA
収録論文 53本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PointZero: 転移可能な3Dダイナミクス学習のための3D点追跡補完3Dダイナミクス/事前学習2026/9/16
ロボットの行動ラベルなしで、RGB-D観測と部分的な3D軌跡から全点の未来軌跡を予測する事前学習手法を提案し、下流のダイナミクス予測や模倣学習で有効性を示した。
- Hydra-0: 汎用世界モデリングと制御のためのアクションフロー世界モデル2026/8/18
ロボットの動作をピクセル運動として表現するアクションフローを用いた汎用世界モデルを提案し、動作誤差を大幅に低減し、ゼロショット合成やデータ効率的な適応を実現した。
- PROBE: VLMエージェントによる操作基盤の視覚質問応答VQA/操作計画2026/8/17
ロボットが隠れた物体を探すために操作が必要な動的シーンでの視覚質問応答(MG-VQA)を提案し、シミュレータとベンチマークを構築、VLMエージェントの性能を評価・微調整する手法を示した。
- Vesta: 汎用身体化推論モデルVLA2026/6/1
ロボットのための単一の基盤モデルで、位置推定・空間推論・ナビゲーション・長期計画を統合し、専門モデル群を上回る性能を示した。
- GraspGen-X: クロスエンボディメント6自由度拡散ベース把持把持2026/6/1
異なるグリッパー形状や物理的把持プロセスにも対応できる、拡散モデルを用いた6自由度把持生成手法を提案。スイープボリュームによるグリッパー表現と手続き的グリッパーによる大規模データセットで訓練し、未知のグリッパーへのゼロショット汎化を実現した。
- VoLo: オープン語彙の長期的操作のための物理オーケストレータ操作/VLA2026/6/1
VLMがロボットの多様な能力を中断可能なツールとして統合し、長期的な操作タスクを計画・実行・監視・回復するエージェントループを提案。高忠実度ベンチマークRoboVoLoで評価し、既存手法を上回る性能を実証。
- RoboLab: タスク汎用ポリシー解析のための高忠実度シミュレーションベンチマークベンチマーク2026/4/1
ロボット基盤モデルの真の汎化性能を評価するため、高忠実度シミュレーション環境でタスク生成と系統的解析を可能にするRoboLabフレームワークと、120タスクからなるRoboLab-120ベンチマークを提案した。
- cuRoboV2:高自由度ロボットのための深度融合距離場を用いた動力学考慮型動作生成動作生成2026/3/1
Bスプライン軌道最適化、GPUネイティブなTSDF/ESDF知覚、全身計算を統合し、高自由度ヒューマノイドでも安全で実行可能な動作生成を高速に実現するフレームワーク。
- Fast-FoundationStereo:リアルタイムゼロショットステレオマッチングステレオマッチング2025/12/1
ステレオ基盤モデルのゼロショット汎化性能を保ちつつ、知識蒸留・NAS・構造的プルーニングで高速化し、リアルタイム動作を実現した。
- SpaceTools: 二重対話型強化学習によるツール拡張空間推論VLA2025/12/1
VLMが複数の視覚ツールを強化学習で協調利用できるよう訓練する二段階フレームワークDIRLを提案し、空間推論ベンチマークで最高性能と実機マニピュレーションを実現した。
- BOP-ASK:視覚言語モデルのための物体インタラクション推論VLA2025/11/1
6D物体姿勢データを活用し、把持姿勢や経路計画などの細かい空間推論を問う15万枚・3300万QAペアの大規模データセットBOP-ASKを構築し、VLMの物体インタラクション理解を評価・訓練する。
- Sim-to-Real転送のためのロボット政策評価:ベンチマークの視点sim2real2025/8/1
本論文は、汎用ロボットマニピュレーション政策のsim-to-real転送を目的としたベンチマーク設計の課題と要件を議論し、高視覚忠実度シミュレーションの活用、タスク複雑性とシナリオ摂動を段階的に増やす評価、実世界性能とシミュレーション性能の整合性の定量化を提案する。
- GraspGen: オブジェクト把持のための拡散モデルフレームワークマニピュレーション2025/7/1
拡散モデルを用いて6自由度の把持を生成し、識別器でフィルタリングするフレームワークを提案。5300万把持のデータセットを公開し、実機でも高い性能を示した。
- OG-VLA: 正投影画像生成による3D認識型視覚言語行動モデルVLA2025/6/1
多視点RGBD観測を正投影画像に変換し、LLMと拡散モデルでエンドエフェクタの次位置・姿勢を生成する3D認識型VLAを提案。未見環境への汎化性能を大幅に向上。
- FoundationStereo: ゼロショットステレオマッチングの基盤モデルステレオ深度推定2025/1/1
大規模合成データと単眼基盤モデルの活用により、未知の環境でも高精度にステレオ深度推定を行う基盤モデルを構築した。
- RoboSpatial:ロボティクスのための2D・3D視覚言語モデルに空間理解を教えるVLA2024/11/1
ロボティクス向けの大規模空間理解データセットRoboSpatialを構築し、2D・3Dの視覚言語モデルに空間推論を学習させることで、空間アフォーダンス予測やロボット操作などのタスク性能を向上させた。
- SPOT: 物体中心操作のためのSE(3)姿勢軌道拡散模倣学習2024/11/1
物体のSE(3)姿勢軌道をタスク表現として用い、拡散ポリシーを条件付ける物体中心模倣学習フレームワークを提案。iPhoneで撮影した8つの実演のみで実世界タスクを制約遵守しつつ完遂した。
- 実世界画像からロボットシミュレーションタスクを生成するGRSsim2real2024/10/1
単一のRGB-D画像からデジタルツインシミュレーションを構築し、仮想エージェント訓練用のタスクを自動生成するシステムを提案。
- 潜在空間生成ワールドモデルによる自動運転模倣学習の共変量シフト緩和自動運転/模倣学習2024/9/1
潜在空間の生成ワールドモデルを訓練に活用し、自動運転ポリシーの共変量シフトを抑える手法を提案。マルチビュー・クロスアテンションと学習済みシーンクエリを備えたTransformer知覚エンコーダも導入し、CARLAとDRIVE Simで閉ループ性能と外乱対応の改善を示した。
- 未知の関節物体のデジタルツイン構築のためのニューラル陰的表現3D再構成2024/4/1
異なる関節状態の2つのRGBDスキャンから、未知の関節物体の形状と関節モデルを再構成し、デジタルツインを構築する手法を提案。
- DeformGS: Scene Flow in Highly Deformable Scenes for Deformable Object Manipulation2023/12/1
- FoundationPose: Unified 6D Pose Estimation and Tracking of Novel Objects2023/12/1
- Diff-DOPE: Differentiable Deep Object Pose Estimation2023/10/1
- HANDAL: A Dataset of Real-World Manipulable Object Categories with Pose Annotations, Affordances, and Reconstructions2023/8/1
- Affordance Diffusion: Synthesizing Hand-Object Interactions2023/3/1
- BundleSDF: Neural 6-DoF Tracking and 3D Reconstruction of Unknown Objects2023/3/1
- MegaPose: 6D Pose Estimation of Novel Objects via Render & Compare2022/12/1
- One-Shot Neural Fields for 3D Object Understanding2022/10/1
- Parallel Inversion of Neural Radiance Fields for Robust Pose Estimation2022/10/1
- RGB-Only Reconstruction of Tabletop Scenes for Collision-Free Manipulator Control2022/10/1
- Keypoint-Based Category-Level Object Pose Tracking from an RGB Sequence with Uncertainty Estimation2022/5/1
- 6-DoF Pose Estimation of Household Objects for Robotic Manipulation: An Accessible Dataset and Benchmark2022/3/1
- Single-Stage Keypoint-Based Category-Level Object Pose Estimation from an RGB Image2021/9/1
- PredictionNet: Real-Time Joint Probabilistic Traffic Prediction for Planning, Control, and Simulation2021/9/1
- NViSII: A Scriptable Tool for Photorealistic Image Generation2021/5/1
- Multi-View Fusion for Multi-Level Robotic Scene Understanding2021/3/1
- Hierarchical Planning for Long-Horizon Manipulation with Geometric and Symbolic Scene Graphs2020/12/1
- Fast Uncertainty Quantification for Deep Object Pose Estimation2020/11/1
- Joint Space Control via Deep Reinforcement Learning2020/11/1
- Indirect Object-to-Robot Pose Estimation from an External Monocular RGB Camera2020/8/1
- RMPflow: A Geometric Framework for Generation of Multi-Task Motion Policies2020/7/1
- MVLidarNet: Real-Time Multi-Class Scene Understanding for Autonomous Driving Using Multiple Views2020/6/1
- Contextual Reinforcement Learning of Visuo-tactile Multi-fingered Grasping Policies2019/11/1
- Camera-to-Robot Pose Estimation from a Single Image2019/11/1
- DexPilot: Vision Based Teleoperation of Dexterous Robotic Hand-Arm System2019/10/1
- Toward Sim-to-Real Directional Semantic Grasping2019/9/1
- RMPflow: A Computational Graph for Automatic Motion Policy Generation2018/11/1
- Robust Learning of Tactile Force Estimation through Robot Interaction2018/10/1
- Deep Object Pose Estimation for Semantic Robotic Grasping of Household Objects2018/9/1
- Synthetically Trained Neural Networks for Learning Human-Readable Plans from Real-World Demonstrations2018/5/1
- Riemannian Motion Policies2018/1/1
- An Energy Minimization Approach to 3D Non-Rigid Deformable Surface Estimation Using RGBD Data2017/8/1
- Toward Low-Flying Autonomous MAV Trail Navigation using Deep Neural Networks for Environmental Awareness2017/5/1