Jan Kautz
NVIDIA
収録論文 32本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Recova: 自律ロボットマニピュレーションのためのエージェント誘導型失敗回復マニピュレーション2026/10/1
デジタルツイン上でエージェントが失敗を診断し回復行動を学習、実機での検証と人間デモを組み合わせて回復能力を拡張する枠組みを提案し、成功率と人間介入の削減を実証した。
- ASENA: 自己進化型エージェントによる身体性ナビゲーションナビゲーション2026/9/30
コーディングエージェントがプログラムを書いて実行・修正・経験を蓄積しながらロボットをナビゲーションさせるシステムを提案し、4Bの単眼ナビゲーション方策と組み合わせてR2RやRxRで高性能を達成した。
- S4VY: フィードフォワード4D視覚幾何におけるセグメントエニシング4Dセグメンテーション2026/9/29
RGB観測からフィードフォワードな4D視覚幾何特徴を抽出し、時空間クエリデコーダで永続的な4Dインスタンスマスクを生成するセグメンテーションモデルを提案。言語指示に基づく4Dグラウンディングも可能。
- GRAIL: 3Dアセットとビデオ事前知識から人型ロコ操作を生成ロコ操作2026/6/1
物理環境や遠隔操作を必要とせず、3Dアセットとビデオ基盤モデルの事前知識を用いて、人型ロボットの全身操作デモを仮想的に生成するパイプラインを提案した。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- Vesta: 汎用身体化推論モデルVLA2026/6/1
ロボットのための単一の基盤モデルで、位置推定・空間推論・ナビゲーション・長期計画を統合し、専門モデル群を上回る性能を示した。
- LocateAnything: 並列ボックスデコードによる高速・高品質な視覚言語グラウンディングVLA2026/5/1
視覚言語モデルによる物体検出・グラウンディングを、ボックス座標を並列に一度でデコードする方式に変え、推論速度と精度を両立させた。
- SpaCeFormer: 提案不要の高速オープンボキャブラリ3Dインスタンス分割3Dインスタンス分割2026/4/1
3Dシーンを空間曲線トランスフォーマーで直接インスタンス分割する提案不要の手法を開発し、従来より2〜3桁高速化。大規模データセットも構築した。
- Kimodo: 制御可能な人間動作生成のスケーリング動作生成2026/3/1
700時間の光学モーションキャプチャデータで訓練した、テキストやキネマティック制約で制御可能な高品質な人間動作生成モデルを提案した論文。
- 世界行動モデルはゼロショット方策であるVLA2026/2/1
動画拡散モデルを基盤に未来の世界状態と行動を予測するWorld Action Model「DreamZero」を提案し、実機でVLAを上回る汎化性能と7Hzのリアルタイム閉ループ制御を実現した。
- Fast-ThinkAct: 言語化可能な潜在プランニングによる効率的な視覚-言語-行動推論VLA2026/1/1
推論トレースを潜在的な思考連鎖に蒸留し、推論VLAの推論遅延を最大89.3%削減しつつ長期的プランニングや適応性能を維持する手法を提案。
- 物理AIのための動画基盤モデルによる世界シミュレーション世界モデル2025/11/1
テキスト・画像・動画から世界を生成する動画基盤モデルCosmos-Predict2.5と、Sim2Real/Real2Real変換を行うCosmos-Transfer2.5を発表し、ロボティクス向けの合成データ生成やシミュレーションを可能にした。
- SONIC: 自然なヒューマノイド全身制御のための運動追跡の超大規模化ヒューマノイド制御2025/11/1
運動追跡をスケーラブルなタスクと位置づけ、モデル容量・データ・計算量を大規模化することで、自然で堅牢な全身運動が可能な汎用ヒューマノイド制御器を構築した研究。
- GENMO: 人間の動作のための汎用モデル動作生成・推定2025/5/1
動作生成と動作推定を単一の枠組みに統合した汎用モデルGENMOを提案。動作推定を制約付き動作生成として再定式化し、回帰と拡散の相乗効果で高精度な推定と多様な生成を両立する。
- 自律型電動キックボードのための経路追従モデル予測制御経路追従/MPC2025/5/1
電動キックボードの自律走行を実現するため、Raspberry Pi 5上で動作する経路追従モデル予測制御を開発し、実機実験で有効性を示した。
- FLARE: 暗黙的世界モデリングによるロボット学習VLA2025/5/1
将来の観測の潜在表現を予測する世界モデリングを拡散トランスフォーマーポリシーに組み込み、模倣学習の性能と汎化を大幅に向上させた手法。
- DreamGen:動画世界モデルでロボット学習の汎化を解き放つVLA2025/5/1
画像から動画を生成するモデルでロボットの疑似行動データを作り、1つのテレオペデータから多様な行動・環境への汎化を実現する4段階パイプラインを提案。
- GR00T N1: 汎用人型ロボットのためのオープン基盤モデルVLA2025/3/1
視覚言語モジュールと拡散トランスフォーマを組み合わせた二重システム構成のVLA基盤モデルを提案し、実機・人間動画・合成データで学習して人型ロボットの両手マニピュレーションを実現した。
- FoundationStereo: ゼロショットステレオマッチングの基盤モデルステレオ深度推定2025/1/1
大規模合成データと単眼基盤モデルの活用により、未知の環境でも高精度にステレオ深度推定を行う基盤モデルを構築した。
- NaVILA: 脚式ロボットのための視覚-言語-行動モデルによるナビゲーションVLA2024/12/1
脚式ロボットの視覚言語ナビゲーションにおいて、VLAモデルで「75cm前進」のような中間行動を生成し、それを強化学習による歩行ポリシーで実行する2階層フレームワークを提案した論文。
- HOVER: ヒューマノイドのための汎用全身制御ニューラルコントローラヒューマノイド全身制御2024/10/1
全身の運動模倣を共通の抽象表現として活用し、ナビゲーションや卓上操作など複数の制御モードを単一の方策に蒸留統合したヒューマノイド全身コントローラを提案した。
- Eagle:複数の視覚エンコーダを組み合わせたマルチモーダルLLMの設計空間の探求VLA2024/8/1
複数の視覚エンコーダを組み合わせる際の設計選択を体系的に比較し、視覚トークンを単純に連結する手法が有効であることを示した上で、Pre-Alignmentを導入したEagleモデルを提案した論文。
- FoundationPose: Unified 6D Pose Estimation and Tracking of Novel Objects2023/12/1
- FB-OCC: 3D Occupancy Prediction based on Forward-Backward View Transformation2023/7/1
- BundleSDF: Neural 6-DoF Tracking and 3D Reconstruction of Unknown Objects2023/3/1
- GLAMR: Global Occlusion-Aware Human Mesh Recovery with Dynamic Cameras2021/12/1
- Binary TTC: A Temporal Geofence for Autonomous Navigation2021/1/1
- Bi3D: Stereo Depth Estimation via Binary Classifications2020/5/1
- How to Close Sim-Real Gap? Transfer with Segmentation!2020/5/1
- Simultaneous Edge Alignment and Learning2018/8/1
- Synthetically Trained Neural Networks for Learning Human-Readable Plans from Real-World Demonstrations2018/5/1
- Sim-to-Real Transfer of Accurate Grasping with Eye-In-Hand Observations and Continuous Control2017/12/1