Zhiding Yu
NVIDIA
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Recova: 自律ロボットマニピュレーションのためのエージェント誘導型失敗回復マニピュレーション2026/10/1
デジタルツイン上でエージェントが失敗を診断し回復行動を学習、実機での検証と人間デモを組み合わせて回復能力を拡張する枠組みを提案し、成功率と人間介入の削減を実証した。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- Vesta: 汎用身体化推論モデルVLA2026/6/1
ロボットのための単一の基盤モデルで、位置推定・空間推論・ナビゲーション・長期計画を統合し、専門モデル群を上回る性能を示した。
- LocateAnything: 並列ボックスデコードによる高速・高品質な視覚言語グラウンディングVLA2026/5/1
視覚言語モデルによる物体検出・グラウンディングを、ボックス座標を並列に一度でデコードする方式に変え、推論速度と精度を両立させた。
- Fast-ThinkAct: 言語化可能な潜在プランニングによる効率的な視覚-言語-行動推論VLA2026/1/1
推論トレースを潜在的な思考連鎖に蒸留し、推論VLAの推論遅延を最大89.3%削減しつつ長期的プランニングや適応性能を維持する手法を提案。
- GR00T N1: 汎用人型ロボットのためのオープン基盤モデルVLA2025/3/1
視覚言語モジュールと拡散トランスフォーマを組み合わせた二重システム構成のVLA基盤モデルを提案し、実機・人間動画・合成データで学習して人型ロボットの両手マニピュレーションを実現した。
- 衝突シナリオ統合による自動運転の安全性向上自動運転2025/3/1
衝突データから安全志向の指標を用いて学習するSafeFusionと、言語プロンプトで衝突シナリオを生成するCollisionGenを提案し、衝突リスクの高い場面での計画性能を56%改善した。
- Centaur: テスト時訓練による堅牢なエンドツーエンド自動運転自動運転2025/3/1
テスト時訓練でプランナーの不確実性を最小化し、手設計のルールやコスト関数に頼らずに自動運転の安全性を向上させる手法を提案。
- Hydra-NeXt: 開ループ学習による堅牢な閉ループ自動運転自動運転2025/3/1
軌道予測・制御予測・軌道精緻化を1つのモデルに統合したマルチブランチ計画フレームワークを提案し、開ループ学習と閉ループ運転のギャップを埋めてBench2Driveで大幅な性能向上を達成した。
- Eagle:複数の視覚エンコーダを組み合わせたマルチモーダルLLMの設計空間の探求VLA2024/8/1
複数の視覚エンコーダを組み合わせる際の設計選択を体系的に比較し、視覚トークンを単純に連結する手法が有効であることを示した上で、Pre-Alignmentを導入したEagleモデルを提案した論文。
- 重要なものだけを記憶する:多重走行からの創発的シーン分解3Dマッピング2024/5/1
同じ領域を複数回走行したRGB動画から、自己教師ありで環境と一時的物体を分離し、3Dガウシアンマップを構築する手法を提案。
- FB-OCC: 3D Occupancy Prediction based on Forward-Backward View Transformation2023/7/1
- VoxFormer: Sparse Voxel Transformer for Camera-based 3D Semantic Scene Completion2023/2/1
- SECANT: Self-Expert Cloning for Zero-Shot Generalization of Visual Policies2021/6/1
- Automated Synthetic-to-Real Generalization2020/7/1
- Confidence Regularized Self-Training2019/8/1
- Simultaneous Edge Alignment and Learning2018/8/1
- Structured Hough Voting for Vision-based Highway Border Detection2014/11/1