Hongxu Yin
NVIDIA
収録論文 7本 ・ フィジカルAI/ロボット学習
マニピュレーションナビゲーションVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Recova: 自律ロボットマニピュレーションのためのエージェント誘導型失敗回復マニピュレーション2026/10/1
デジタルツイン上でエージェントが失敗を診断し回復行動を学習、実機での検証と人間デモを組み合わせて回復能力を拡張する枠組みを提案し、成功率と人間介入の削減を実証した。
- ASENA: 自己進化型エージェントによる身体性ナビゲーションナビゲーション2026/9/30
コーディングエージェントがプログラムを書いて実行・修正・経験を蓄積しながらロボットをナビゲーションさせるシステムを提案し、4Bの単眼ナビゲーション方策と組み合わせてR2RやRxRで高性能を達成した。
- Vesta: 汎用身体化推論モデルVLA2026/6/1
ロボットのための単一の基盤モデルで、位置推定・空間推論・ナビゲーション・長期計画を統合し、専門モデル群を上回る性能を示した。
- トレース条件付きVLA計画による長期的操作マニピュレーション2026/4/1
長期的な操作タスクを、タスク管理VLMが現在の観察から残りの計画を予測し、視覚的トレースを実行VLAに提供することで、短期的なVLA実行を長期的な指示追従に拡張するフレームワークを提案。
- EgoVLA:自己中心視点の人間動画から視覚-言語-行動モデルを学習VLA2025/7/1
一人称視点の人間動画でVLAモデルを訓練し、逆運動学とリターゲティングで人間の手の動きをロボット動作に変換、少数のロボット実演で微調整してロボットポリシーを獲得する手法を提案。
- NaVILA: 脚式ロボットのための視覚-言語-行動モデルによるナビゲーションVLA2024/12/1
脚式ロボットの視覚言語ナビゲーションにおいて、VLAモデルで「75cm前進」のような中間行動を生成し、それを強化学習による歩行ポリシーで実行する2階層フレームワークを提案した論文。
- Eagle:複数の視覚エンコーダを組み合わせたマルチモーダルLLMの設計空間の探求VLA2024/8/1
複数の視覚エンコーダを組み合わせる際の設計選択を体系的に比較し、視覚トークンを単純に連結する手法が有効であることを示した上で、Pre-Alignmentを導入したEagleモデルを提案した論文。