Hongyu Li
NVIDIA
収録論文 15本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Hydra-0: 汎用世界モデリングと制御のためのアクションフロー世界モデル2026/8/18
ロボットの動作をピクセル運動として表現するアクションフローを用いた汎用世界モデルを提案し、動作誤差を大幅に低減し、ゼロショット合成やデータ効率的な適応を実現した。
- Deform360: 変形可能な世界モデルのための大規模マルチビュー視触覚データセットデータセット/世界モデル2026/7/1
変形物体の動力学予測(世界モデリング)の研究を促進するため、198個の日用品、1,980のインタラクションシーケンス、215時間以上の観測データを含む大規模な視触覚データセットを構築し、2Dビデオモデルと3Dパーティクルモデルの性能を体系的に評価した。
- NovaPlan: 閉ループ動画言語計画によるゼロショット長期的マニピュレーションマニピュレーション2026/2/1
VLMと動画生成を組み合わせ、生成動画から物体キーポイントと人間の手の姿勢を抽出してロボット動作に変換する階層的フレームワークを提案。訓練や実演なしで長期的な組立作業やエラー回復を実現した。
- 指示からイベントへ:音トリガー型モバイルマニピュレーションモバイルマニピュレーション2026/1/1
音を発する物体を自律的に検知・操作する「音トリガー型モバイルマニピュレーション」を提案し、音響レンダリングと物理操作を統合したデータ基盤Habitat-Echoとベースライン手法を開発した。
- NovaFlow: 生成動画からの実行可能フローによるゼロショットマニピュレーションマニピュレーション2025/10/1
タスク記述から動画を生成し、それを3Dの物体フローに変換してロボットの動作計画を立てることで、実演なしで新しい操作タスクをゼロショット実行するフレームワーク。
- UniTac:触覚センサなしで実現する全身接触センシング触覚2025/7/1
関節センサのみを用いたデータ駆動型の全身接触位置推定手法を提案し、FrankaアームとSpot四足歩行ロボットで有効性を検証した。
- ViTa-Zero: ゼロショット視触覚物体6D姿勢推定視触覚2025/4/1
視覚モデルを土台に、触覚と固有感覚から得た物理制約でテスト時最適化を行い、学習データなしで物体の6D姿勢を推定するフレームワーク。
- V-HOP: 視覚触覚融合による6D物体姿勢追跡視覚触覚融合2025/2/1
視覚と触覚を統合したトランスフォーマーにより、多様なグリッパやセンサに対応する6D物体姿勢追跡手法を提案し、実世界で視覚のみの手法を大きく上回る性能を実現した。
- HyperTaxel: 対照学習による触覚センサ信号のハイパー解像度化触覚2024/8/1
疎な低解像度の触覚センサ信号を対照学習で高解像度の接触面にマッピングし、接触面の形状特徴を捉える表現を学習するフレームワークを提案した。
- ODTFormer: Transformerによるステレオカメラでの効率的な障害物検出と追跡障害物検出・追跡2024/3/1
ステレオカメラ画像からTransformerで3Dボクセル占有グリッドを構築し、フレーム間でボクセルを対応付けることで障害物の検出と追跡を高効率に行うモデルを提案した。
- StereoNavNet: ステレオカメラと補助占有ボクセルを用いたナビゲーション学習ナビゲーション2024/3/1
ステレオRGB画像から3D占有ボクセルを推定し、その幾何特徴と目標を政策モジュールで用いてナビゲーション行動を予測するモジュール型学習手法を提案。未見環境でも高い汎化性能を示す。
- E(2)-Equivariant Graph Planning for Navigation2023/9/1
- ViHOPE: Visuotactile In-Hand Object 6D Pose Estimation with Shape Completion2023/9/1
- StereoVoxelNet: Real-Time Obstacle Detection Based on Occupancy Voxels from a Stereo Camera Using Deep Neural Networks2022/9/1
- Deep Reinforcement Learning based Robot Navigation in Dynamic Environments using Occupancy Values of Motion Primitives2022/8/1