Yanjia Huang
収録論文 8本 ・ フィジカルAI/ロボット学習
sim2realデータエンジン/操作学習3Dアセット生成VLAマニピュレーションナビゲーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- BladeMaster: オンライン生成される永続的不連続性を用いたリアルタイムロボット切断シミュレーションsim2real2026/9/23
GPU加速されたTLMPMベースの切断シミュレータで、刃の形状からオンラインで生成される永続的なサイドラベルにより、切断履歴を物質点に直接エンコードし、工具引き抜き後も切断面の不連続性を保持しつつ、リアルタイムを超える速度で切断と操作を実現する。
- AXIS:拡張可能なロボット操作のためのコミュニティ駆動型データエンジンデータエンジン/操作学習2026/7/1
ブラウザベースの遠隔操作で大規模なデモ収集を可能にし、タスクの自動生成・検証とデータ品質向上を組み合わせた、拡張可能なロボット操作学習用データエンジンとベンチマークを提案。
- Fishbone: 1つの3Dアセットから100万通りの制御可能な編集へ3Dアセット生成2026/5/24
3Dメッシュの形状変形を制御するための統一的なリブ・スパイン表現を提案し、リアルタイムで予測可能な変形やアニメーションを可能にする。
- VISTAv2: 屋内視覚言語ナビゲーションのための世界想像モデルVLA2025/12/1
過去の観測・行動候補・指示から未来の視点を生成し、オンライン価値マップとして計画に融合する世界モデルを提案。MP3DとRoboTHORで性能向上を実証。
- FORGE-Tree: 拡散強制と木探索による長期的ロボットマニピュレーションマニピュレーション2025/10/1
凍結したVLAエンコーダに拡散強制ヘッドとモンテカルロ木拡散を組み合わせ、軌道を局所的に修正しながら長期的な操作タスクの成功率を向上させる制御層を提案。
- VISTA: 視覚と言語によるナビゲーションのための生成的視覚想像VLA2025/5/1
拡散モデルを用いて言語指示に基づく未来の視覚イメージを生成し、現在の観測と整合させながら行動を決定するVLNフレームワークを提案。R2RとRoboTHORで最高性能を達成。
- PANDORA: 拡散ポリシー学習による器用なロボットピアノ演奏マニピュレーション2025/3/1
拡散モデルベースのポリシー学習とLLMによる音楽表現評価を組み合わせ、ロボットが精密かつ表現豊かにピアノを演奏できるフレームワークを提案した。
- 視覚言語モデルと思考の木推論によるゼロショット物体ナビゲーションナビゲーション2024/10/1
視覚言語モデルとTree-of-Thought推論を組み合わせ、未知環境で自然言語指示に従って物体を探索するゼロショット物体ナビゲーション手法VLTNetを提案した論文。