Yihan Wang
収録論文 5本 ・ フィジカルAI/ロボット学習
ナビゲーション操作ビデオ生成/身体性転写VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ロボストラル・ナビゲート:単眼RGBのみで動作するスケーラブルな視覚言語ナビゲーションモデルナビゲーション2026/7/1
単眼RGB画像のみを入力とし、画像空間上でウェイポイントを予測することで、様々なロボット形態に再較正なしで適用可能な8B視覚言語モデルを提案。大規模シミュレーションデータと効率的な学習手法により、実世界データへの依存を低減しつつ高性能を実現した。
- SWEET: 画像編集によるスパースな世界モデリングを用いた身体性タスク実行操作2026/5/19
ロボット操作タスクにおいて、密なビデオ生成の代わりに画像編集モデルを用いてタスク関連のキーフレームを予測するスパースな視覚世界モデルを提案し、計算コストを削減しつつタスク実行を可能にした。
- OmniHumanoid: ペアデータ不要の適応によるストリーミング型クロス身体性ビデオ生成ビデオ生成/身体性転写2026/5/12
異なる身体性(人間やロボット)間で動作を転写するビデオ生成フレームワークを提案。共有動作モデルと軽量な身体性アダプタにより、ペアデータなしで新しいロボットへの適応を可能にした。
- NavSpace:ナビゲーションエージェントの空間知能指示追従ベンチマークナビゲーション2025/10/1
ナビゲーションエージェントの空間知能を評価する6カテゴリ・1228ペアのベンチマークNavSpaceを提案し、22モデルを評価するとともに、新モデルSNavを提案して実機でも優位性を示した。
- LoHoVLA:長期的な身体タスクのための統合視覚言語行動モデルVLA2025/6/1
大規模視覚言語モデルを基盤に、言語と行動トークンを統合生成し、階層的閉ループ制御で長期的身体タスクを遂行するVLAフレームワークを提案。