Han Hu
収録論文 8本 ・ フィジカルAI/ロボット学習
GUIエージェントVLA身体化基盤モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HyMobileAgent: データと環境の共スケーリングによる高効率GUIエージェントGUIエージェント2026/7/16
モバイルGUIエージェントの性能を、モデル規模だけでなくデータと環境の両方をスケールさせる枠組みで向上させた。合成データ生成、知識パイプライン、大規模アクションデータ、リセット可能な訓練環境、計画・反省機構を統合している。
- Hy-Embodied-VLM-1.0:効率的な物理世界エージェントVLA2026/7/14
物理世界で動作する組み込みエージェント向けの基盤モデルを提案し、行動中心の能力分類に基づくデータパイプラインと効率的なMoEアーキテクチャにより、38ベンチマークで優れた性能を達成した。
- RxBrain:言語と視覚の推論・想像を統合した身体化認知基盤モデルVLA2026/7/1
身体化認知のための基盤モデルRxBrainを提案。言語による計画構造と視覚による世界状態予測を統合し、単一の計画シーケンスで表現する。
- Hy-Embodied-0.5-VLA:視覚言語行動モデルから実世界ロボット学習スタックへVLA2026/6/1
データ収集からモデル設計、事前学習、微調整、強化学習、実機展開までを含むロボット学習の全スタックを備えたエンドツーエンドシステムを提案した論文。
- Embodied-R1.5:身体化基盤モデルによる物理的知能の進化身体化基盤モデル2026/6/1
身体化された認知・計画・修正・指示を統合した基盤モデルを構築し、大規模データとマルチタスク強化学習で身体化VLMのSOTAを達成。さらに少量データでVLAに転移可能なことを示した。
- GEM: 生成的監視が身体化知能を強化するVLA2026/5/27
視覚言語モデルの事前学習に深度マップ生成タスクを統合し、身体化環境での空間・物理理解を向上させるGEMを提案。大規模データセットGEM-4Mを公開し、シミュレーションと実世界で高い性能を実証した。
- HY-Embodied-0.5: 実世界エージェントのための具現化基盤モデルVLA2026/4/8
実世界の具現化エージェント向けに設計された基盤モデル群を提案し、空間・時間的視覚知覚と推論能力を強化した。
- Spatial Constraint Generation for Motion Planning in Dynamic Environments2021/10/1