Yucheng Hu
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Embodied-R1.5:身体化基盤モデルによる物理的知能の進化身体化基盤モデル2026/6/1
身体化された認知・計画・修正・指示を統合した基盤モデルを構築し、大規模データとマルチタスク強化学習で身体化VLMのSOTAを達成。さらに少量データでVLAに転移可能なことを示した。
- UAM: VLA訓練における忘却問題への二経路視点からのアプローチVLA2026/5/15
VLAモデルがVLMのマルチモーダル能力を失う「身体化税」問題を、生物学的視覚の二経路構造に着想を得て、並列な背側経路(Dorsal Expert)を追加するUAMを提案し、忘却を抑えつつ操作性能を向上させた。
- Veo-Act: 最先端ビデオモデルはどこまで汎用ロボット操作を前進させられるか?操作2026/4/1
ビデオ生成モデルVeo-3を高次プランナーとして使い、低次実行にはVLAポリシーを用いる階層的フレームワークVeo-Actを提案し、操作性能を向上させた。
- Realtime-VLA V2: VLAを高速・滑らか・正確に実行する学習VLA/制御2026/3/1
VLAモデルを実ロボットに高速展開するための実践的技術群を提案し、軽量アームで人間並みの速度と精度を実現した。
- BagelVLA: 視覚・言語・行動の交互生成による長期的マニピュレーションの強化VLA2026/2/1
言語計画と視覚予測を行動生成ループに交互に組み込み、長期的なロボット操作タスクの性能を高める統合モデルを提案した。
- UniJEPA:連続・離散表現の統合学習によるロボットポリシーの強化VLA2025/10/1
100万件超の操作動画で視覚表現を事前学習し、ロボット実機データで微調整することで、予測表現から行動トークンへのマッピングを学習する汎用ロボットポリシー手法を提案。
- Robix: ロボットの対話・推論・計画を統合する統一モデルVLA2025/9/1
視覚言語モデル1つでロボットの高レベル推論・タスク計画・自然言語対話を担い、低レベル制御への指令生成と人間との対話を統合的に実現するモデルを提案。
- オンライン強化学習による視覚言語行動モデルの改善VLA2025/1/1
大規模視覚言語行動モデルをオンライン強化学習で改善する際の不安定性と計算負荷に対処するため、強化学習と教師あり学習を交互に繰り返すiRe-VLAフレームワークを提案し、シミュレーションと実機で有効性を検証した。
- 動画予測ポリシー:予測的視覚表現を持つ汎用ロボットポリシーVLA2024/12/1
動画拡散モデルが持つ未来予測的な視覚表現を活用し、ロボット操作のための汎用ポリシーを学習する手法を提案。Calvinベンチマークと実世界の巧緻操作で大幅な性能向上を達成した。
- 行動予測と画像予測の統合拡散過程による視覚ポリシー学習VLA2024/11/1
画像予測とロボット行動生成を同一の拡散過程で統合し、将来画像と行動を同時に予測する視覚ポリシー学習フレームワークPADを提案。Metaworldベンチマークで26.3%の相対改善を達成。
- HiRT: 階層型ロボットトランスフォーマーによるロボット制御の強化VLA2024/10/1
大規模VLAモデルの計算コストと遅延を抑えるため、低頻度のVLMと高頻度の視覚ポリシーを組み合わせた階層型トランスフォーマーを提案し、動的タスクの成功率を向上させた。