Haoyi Zhu
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 光の相互作用:インタラクティブビデオワールドモデルのための学習不要推論高速化推論高速化2026/5/29
インタラクティブなビデオワールドモデルの推論を高速化する、学習不要のフレームワークを提案。適応的なコンテキスト管理とキャッシュ、スパースアテンションにより最大2.59倍の高速化を実現。
- GAE:VLMの物理的ポテンシャルを引き出す汎用アクションエキスパートVLA2025/10/1
VLMが予測した疎な3Dウェイポイントを、汎用アクションエキスパートが密なロボット動作に変換する手法を提案。大規模点群-軌道データで事前学習し、下流タスクへの汎化性能を実現した。
- プリミティブ身体性ワールドモデルの学習:スケーラブルなロボット学習に向けてワールドモデル2025/8/1
動画生成ベースの身体性ワールドモデルを固定短時間のプリミティブ動作に限定し、言語と動作の細粒度対応・データ効率・推論速度を改善するPEWMを提案。VLMプランナとヒートマップ誘導で閉ループ制御と長期タスクへの組合せ汎化を実現する。
- VQ-VLA:ベクトル量子化アクショントークナイザのスケーリングによる視覚-言語-行動モデルの改善VLA2025/7/1
大規模な行動軌跡データセットで学習したベクトル量子化アクショントークナイザを提案し、ゼロショットで多様なロボットタスクに適応可能で、長期的タスクの成功率を最大30%向上させた。
- CoMo: インターネット動画から連続潜在運動を学習するスケーラブルなロボット学習VLA2025/5/1
インターネット動画から連続的な潜在運動表現を教師なしで学習し、未知動画へのゼロショット汎化と擬似行動ラベル生成を可能にする手法CoMoを提案。
- Aether: 幾何学認識を統合した統一的世界モデリング世界モデル2025/3/1
4D動的再構成・行動条件付き動画予測・目標条件付き視覚計画を同時に学習する世界モデルを提案し、実世界データなしでもゼロショットで汎化できることを示した。
- Tra-MoE: 複数ドメインからの軌道予測モデル学習による適応的ポリシー条件付けVLA2024/11/1
スパースMoEアーキテクチャで任意点軌道を予測し、適応的ポリシー条件付けでロボット制御を改善する手法を提案。
- SPA: 3D空間認識による効果的な身体性表現学習身体性表現学習2024/10/1
多視点画像への微分可能レンダリングでViTに3D空間理解を持たせ、8シミュレータ268タスクで既存手法を上回る身体性表現学習フレームワークを提案。
- 点群が鍵:ロボット学習における観測空間の影響の再考マニピュレーション2024/2/1
RGB・RGB-D・点群という3つの観測モダリティがロボット学習に与える影響を、2つのシミュレータと125タスクからなるベンチマークOBSBenchで比較し、点群ベースの手法が接触の多い操作タスクで優れた性能と汎化を示すことを明らかにした。
- RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot2023/7/1