Zhiyuan Feng
収録論文 5本 ・ フィジカルAI/ロボット学習
VLA/サーベイVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 人間のビデオからロボット操作へ:人間中心データを用いたスケーラブルな視覚言語行動学習に関するサーベイVLA/サーベイ2026/6/1
ロボットのデモデータに頼らず、豊富な人間のビデオをVLAモデルの学習に活用する手法を4つのカテゴリに分類して整理し、未解決の課題と今後の研究方向を提示したサーベイ論文。
- HiMoE-VLA:汎用視覚言語行動ポリシーのための階層的Mixture-of-ExpertsVLA2025/12/1
異なるロボットの実演データを混ぜて学習する際の負の転移を防ぐため、行動空間ごとに特化する階層的MoE行動モジュールを提案し、CALVINやLIBERO、実機タスクで高い性能を達成した。
- 発見・学習・強化:多様なRL生成軌道による視覚-言語-行動事前学習のスケーリングVLA2025/11/1
強化学習で多様な行動パターンを発見し、VLAモデルの事前学習用データを自動生成するフレームワークDLRを提案。標準RLより多様で高成功率の軌道を生成し、下流タスク性能とデータスケーリングを改善する。
- 実生活の人間活動動画を用いたロボットマニピュレーション向け視覚-言語-行動モデルのスケーラブル事前学習VLA2025/10/1
人間の手の日常動画を自動解析してロボットのVLA学習データに変換し、100万エピソード規模のデータセットでモデルを事前学習することで、未知環境でのゼロショット性能と実機微調整時の成功率・汎化性能を向上させた。
- 人間のデモを超えて:VLA学習用データを生成する拡散ベース強化学習VLA2025/9/1
拡散モデルを用いた強化学習で高品質・低分散な軌道を生成し、人間のデモなしでVLAモデルを学習させる手法を提案。LIBEROベンチマークで人間データやガウスRLより高い成功率を達成。