Yichao Shen
収録論文 3本 ・ フィジカルAI/ロボット学習
VLA/サーベイVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 人間のビデオからロボット操作へ:人間中心データを用いたスケーラブルな視覚言語行動学習に関するサーベイVLA/サーベイ2026/6/1
ロボットのデモデータに頼らず、豊富な人間のビデオをVLAモデルの学習に活用する手法を4つのカテゴリに分類して整理し、未解決の課題と今後の研究方向を提示したサーベイ論文。
- HiMoE-VLA:汎用視覚言語行動ポリシーのための階層的Mixture-of-ExpertsVLA2025/12/1
異なるロボットの実演データを混ぜて学習する際の負の転移を防ぐため、行動空間ごとに特化する階層的MoE行動モジュールを提案し、CALVINやLIBERO、実機タスクで高い性能を達成した。
- VideoVLA:動画生成モデルを汎用ロボットマニピュレータに転換VLA2025/12/1
大規模動画生成モデルをロボットの視覚-言語-行動モデルに転換し、言語指示と画像から行動列と将来の視覚結果を同時予測することで、新規物体や他機体スキルへの汎化を実現した。