Bei Liu
収録論文 7本 ・ フィジカルAI/ロボット学習
VLA/計画VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- トークン予測は計画ではない:物理に基づく因果推論エージェントの構築VLA/計画2026/6/1
身体性を持つ視覚言語計画の評価では、言語的な次トークン予測が重視されがちですが、本研究では物理的な因果推論を促すベンチマークと大規模データセットを構築し、因果推論を学習したモデルが計画性能を向上させることを示しました。
- HiMoE-VLA:汎用視覚言語行動ポリシーのための階層的Mixture-of-ExpertsVLA2025/12/1
異なるロボットの実演データを混ぜて学習する際の負の転移を防ぐため、行動空間ごとに特化する階層的MoE行動モジュールを提案し、CALVINやLIBERO、実機タスクで高い性能を達成した。
- CogACT: 認知と行動を融合するロボット操作のための基盤的視覚-言語-行動モデルVLA2024/11/1
VLMの出力を条件とする専用の拡散行動トランスフォーマーを組み込んだ新しいVLAアーキテクチャを提案し、ロボット操作の成功率と汎化性能を大幅に向上させた。
- RoLD: マルチタスク方策モデリングのためのロボット潜在拡散モデルVLA2024/3/1
ロボットの行動軌跡を潜在空間にエンコードし、その空間上で拡散モデルを学習することで、言語指示付きマルチタスク操作の方策を効率的に生成する手法を提案した。
- ロボット運動制御のための時空間予測事前学習VLA2024/3/1
大規模動画を用い、マスクされた現在フレームの空間予測と未来フレームを条件とした時間予測を二重デコーダで同時に行うことで、運動情報を捉えるロボット運動制御向け視覚事前学習フレームワークSTPを提案した。
- Transferring Foundation Models for Generalizable Robotic Manipulation2023/6/1
- AlphaBlock: Embodied Finetuning for Vision-Language Reasoning in Robot Manipulation2023/5/1