Shaofei Cai
収録論文 5本 ・ フィジカルAI/ロボット学習
VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 視覚-言語-行動モデルサーベイ:行動トークン化の観点からVLA2025/7/1
視覚と言語の入力を行動トークンに変換して実行するVLAモデルを、行動トークンの種類(言語記述・コード・アフォーダンス・軌道など)で分類し、各手法の長所と課題を整理したサーベイ。
- 視覚運動エージェントの汎化可能な空間知能のためのスケーラブルなマルチタスク強化学習VLA2025/7/1
Minecraft環境で大規模マルチタスク強化学習を行い、視覚運動エージェントが未見の世界や実世界設定へゼロショット汎化できることを示した。
- ROCKET-2: クロスビュー目標整合による視覚運動ポリシーの操作VLA2025/3/1
ユーザーのカメラ視点からセグメンテーションマスクで目標を指定し、エージェントの視点と整合させることで、Minecraftで訓練したエージェントが他の3D環境にもゼロショットで汎化できる手法を提案。
- GROOT-2: 弱教師ありマルチモーダル指示追従エージェントVLA2024/12/1
ラベルなしデモで多様な行動を学びつつ、少数のラベル付きデモで人間の意図に合わせる半教師あり学習手法を提案し、マルチモーダル指示追従性能を向上させた。
- OmniJARVIS:統合視覚言語行動トークン化によるオープンワールド指示追従エージェントVLA2024/6/27
Minecraftのオープンワールドで、行動軌跡を自己教師あり学習で離散トークン化し、推論・計画・行動を単一のVLAモデルで統合的に実行できるようにした研究。