何が起きたか
2025年12月12日、arXivに投稿された論文で、VLAモデルの汎化を改善する手法「Atomic Action Slicing (AAS)」が発表された。AASは長期的なデモをプランナーに整合した短い原子アクションに分解し、LIBEROデモから2,124の原子セグメントを生成した。この手法をCLIP-RT+に適用したところ、LIBERO-Goalで94.2%から95.3%、LIBERO-Longで83.8%から88.8%に成功率が向上した。
詳細
AASは、長期的なデモをプランナーが使いやすく、ポリシーが学習しやすい短い型付き原子アクションに分解する。LIBEROデモから、アクションタイプ、時間スパン、信頼度でラベル付けされた2,124の原子セグメントを検証済みデータセットとして生成した。より強力なセグメンタ(Gemini 2.5 Pro)はプランナー定義のプランと密接に一致し、キーフレームのジッターに対しても頑健である一方、小規模モデルは複数オブジェクトタスクで性能が低かった。生成されたデータセット「GATE-VLAP」はHuggingFaceで公開されている。
Key Facts
| AASは長期的なデモを短い型付き原子アクションに分解する手法である。 | [1] |
| LIBEROデモから2,124の原子セグメントを生成し、アクションタイプ、時間スパン、信頼度でラベル付けした。 | [1] |
| CLIP-RT+を原子データセットで微調整した結果、LIBERO-Goalで94.2%から95.3%、LIBERO-Longで83.8%から88.8%に成功率が向上した。 | [1] |
| Gemini 2.5 Proはプランナー定義のプランと密接に一致し、キーフレームのジッターに対して頑健である。 | [1] |
| GATE-VLAPデータセットはHuggingFaceで公開されている。 | [1] |
なぜ重要か
VLAモデルの汎化はロボット学習の実用化における大きな障壁であり、本研究はデータ分割という観点からその改善を試みた点で意義がある。公開されたデータセットは他の研究者のベンチマークとしても活用でき、ロボット学習コミュニティ全体の進展に寄与する可能性がある。