何が起きたか

研究チームは2025年11月18日、arXivにてAsyncVLAを発表した。AsyncVLAは、VLAモデルにおける行動生成を非同期フローマッチング(AFM)で行い、行動トークンを非一様な時間スケジュールで生成することで、文脈に応じた生成と自己修正を可能にする。ロボット操作ベンチマークのシミュレーションと実世界評価で、既存手法を上回る性能を達成したとしている。

詳細

AsyncVLAは、従来の同期フローマッチング(SFM)が固定かつ均一な時間スケジュールに依存するのに対し、非同期フローマッチング(AFM)を導入し、行動トークンを非一様な時間スケジュールで生成する。さらに、初期生成行動の信頼度を評価するconfidence raterを導入し、不正確な行動トークンを実行前に選択的に修正する。また、SFMとAFMを統一的に訓練する手順を提案し、単一モデルで両モードを実現することでKVキャッシュの利用効率を向上させる。コードはGitHubで公開されている。

Key Facts

AsyncVLAは、非同期フローマッチング(AFM)を導入し、行動トークンを非一様な時間スケジュールで生成する。[1]
confidence raterを導入し、初期生成行動の信頼度を評価して不正確な行動トークンを選択的に修正する。[1]
SFMとAFMの統一的訓練手順を提案し、単一モデルで両モードを実現してKVキャッシュ利用効率を向上させる。[1]
ロボット操作ベンチマークのシミュレーションと実世界評価で、既存手法を上回る性能を達成した。[1]
コードはhttps://github.com/YuhuaJiang2002/AsyncVLAで公開されている。[1]

なぜ重要か

AsyncVLAは、VLAモデルの行動生成における時間的柔軟性と自己修正を導入することで、長期的なロボット操作タスクの信頼性を高める可能性を示した。これは、ロボットの実用化に向けた重要な一歩であり、今後のVLAモデルの発展に影響を与えるとみられる。