何が起きたか

2026年8月27日、arxiv.orgに掲載された論文で、VLAモデル向けの表現中心継続事前学習手法「VLAct」が発表された。VLActは、ロボットデータのスケーリングが困難な中、固定データ予算下で表現品質を向上させることを目的とする。評価では、LIBERO-Plusで成功率82.6%、RoboTwin 2.0で92.5%を達成し、産業用VLAシステムのABot-M0とLingBot-VLAを上回った。さらに、未見のヒューマノイド実体であるRoboCasa-GR1では、下流軌道データの20%のみで、フルデータのGR00T-N1.6ベースラインを上回る性能を示した。

詳細

VLActは、VLA向けVLMバックボーンを、タスク固有のファインチューニング前に、広範で異種のマルチ実体ロボットデータで継続事前学習する手法。VLM事前分布の保持、マルチヘッド連続行動共教師、部分的に統一されたクロス実体行動レイアウトを特徴とし、ファインチューニング時にはタスク固有の行動ヘッドを可能にする。評価はシミュレーション、実世界、未見実体転移で行われ、固定ファインチューニングプロトコル下で一貫した改善を示した。RoboDojoでは全ポリシー中6位の成功率で、明示的に指定された世界行動モデル(WAM)エントリを両指標で上回った。これらの結果は、完全にオープンソースのデータと16GPU構成のみで達成された。

Key Facts

VLActはLIBERO-Plusで成功率82.6%、RoboTwin 2.0で92.5%を達成し、ABot-M0とLingBot-VLAを上回った。[1]
RoboCasa-GR1(未見のヒューマノイド実体)で、VLActは下流軌道データの20%のみでフルデータのGR00T-N1.6ベースラインを上回った。[1]
VLActは16GPU構成と完全にオープンソースのデータで訓練された。[1]
VLActはVLM事前分布の保持、マルチヘッド連続行動共教師、部分的に統一されたクロス実体行動レイアウトを特徴とする。[1]
RoboDojoでは、VLActは全ポリシー中6位の成功率で、明示的に指定された世界行動モデル(WAM)エントリを両指標で上回った。[1]

本紙の見方

今回の提案であるVLActは、ロボットデータのスケーリングが困難であるという前提に立ち、表現品質を中心的なボトルネックと位置づける点で新規性がある。従来のVLA研究はデータ量の拡大に焦点を当てがちだが、VLActは固定データ予算の下で、限られた軌道データを転移可能な知識に変換することを目指す。これは、データスケーリングとは独立した進歩の軸を示すものであり、特に実世界でのデータ収集コストが高いロボティクス分野において重要な視点である。 本論文の結果は、16GPUという比較的小規模な計算資源で、産業用VLAシステムを上回る性能を達成した点で注目に値する。これは、計算資源が限られた研究機関や企業でも、表現中心のアプローチによって競争力のあるVLAモデルを構築できる可能性を示唆する。また、オープンソースデータのみを使用している点も、再現性とコミュニティへの貢献という観点で意義がある。 業界構造への含意として、VLActの成功は、VLAモデルの競争が単なるデータ量や計算資源の規模ではなく、表現学習の質によって左右されることを示す。これは、データ収集に多大なコストをかける大手企業に対して、アルゴリズムの工夫で対抗できる道を開くものであり、ロボットAIの民主化につながる可能性がある。また、マルチ実体学習の有効性は、異なるロボット間での知識転移を促進し、ロボットの汎用性向上に寄与する。 未確定の論点としては、VLActの実世界での性能がシミュレーションと同等に発揮されるかどうか、また、より大規模なデータや計算資源を用いた場合にスケールするかどうかが挙げられる。さらに、VLActが提案する表現中心のアプローチが、他のVLAアーキテクチャやタスクにも一般化するかは今後の検証が必要である。

なぜ重要か

VLActは、ロボットデータのスケーリングに頼らずにVLAモデルの性能を向上させる手法を示し、計算資源やデータが限られた環境でも高性能なロボットAIを実現できる可能性を提示する。これは、ロボットAIの研究開発における参入障壁を下げ、多様なプレイヤーによる革新を促進する点で重要である。