何が起きたか
arxiv.orgは2026-08-27、視覚・言語・行動モデル向けの継続事前学習手法「VLAct」を掲載した。VLActは、広範で異種・多身体のロボットデータでVLMバックボーンを事前に学習し、その後にタスク別へ微調整する構成である。論文は、固定されたロボットデータ予算の下では、限られた軌跡を汎化可能な視覚・行動知識へ変えることが重要だと位置づけている。
詳細
VLActは、VLM-prior preservation、multi-head continuous action co-supervision、partial unified cross-embodiment action layoutの3要素を組み合わせ、微調整時にはタスク別のaction headを許す。評価では、LIBERO-Plusで82.6%、RoboTwin 2.0で92.5%の成功率を示し、産業用VLAシステムとしてABot-M0とLingBot-VLAを上回ったとしている。 RoboDojoでは成功率で全ポリシー中6位となり、world-action model(WAM)に指定されたエントリの両指標を上回った。さらにRoboCasa-GR1では、未学習のヒューマノイドembodimentに対し、下流軌跡の20%のみを使ってGR00T-N1.6の全データベースラインを上回ったとしている。著者らは、これらが完全なオープンソースデータと16GPUの訓練設定で得られたとしている。
Key Facts
| arxiv.orgに2026-08-27掲載の論文は、VLAモデル向け継続事前学習手法「VLAct」を提案した。 | [1] |
| VLActは、広範・異種・多身体のロボットデータでVLMバックボーンを事前学習し、微調整時にタスク別action headを使う構成である。 | [1] |
| 論文は、LIBERO-Plusで82.6%、RoboTwin 2.0で92.5%の成功率を示したとしている。 | [1] |
| RoboCasa-GR1では、未学習のヒューマノイドembodimentに対し、下流軌跡の20%のみでGR00T-N1.6の全データベースラインを上回ったとしている。 | [1] |
| 結果は、完全なオープンソースデータと16GPUの訓練設定で得られたとしている。 | [1] |
本紙の見方
VLActの新しさは、ロボットデータを単純に増やすのではなく、限られた軌跡から「移る表現」を作ることを前面に出した点にある。16GPUという比較的小さな訓練設定で、LIBERO-PlusやRoboTwin 2.0、RoboCasa-GR1で高い成功率を示したことは、VLAの性能競争がデータ量の多寡だけで決まらないことを示す材料である。一方で、論文が強調するのはあくまで継続事前学習の設計であり、巨大な専用計算基盤や閉鎖データを前提にしない点が既定路線との差になる。 構造面では、VLActは「広いVLM事前知識」→「多身体ロボットデータでの継続事前学習」→「タスク別微調整」という流れを取る。ここで重要なのは、VLM-prior preservationと、cross-embodimentで行動表現を部分的に統一する設計である。これは、入力としての視覚・言語の汎用性と、出力としての行動ヘッドの個別最適化を分ける発想であり、単一ロボットや単一タスクに閉じた学習とは異なる。RoboCasa-GR1で未学習のヒューマノイドに対して20%の下流軌跡で全データ版を上回ったという結果は、表現の共有が移植性に効くという著者らの主張を補強する。 産業的には、ロボットごとのデータ収集コストと、異なる身体構造への転用性の両方が焦点になる。特に16GPUという条件は、計算資源を前提にした大規模モデル競争だけでなく、学習設計そのものが性能差を生む余地を示す。ただし、論文は研究ベンチマークでの結果であり、実機導入での安定稼働、失敗時の安全性、継続学習後のBOMや運用コスト、どの程度のタスク群で再現するかはまだ確認が必要である。
なぜ重要か
この論文は、VLAモデルの改善余地がデータ収集量だけではなく、表現設計と身体間の共有方法にあると示している。研究開発側にとっては、16GPUと公開データで高い性能を出せるなら、学習基盤の組み方を見直す価値がある。
日本への影響
日本のロボット研究・産業にとっては、機体ごとのデータ収集負担をどう下げるかが具体的な論点になる。特に、異なる身体構成にまたがって行動表現を共有する設計は、個別機体向けの学習を繰り返してきた現場に影響しうる。