何が起きたか
研究チームは2026年8月31日、arxiv.orgで「CometVLA: Co-Training on an Embodied Data Pyramid towards Physical Understanding」を発表した。CometVLAは、遠隔操作、シミュレーション、エゴセントリック動画、VQA層からなる「身体化データピラミッド」で共訓練されるVLAモデルである。実世界の操作タスクとRoboTwinシミュレーションにおいて、既存の強力なVLAベースラインを一貫して上回る性能を示した。
詳細
CometVLAは、身体化された物理VQAコーパス「CometData」とベンチマーク「CometBench」を新たに構築し、ロボットの行動データと身体性に厳密に整合させた。新たに導入された「Global Action Prior (GAP)トークン」は、タスク非依存の動作規則性を分離するコンパクトな学習可能なボトルネックであり、事前学習済みVLMバックボーンを破壊せずに物理常識を行動ヘッドに供給する。共訓練は、遠隔操作、シミュレーション、エゴセントリック軌跡、VQA層からなる身体化データピラミッド全体で行われる。相関分析により、CometBenchでのVLM性能が高いほど、VLAの成功率が高いことが示された。
Key Facts
| CometVLAは、身体化データピラミッド(遠隔操作、シミュレーション、エゴセントリック軌跡、VQA層)で共訓練されるVLAモデルである。 | [1] |
| CometDataとCometBenchは、ロボットの行動データと身体性に厳密に整合した身体化物理VQAコーパスおよびベンチマークである。 | [1] |
| Global Action Prior (GAP)トークンは、タスク非依存の動作規則性を分離するコンパクトな学習可能なボトルネックであり、事前学習済みVLMバックボーンを破壊せずに物理常識を行動ヘッドに供給する。 | [1] |
| 実世界の操作タスクとRoboTwinシミュレーションで、CometVLAは強力なVLAベースラインを一貫して上回った。 | [1] |
| 相関分析により、CometBenchでのVLM性能が高いほど、VLAの成功率が高いことが示された。 | [1] |
本紙の見方
今回の発表の核心は、VLAモデルにおける物理理解の欠如という課題に対し、データとモデル構造の両面からアプローチした点にある。従来の物理VQAデータは身体性を欠き、ロボットの行動領域と整合していなかった。また、エゴセントリック動画は補助的な事前学習にのみ使われ、VLMの物理理解が実際の行動生成に寄与するかは不明だった。CometVLAは、行動データと厳密に整合した身体化VQAコーパスを構築し、データピラミッド全体で共訓練することで、このギャップを埋めようとしている。 技術的な特徴は、GAPトークンの導入にある。これは、タスク非依存の動作規則性を分離するボトルネックとして機能し、事前学習済みVLMの表現を破壊せずに物理常識を行動ヘッドに統合する。この設計は、VLMの物理理解が行動生成に悪影響を及ぼすという懸念に対処するものであり、モデル構造の工夫として注目に値する。 業界構造への含意として、VLAモデルの性能向上には、データの身体性とモデルの統合方法が重要であることが示された。特に、物理理解の事前学習が実際の操作成功率に寄与するという相関分析の結果は、今後のVLA開発において、物理VQAデータの整備が重要な要素となることを示唆している。 未確定の論点としては、CometDataの規模や構成(具体的なデータ量、タスクの種類、ロボットのプラットフォームなど)が公開されていない点が挙げられる。また、実世界の操作タスクの具体的な内容や成功率の数値も明記されておらず、ベースラインとの差がどの程度のものかは不明である。さらに、GAPトークンの設計詳細(次元数、学習方法など)も論文の要旨からは読み取れない。これらの詳細は、今後の論文本文や追加の発表で確認する必要がある。
なぜ重要か
VLAモデルはロボット操作の汎用性を高める可能性を秘めるが、物理常識の欠如が実用化の障壁となっていた。CometVLAは、身体化データとモデル構造の工夫により、物理理解を行動生成に統合する道筋を示した。この成果は、ロボットが実世界でより堅牢に動作するための基盤となる可能性があり、今後のVLA研究の方向性に影響を与えるだろう。