何が起きたか

2024年11月29日、arXivに掲載された論文で、ロボット操作のための新しいVLA(Vision-Language-Action)モデル「CogACT」が発表された。同モデルは、既存のVLMを直接アクション予測に用いるのではなく、VLM出力に基づく専門のアクションモジュールを備えた構成を特徴とする。

詳細

CogACTは、事前学習済みの大規模VLMから派生したVLAアーキテクチャである。従来の研究が単純なアクション量子化でVLMをアクション予測に転用していたのに対し、CogACTはVLM出力に条件付けられた専門のアクションモジュールを持つ構成を提案している。アクションシーケンスモデリングには拡散アクショントランスフォーマーを用い、その設計を体系的に研究し、性能向上とスケーリング特性を示した。評価はシミュレーションと実機の5つのロボットプラットフォームで実施され、新しいロボットへの適応や未知の物体・背景への一般化に優れるとしている。同モデルは、同程度のモデルサイズ(7B)のOpenVLAと比較して、シミュレーションで平均成功率を35%以上、実機実験で55%以上上回り、大規模なRT-2-X(55B)に対してもシミュレーションで18%の絶対成功率の向上を示したと主張している。

Key Facts

CogACTは、VLM出力に条件付けられた専門のアクションモジュールを持つ新しいVLAアーキテクチャである。出典一覧
アクションシーケンスモデリングに拡散アクショントランスフォーマーを用いる。出典一覧
シミュレーションと実機の5つのロボットプラットフォームで評価された。出典一覧
OpenVLA(7B)と比較して、シミュレーションで平均成功率を35%以上、実機実験で55%以上上回ったとしている。出典一覧
RT-2-X(55B)と比較して、シミュレーションで18%の絶対成功率の向上を示したとしている。出典一覧

本紙の見方

今回の発表は、ロボット操作におけるVLAモデルの性能向上を目指した研究の一環と位置づけられる。従来のVLAモデルがVLMをそのままアクション予測に転用していたのに対し、CogACTはアクションモジュールを分離し、拡散モデルを導入した点が新しい。この設計により、タスク成功率が大幅に向上したと主張されており、VLAモデルのアーキテクチャ設計における一つの方向性を示すものと言える。 本紙の過去報道との接続はないが、VLAモデルの進化という観点では、ロボット操作の汎用性向上に向けた研究が活発化している流れの一つとみられる。特に、モデルサイズが同程度のOpenVLAとの比較で大きな差をつけた点は、アーキテクチャの改良が性能に直結する可能性を示唆している。 業界構造への含意としては、ロボット操作の基盤モデル競争において、アーキテクチャ設計が重要な競争軸になることが挙げられる。また、拡散モデルの導入は、アクション生成の品質向上に寄与する可能性があり、今後のVLAモデルの標準的な手法となる可能性もある。 未確定の論点としては、論文で報告された成功率の向上が、実環境での多様なタスクやロボットに対してどの程度一般化するかが挙げられる。また、モデルの学習データや計算コスト、実運用上の課題なども今後の検証が必要である。

なぜ重要か

CogACTの発表は、ロボット操作におけるVLAモデルの性能向上がアーキテクチャ設計によって大きく変わり得ることを示した。これは、ロボットの汎用操作能力の実現に向けた研究開発に影響を与える可能性がある。