何が起きたか
研究チームは、視覚・言語・行動を統合したVLAモデルMM-ACTを発表した。同モデルは、テキスト・画像・行動を共有トークン空間で生成し、LIBEROシミュレーションで96.3%、実機Frankaで72.0%、RoboTwin2.0で52.38%の成功率を達成したとしている。
詳細
MM-ACTは、テキスト・画像・行動を共有トークン空間で統合し、3つのモダリティすべてで生成を行う。テキストと画像の生成には再マスク並列デコード戦略を、行動生成には一段階並列デコード戦略を採用し、効率を向上させている。また、共有コンテキストから3つのモダリティの生成を監視するContext-Shared Multimodal Learningという統合トレーニングパラダイムを導入し、クロスモーダル学習による行動生成の強化を図る。実験はLIBEROシミュレーションとFranka実機、およびRoboTwin2.0で実施され、ドメイン内とドメイン外の性能を評価した。成功率はLIBEROで96.3%、実機Frankaの3タスクで72.0%、RoboTwin2.0の8つのバイマニュアルタスクで52.38%であり、クロスモーダル学習による追加の向上は9.25%だった。コード、モデル、データはGitHubで公開されている。
Key Facts
| MM-ACTは、テキスト・画像・行動を共有トークン空間で統合するVLAモデルである。 | 出典一覧 |
| テキストと画像の生成には再マスク並列デコード戦略を、行動生成には一段階並列デコード戦略を採用する。 | 出典一覧 |
| Context-Shared Multimodal Learningという統合トレーニングパラダイムを導入し、クロスモーダル学習による行動生成の強化を図る。 | 出典一覧 |
| LIBEROで96.3%、実機Frankaの3タスクで72.0%、RoboTwin2.0の8つのバイマニュアルタスクで52.38%の成功率を達成した。 | 出典一覧 |
| コード、モデル、データはGitHubで公開されている。 | 出典一覧 |
本紙の見方
MM-ACTの発表は、ロボット政策におけるVLAモデルの進展を示すものである。従来のVLAモデルは、テキストと画像の理解に重点を置き、行動生成は別のモジュールに委ねることが多かった。MM-ACTは、3つのモダリティを共有トークン空間で統合し、並列生成することで、タスク計画と環境との相互作用を統一的な枠組みで扱う点が新しい。特に、再マスク並列デコードと一段階並列デコードの採用は、生成効率の向上に寄与しており、実機ロボットへの応用を意識した設計とみられる。 本紙の過去報道との接続はないが、VLAモデルの研究は急速に進展しており、MM-ACTはその流れに位置づけられる。特に、クロスモーダル学習による行動生成の強化は、データ効率の改善につながる可能性があり、実世界でのロボット学習の課題に対処する一歩と評価できる。 業界構造への含意としては、VLAモデルの性能向上が、ロボットの汎用性を高め、製造業や物流などでの導入を加速させる可能性がある。一方で、シミュレーションと実機のギャップは依然として課題であり、RoboTwin2.0での成功率が52.38%にとどまることは、複雑なタスクでの課題を示している。 未確定の論点としては、実機での性能がシミュレーションに比べて低いことから、シミュレーションから実機への転移の限界が挙げられる。また、クロスモーダル学習の効果がタスクによって異なる可能性があり、その要因の解明が今後の焦点になる。さらに、公開されたコードやデータの利用可能性が、コミュニティでの再現性や応用研究にどのように影響するかも注目される。
なぜ重要か
MM-ACTは、VLAモデルの統合と効率化を進めることで、ロボットの汎用性向上に寄与する可能性がある。特に、共有トークン空間での並列生成は、実時間での行動決定を必要とする応用に有用であり、今後のロボット政策の研究開発に影響を与えるとみられる。