何が起きたか
研究チームは、視覚・言語・行動を統合したVLAモデルMM-ACTを発表した。同モデルは、テキスト・画像・行動を共有トークン空間で生成し、LIBEROシミュレーションで96.3%、実機Frankaで72.0%、RoboTwin2.0で52.38%の成功率を達成したとしている。
詳細
MM-ACTは、テキスト・画像・行動を共有トークン空間で統合し、3つのモダリティすべてで生成を行う。テキストと画像の生成には再マスク並列デコード戦略を、行動生成には一段階並列デコード戦略を採用し、効率を向上させている。また、共有コンテキストから3つのモダリティの生成を監視するContext-Shared Multimodal Learningという統合トレーニングパラダイムを導入し、クロスモーダル学習による行動生成の強化を図る。実験はLIBEROシミュレーションとFranka実機、およびRoboTwin2.0で実施され、ドメイン内とドメイン外の性能を評価した。成功率はLIBEROで96.3%、実機Frankaの3タスクで72.0%、RoboTwin2.0の8つのバイマニュアルタスクで52.38%であり、クロスモーダル学習による追加の向上は9.25%だった。コード、モデル、データはGitHubで公開されている。
Key Facts
| MM-ACTは、テキスト・画像・行動を共有トークン空間で統合するVLAモデルである。 | [1] |
| テキストと画像の生成には再マスク並列デコード戦略を、行動生成には一段階並列デコード戦略を採用する。 | [1] |
| Context-Shared Multimodal Learningという統合トレーニングパラダイムを導入し、クロスモーダル学習による行動生成の強化を図る。 | [1] |
| LIBEROで96.3%、実機Frankaの3タスクで72.0%、RoboTwin2.0の8つのバイマニュアルタスクで52.38%の成功率を達成した。 | [1] |
| コード、モデル、データはGitHubで公開されている。 | [1] |
なぜ重要か
MM-ACTは、VLAモデルの統合と効率化を進めることで、ロボットの汎用性向上に寄与する可能性がある。特に、共有トークン空間での並列生成は、実時間での行動決定を必要とする応用に有用であり、今後のロボット政策の研究開発に影響を与えるとみられる。