日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2608.09771v1

SLIM-0.5B: ロボット操作のための行動基盤予測潜在表現の学習

SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

小型の0.5Bパラメータの潜在相互作用ポリシーを提案し、行動に基づく予測潜在表現を自己教師ありで学習することで、大規模VLAモデルと同等以上の性能を少ないパラメータで達成した。

詳しい要約

1. どんなもの?

SLIM-0.5Bは、ロボット操作のためのコンパクトな0.5Bパラメータの潜在相互作用ポリシーである。視覚と言語の大規模マルチモーダルバックボーンに依存する従来のVision-Language-Action (VLA)ポリシーとは異なり、SLIMはアクションに接地された予測潜在表現を学習し、アクション条件付きの将来遷移と観測変化を説明するアクションの両方を捉える。自己教師ありのマスク軌道予測により、アクション再構成と将来潜在予測を組み合わせて表現を学習する。コンパクトなMixture-of-Transformers (MoT)バックボーンが観測潜在とアクショントークンの相互作用をモデル化し、フローマッチングで言語条件付きアクション生成を訓練する。

2. 先行研究と比べてどこがすごい?

従来のVLAポリシーは大規模なマルチモーダルバックボーンに依存し、オープンドメインのセマンティクスに多くの容量を割くが、連続ロボット操作には観測・アクション・遷移のコンパクトな表現が主に必要である。ピクセルレベルの世界モデルは制御に無関係な視覚詳細の予測にコストがかかる。SLIMはこれらの問題を、アクションに接地された潜在表現を学習することで解決し、大規模なVLAや世界行動モデルのベースラインと比較して、少ないパラメータ、追加の具現化事前学習なし、低い推論レイテンシ、大幅に低いGPUメモリ使用量で同等以上の性能を達成する。

3. 技術・手法の肝は?

SLIMの核心は、自己教師ありのマスク軌道予測を通じてアクションに接地された予測潜在表現を学習することである。具体的には、アクション再構成と将来潜在予測を組み合わせた目的関数を用いる。コンパクトなMixture-of-Transformers (MoT)バックボーンが観測潜在とアクショントークンの相互作用をモデル化し、フローマッチングを用いて言語条件付きアクション生成を訓練する。これにより、制御に重要な情報に焦点を当てた表現を効率的に学習する。

4. どうやって有効だと検証した?

シミュレーションベンチマークと実世界評価の両方で検証された。代表的な大規模VLAおよび世界行動モデルのベースラインと比較し、SLIMは少ないパラメータ、追加の具現化事前学習なし、低い推論レイテンシ、大幅に低いGPUメモリ使用量で同等以上の性能を達成した。

5. 議論はある?

要旨からは、SLIMの潜在表現が制御に重要な情報を捉える一方で、オープンドメインのセマンティクス理解が限定的である可能性や、大規模な事前学習なしでどこまで汎化できるかなどの議論は明示されていない。また、MoTバックボーンの設計選択や、フローマッチングの利点についての詳細な議論も要旨には含まれていない。

6. 次に読むべき論文は?

要旨で参照されている代表的な大規模VLAおよび世界行動モデルのベースラインに関する論文が次に読むべきである。具体的には、Vision-Language-Actionモデル(例:RT-2、OpenVLA)や世界モデル(例:Dreamer、IRIS)の関連研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jingkai Wang, Zihan Tang, Gu Zhang, Mingyu Cao, Jiapeng Chen, Jingjiao Zhao, Xiansheng Chen, Pengwei Wang, Lemao Liu, Dejing Dou

分類: cs.RO

原文アブストラクト

Vision-language-action policies rely on large multimodal backbones to jointly perform perception, language conditioning, and action generation at every control step. Much of this capacity supports open-domain semantics, whereas continuous robot manipulation primarily requires compact representations of observations, actions, and the transitions induced by actions. Pixel-level world models provide another route, but predicting visual details irrelevant to control can be unnecessarily expensive. We propose SLIM (Self-supervised Latent Interaction Model), a compact 0.5B-parameter latent interaction policy. SLIM learns action-grounded predictive latents that capture both action-conditioned future transitions and the actions that explain observed changes. SLIM learns these representations through self-supervised masked trajectory prediction, combining action reconstruction with future-latent prediction. A compact Mixture-of-Transformers (MoT) backbone models interactions between observation latents and action tokens. The resulting policy is trained with flow matching for language-conditioned action generation. Across simulation benchmarks and real-world evaluation, SLIM matches or exceeds representative large-scale VLA and world-action-model baselines with fewer parameters, no additional embodied pretraining, lower inference latency, and substantially lower GPU memory usage.