何が起きたか

arXivは2026-09-16、論文「M²Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models」を公開した。論文は、連続的な行動信号を離散トークンに変換する際の再構成誤差を下げるため、多頭・多コードブックの行動トークナイザ「M²Tok」を提案している。

詳細

論文は、潜在的な行動特徴を複数のheadに分解し、それぞれに独立したcodebookを割り当てて量子化する方式を採るとしている。複数コードブックの組み合わせにより表現力を高め、従来法より再構成損失を下げると説明している。 評価はRoboTwin、Simpler-Env、および3つのゼロショット実世界タスクで行ったとしており、再構成忠実度の改善に加えてVLAモデルの成功率向上を示したとしている。codeはGitHubで公開されていると記している。

Key Facts

論文名は「M²Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models」である。[1]
掲載日は2026-09-16である。[1]
提案手法は、潜在行動特徴を複数headに分解し、各headに独立したcodebookを割り当てる。[1]
評価先はRoboTwin、Simpler-Env、3つのゼロショット実世界タスクである。[1]
codeはhttps://github.com/cpaaax/M2Tokで公開されている。[1]

本紙の見方

本件の新規性は、VLAモデルの入力側にある連続行動をどう離散化するか、という基礎部品にある。M²Tokは単にトークン化を行うのではなく、行動特徴を複数headに分け、各headへ独立codebookを与えることで、離散化に伴う情報落ちを抑えようとしている。つまり、ロボットの制御性能を左右しやすいのはモデル本体だけでなく、行動を表現へ落とし込む前処理の設計である、という点を前面に出した論文だとみられる。 本紙の過去報道に当たるものが今回の提供情報にはないため、連続性を直接追う材料はない。ただし、公開情報ベースで見れば、VLAは画像・言語・行動をつなぐ枠組みとして広がってきた一方、行動の離散化は常に再構成誤差とのトレードオフを抱えてきた。M²Tokはそのボトルネックに対し、多頭化と複数codebookという比較的明快な構造で切り込んでいる点が特徴で、既存の単一codebook型よりも表現の組み合わせ余地を増やす設計だと読める。もっとも、論文が示すのはRoboTwin、Simpler-Env、3つのゼロショット実世界タスクでの有効性であり、汎用ロボット制御の全条件を示したわけではない。 業界構造への含意としては、VLAの競争が大規模モデルやデータ量だけでなく、行動表現の粒度設計に移っていることが分かる。計算基盤の拡充だけでは埋まらない性能差が、トークナイザの設計やcodebookの持ち方で生じうるため、ロボット学習では入力・中間表現・制御の連結全体が性能差の源泉になる。公開コードがある以上、比較検証は進みやすいが、実運用で必要な成功率の安定性、タスク間の移植性、codebook数やhead数の選び方がどこまで一般化するかはなお焦点になる。 今後確認すべき点は、(1) head数とcodebook構成を変えたときの性能差、(2) ゼロショット実世界タスクでの再現条件と失敗例、(3) 既存VLAに組み込んだ場合の計算量と推論遅延である。

なぜ重要か

ロボットの視覚・言語・行動をつなぐVLAでは、行動の離散化精度が制御性能に直結しうるため、M²Tokのようなトークナイザ設計はモデル本体の改良と同じくらい重要である。論文が示すとおり、RoboTwin、Simpler-Env、3つのゼロショット実世界タスクでの成功率改善が確認できれば、学習済みVLAの使い勝手を左右する層が計算資源から表現設計へ一段移る可能性がある。

日本への影響

日本のロボット研究や産業応用では、モデルの大型化だけでなく、行動表現の設計と評価系が性能差を生みうる。M²Tokのような多頭・多コードブック方式は、実機タスクでの離散化誤差をどう抑えるかという観点で、日本の実世界ロボット実験にも直接関係しうる。