何が起きたか
arXivは2026-06-19付で、「NAC: Neural Action Codec for Vision-Language-Action Models」を公開した。論文は、視覚言語行動モデル(VLA)が用いるロボット行動の離散トークナイザーについて、短い行動軌道を多チャネル1次元信号として扱い、圧縮するNeural Action Codec(NAC)を提案している。音声コーデック型の設計を転用し、オートレグレッシブな方策が短く構造化された列を扱えるようにした点が特徴である。
詳細
NACは、multi-scale RVQGANアーキテクチャを用いて行動を圧縮し、offset codebooksによりコンパクトで順序付きのトークン空間を提供する。復元側にはVocos型デコーダーを用い、ISTFTヘッドと敵対的識別器で行動軌道を復元する。 論文によると、LIBERO-10、RoboMimic、実世界の操作タスク群で検証し、binning、FAST、既存のVQ系トークナイザーと比べて、同程度またはより高い圧縮率で、より高い平均成功率と再構成忠実度を示したとしている。
Key Facts
| 論文名は「NAC: Neural Action Codec for Vision-Language-Action Models」である。 | [1] |
| 掲載日は2026-06-19である。 | [1] |
| NACは短いロボット行動軌道を多チャネル1次元信号として圧縮する。 | [1] |
| NACはmulti-scale RVQGANアーキテクチャとoffset codebooksを用いる。 | [1] |
| 検証対象はLIBERO-10、RoboMimic、実世界の操作タスク群である。 | [1] |
本紙の見方
今回の論文で新しいのは、VLAの行動表現を単なる離散化ではなく、音声コーデックに近い圧縮・復元の問題として再定義している点である。既存のアクショントークナイザーは圧縮率、遅延、下流性能の三つ巴になりやすいが、NACはmulti-scale RVQGANとoffset codebooksで短い順序付き列を作り、復元側にVocos型デコーダーとISTFT headを置くことで、この設計空間を組み替えている。 本紙の見方では、これはVLAの「出力をどう離散化するか」という下流工程の論文であり、ロボット本体やセンサーの話ではない。したがって焦点は、どの程度の圧縮率で、どの程度の操作成功率を維持できるかにある。論文はbinning、FAST、既存VQ系より高い平均成功率と再構成忠実度を示したとしているが、比較条件が同一か、長いタスクや異なるロボット系で同じ傾向が続くかはまだ確認が必要である。 業界構造への含意としては、VLAのボトルネックが「モデル規模」だけでなく、連続制御をトークン列に落とす表現層にもあることを示す点が大きい。トークンが短く、順序付きで、復元忠実度が高ければ、推論時の列長や学習データの取り回しに効く一方、コードブック設計と復元器の選択が性能を左右する可能性がある。今後の論点は、実機での汎用性、長尺軌道への適用、コードブック数や圧縮率の設定、そして既存VLAに組み込んだ場合の計算コストと安定性である。
なぜ重要か
論文が示すのは、ロボットの行動生成で重要なのがVLA本体だけでなく、連続制御をどうトークン化するかという中間表現だという点である。圧縮率を保ちながら平均成功率と再構成忠実度を引き上げられるなら、学習と推論の両方で扱いやすい行動表現として使える可能性がある。