日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2609.27513

ロボット方策学習のための行動整合型アクショントークン化

Behavior-Aligned Action Tokenization for Robot Policy Learning

シェア:XThreadsFacebookLINEはてブBluesky

Soft-DTWで対応する動作チャンクを選び、量子化座標を再構成と同時に整合させることで、タスク間で共有される動作構造をトークナイザに学習させ、下流の自己回帰方策の性能を向上させた研究。

詳しい要約

1. どんなもの?

- 自己回帰型 robot policy のための action tokenization 手法 Behavior-Aligned Action Tokenization (BAAT) を提案。 - 観測から離散 action token を予測して連続制御を学習する枠組み。 - 異なるタスク間で共有される局所運動に着目し、timing が異なっても類似運動が近い表現を持つよう学習。 - Soft-DTW で対応する action chunk を選び、量子化座標を再構成と jointly に整列。 - history-conditioned diffusion decoder で連続 action chunk を復元し、下流の自己回帰 policy が token を予測。

2. 先行研究と比べてどこがすごい?

- 既存 tokenizer では demonstrations 間の behavioral correspondence に明示的な supervision が限定的。 - そのため timing が異なる類似運動が共有表現を持ちにくい問題があった。 - BAAT は Soft-DTW による対応付けと量子化座標の整列を導入し、類似運動を近傍の量子化表現に配置。 - 実行可能な action 詳細を保持しつつ共有運動構造を組織化する点が先行研究と異なる。 - シミュレーションで OAT を約 7.2 ポイント上回る平均成功率 約 45.2% を達成。

3. 技術・手法の肝は?

- Soft-DTW を用いて異なる demonstrations 間で対応する action chunk を選択。 - 選択した chunk の量子化座標を再構成損失と jointly に整列する目的関数を設計。 - これにより類似運動が近い quantized representation を取るよう促す。 - history-conditioned diffusion decoder が token から連続 action chunk を再構成。 - 下流の autoregressive policy がこれらの token を予測する形で制御を学習。

4. どうやって有効だと検証した?

- 3 つの simulation benchmark の選択タスクと 2 つの real robot タスクで評価。 - simulation の平均成功率は約 45.2% で、OAT を約 7.2 ポイント上回った。 - 制御された LIBERO-All alignment ablation を実施。 - その結果、policy 成功率は 70.2% から 79.0% に上昇。 - 一方で trajectory replay 成功率は低下した。

5. 議論はある?

- 結果は behavioral correspondence を supervision として action tokenizer の共有運動構造を組織化する有効性を支持。 - 下流の robot policy learning の改善にも寄与することを示唆。 - ただし trajectory replay 成功率の低下が見られ、再構成忠実性と policy 性能のトレードオフが議論の余地。 - 要旨からは他の限界や詳細な議論は不明。

6. 次に読むべき論文は?

- 要旨で比較されている OAT をまず参照。 - 関連手法として Soft-DTW、diffusion decoder、autoregressive robot policy、action tokenization の既存研究。 - ベンチマークとして LIBERO-All を含む simulation benchmark 関連の論文。 - 具体的な論文名は要旨からは不明。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Junbo Dong, Ze Chen, Zhendong Xie, Junjie Li, Lixin Xu, Xuemin Chi, Yiming Song, Zhaoyuan Ma

分類: cs.RO

原文アブストラクト

Autoregressive robot policies learn continuous control by predicting discrete action tokens from observations. Different tasks often share local motions, yet behavioral correspondence across demonstrations receives limited explicit supervision in existing tokenizers. Motions with different timing can therefore lack a shared representation despite following similar patterns. We propose Behavior-Aligned Action Tokenization (BAAT), which uses soft dynamic time warping (Soft-DTW) to select corresponding action chunks and aligns their quantized coordinates jointly with reconstruction. This objective encourages similar motions across tasks to occupy nearby quantized representations while retaining executable action detail. A history-conditioned diffusion decoder reconstructs continuous action chunks from these tokens, and a downstream autoregressive policy learns to predict them. We evaluate BAAT on selected tasks from three simulation benchmarks and two real robot tasks. BAAT achieves a mean simulation success rate of approximately 45.2%, exceeding OAT by approximately 7.2 percentage points. In the controlled LIBERO-All alignment ablation, policy success rises from 70.2% to 79.0% while trajectory replay success decreases. These results support behavioral correspondence as supervision for organizing shared motion structure in action tokenizers and improving downstream robot policy learning.

関連論文

PR本紙発行元 EmplifAI