日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2608.24111

ロボット操作のための軌道レベル連続行動表現

Trajectory-Level Continuous Action Representation for Robotic Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

制御周波数に依存せず、固定時間間隔の行動軌跡を連続潜在トークンで表現する新しい行動表現フレームワークCATを提案し、LIBEROや実機の長期的操作タスクで既存手法より高い成功率を達成した。

詳しい要約

1. どんなもの?

本論文は、ロボット操作のための軌跡レベルの連続行動表現フレームワークであるCATを提案している。既存の視覚運動システムは行動表現を制御周波数に絡めたり、固定の時間パラメータ化に依存したりするが、CATは固定の実時間間隔内の行動軌跡を連続的な潜在トークンの集合に符号化する。周波数対応の位置符号化を導入して異なる制御周波数間での時間的一貫性を確保し、軌跡レベルの正則化で潜在表現を安定化させる。これにより、タイムステップ密度に応じた表現の増大を防ぎ、事前定義された時間パラメータ化への依存を回避する。

2. 先行研究と比べてどこがすごい?

先行研究のVQ-based手法や連続的なvisuomotor baselineは、行動表現を制御周波数や固定の時間パラメータ化に依存させており、高サンプリングレートでの表現の冗長性や、重要な動作のモデリングの制限があった。CATは軌跡レベルで連続的な潜在トークンを用いることで、表現の冗長性を防ぎ、時間パラメータ化に依存しない点が優れている。また、周波数対応の位置符号化により、異なる制御周波数間での時間的一貫性を保ち、様々なモデルバックボーンや制御周波数で成功率を向上させる。

3. 技術・手法の肝は?

手法の核は、固定の実時間間隔内の行動軌跡を連続的な潜在トークンに符号化することである。具体的には、周波数対応の位置符号化を導入して、異なる制御周波数間で共有される時間座標系を確立する。さらに、軌跡レベルの正則化を適用して潜在表現の安定化を図る。これにより、タイムステップ密度に応じた表現の増大を防ぎ、事前定義された時間パラメータ化に依存しない。

4. どうやって有効だと検証した?

LIBERO、MimicGen、および実世界の長期的操作タスクにおけるシステムレベルの評価を実施した。CATベースのポリシーは、同等のトレーニング設定下で、競合するVQ-basedおよび連続的なvisuomotor baselineを一貫して上回る性能を示した。また、様々なモデルバックボーンと制御周波数にわたって成功率を向上させた。

5. 議論はある?

要旨からは、CATの限界や潜在的な欠点についての議論は不明である。ただし、軌跡レベルの表現が高周波数での冗長性を防ぐ一方で、低周波数での情報損失の可能性や、連続潜在表現の解釈可能性などが議論の余地として考えられるが、要旨には明記されていない。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、VQ-based手法(例:VQ-VAE)や連続的なvisuomotor baseline(例:ACT)が挙げられる。また、ロボット操作における行動表現の研究として、Action Chunking with Transformers (ACT)やDiffusion Policyなどが関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Tong Yang, Jingkai Jia, Yuecheng Xu, Xueyao Chen, Chi Zhang, Wenqiang Zhang

分類: cs.RO

原文アブストラクト

We propose CAT, a trajectory-level continuous action representation framework for robotic manipulation. Existing visuomotor systems often entangle action representation with control frequency or rely on fixed temporal parameterizations. This leads to representational redundancy at high sampling rates and limits the modeling of critical motion. CAT instead encodes action trajectories within a fixed real-time interval into a set of continuous latent tokens. To ensure temporal consistency across varying control frequencies, we further incorporate a frequency-aware positional encoding that establishs a shared temporal coordinate system. Trajectory-level regularization further stabilizes the latent representation. This approach prevents representation growth with timestep density and avoids reliance on predefined temporal parameterizations. Extensive system-level evaluations on LIBERO, MimicGen, and real-world long-horizon manipulation tasks demonstrate that CAT-based policies consistently outperform both competitive VQ-based and continuous visuomotor baselines under matched training settings. Across various model backbones and control frequencies, CAT consistently improves success rates. These results highlight the advantages of trajectory-level continuous action modeling for scalable robotic manipulation across varying control rates.

関連論文