何が起きたか

研究チームは2026年8月25日、ロボット操作のための軌道レベル連続行動表現フレームワーク「CAT」をarXivで発表した。CATは、固定実時間区間内の行動軌跡を連続潜在トークンに符号化し、周波数対応位置符号化により制御周波数の違いを吸収する。評価では、LIBERO、MimicGen、実機の長期的操作タスクで、既存のVQベースおよび連続ベースラインを上回る成功率を示した。

詳細

CATは、既存の視覚運動システムが行動表現を制御周波数や固定の時間パラメータ化に依存する問題に対処する。具体的には、固定実時間区間内の行動軌跡を連続潜在トークンに符号化し、周波数対応位置符号化を導入して共通の時間座標系を確立する。さらに、軌道レベル正則化により潜在表現を安定化する。これにより、タイムステップ密度に応じた表現の増大を防ぎ、事前定義された時間パラメータ化への依存を回避する。評価はLIBERO、MimicGen、実機の長期的操作タスクで実施され、複数のモデルバックボーンと制御周波数にわたり、CATベースのポリシーがVQベースおよび連続ベースラインを一貫して上回る成功率を達成した。

Key Facts

CATは軌道レベルの連続行動表現フレームワークであり、固定実時間区間の行動軌跡を連続潜在トークンに符号化する。[1]
周波数対応位置符号化を導入し、制御周波数の違いを吸収する共通の時間座標系を確立する。[1]
軌道レベル正則化により潜在表現を安定化し、タイムステップ密度に応じた表現の増大を防ぐ。[1]
LIBERO、MimicGen、実機の長期的操作タスクで評価し、VQベースおよび連続ベースラインを上回る成功率を達成した。[1]
複数のモデルバックボーンと制御周波数にわたり、CATは成功率を一貫して向上させた。[1]

本紙の見方

今回のCATは、ロボット操作における行動表現の設計に一石を投じる。従来の視覚運動ポリシーは、行動表現を制御周波数や固定の時間パラメータ化に結びつけることが多く、高サンプリングレートでは表現の冗長性が生じ、重要な動作のモデル化が制限されるという問題があった。CATは、固定実時間区間の行動軌跡を連続潜在トークンに符号化することで、この問題を回避し、制御周波数に依存しない表現を実現する。これは、ロボット操作のスケーラビリティ向上に寄与する可能性がある。 本紙の過去報道との関連では、[本紙の関連記事]として挙げられた記事は存在しないが、ロボット操作における行動表現の研究は、近年の模倣学習や基盤モデルの進展と軌を一にする。例えば、2025年には、ロボット操作のための大規模事前学習モデルが注目を集め、行動表現の効率化が議論されてきた。CATは、そうした流れの中で、行動表現を軌道レベルで連続化するという新たな視点を提供する。 業界構造への含意としては、CATのアプローチは、制御周波数の異なる複数のロボットプラットフォームに適用可能な点で、汎用性が高い。これにより、ロボットメーカーは、特定の制御周波数に最適化されたポリシーを個別に開発する必要がなくなり、開発コストの削減が期待できる。また、実機での長期的操作タスクでの成功は、実世界展開への可能性を示唆する。 一方で、未確定の論点も残る。第一に、CATの評価は特定のタスクセットに限定されており、より多様なタスクや環境での汎用性が確認されていない。第二に、連続潜在トークンの表現が、どの程度の計算コストを要するのかが不明である。第三に、実機での長期的操作タスクの詳細(タスクの種類、成功率の具体的な数値など)が公開情報では確認できない。今後、これらの点が明らかになれば、CATの実用性がより明確になるだろう。

なぜ重要か

CATは、ロボット操作の行動表現を制御周波数から解放することで、異なるハードウェア間でのポリシー転用を容易にし、ロボット開発の効率化に寄与する可能性がある。また、連続的な軌道表現は、より滑らかで精密な操作を実現する可能性があり、実世界での応用範囲を広げる。