何が起きたか

NVIDIAは2026年7月16日、ロボットポリシーの文脈長を8Kタイムステップに拡張する手法「RoboTTT」を発表した。この手法は、推論遅延を増やさずに文脈長を従来の3桁以上に拡張し、実ロボット操作タスクで単一ステップのベースラインと比較して87%の性能向上を達成した。

詳細

RoboTTTは、テスト時訓練をロボット基盤モデルに統合し、勾配降下によって更新される高速重みをリカレント状態として持つシーケンスモデルを構築する。訓練時には、シーケンスアクションフォーシングと切り詰められた時間方向逆伝播を組み合わせて文脈長をスケールする。8Kタイムステップで訓練したモデルは、1Kタイムステップで訓練した同じモデルより62%高い性能を示した。

Key Facts

RoboTTTは、ロボットポリシーの視覚運動文脈を8Kタイムステップに拡張する手法であり、推論遅延を増やさずに実現する。[1]
RoboTTTは、単一ステップのベースラインと比較して実ロボット操作タスクで87%の性能向上を達成した。[1]
RoboTTTは、5分・10段階の組立タスクを完全に完了したが、ベースラインは一度も完了できなかった。[1]
8Kタイムステップで訓練したRoboTTTは、1Kタイムステップで訓練した同じモデルより62%高い性能を示した。[1]
RoboTTTは、テスト時訓練をVision-Language-Actionポリシーなどのロボット基盤モデルに統合する。[1]

なぜ重要か

RoboTTTは、ロボットポリシーの性能を文脈長のスケーリングによって向上させる新たな手法を示した。これは、ロボット基盤モデルの開発において、モデルアーキテクチャやデータだけでなく、文脈長という新たなスケーリング軸が重要であることを示唆しており、今後のロボットAI研究の方向性に影響を与える可能性がある。