何が起きたか

NVIDIAは2026年7月16日、ロボットポリシーの文脈長を8Kタイムステップに拡張する手法「RoboTTT」を発表した。この手法は、推論遅延を増やさずに文脈長を従来の3桁以上に拡張し、実ロボット操作タスクで単一ステップのベースラインと比較して87%の性能向上を達成した。

詳細

RoboTTTは、テスト時訓練をロボット基盤モデルに統合し、勾配降下によって更新される高速重みをリカレント状態として持つシーケンスモデルを構築する。訓練時には、シーケンスアクションフォーシングと切り詰められた時間方向逆伝播を組み合わせて文脈長をスケールする。8Kタイムステップで訓練したモデルは、1Kタイムステップで訓練した同じモデルより62%高い性能を示した。

Key Facts

RoboTTTは、ロボットポリシーの視覚運動文脈を8Kタイムステップに拡張する手法であり、推論遅延を増やさずに実現する。出典一覧
RoboTTTは、単一ステップのベースラインと比較して実ロボット操作タスクで87%の性能向上を達成した。出典一覧
RoboTTTは、5分・10段階の組立タスクを完全に完了したが、ベースラインは一度も完了できなかった。出典一覧
8Kタイムステップで訓練したRoboTTTは、1Kタイムステップで訓練した同じモデルより62%高い性能を示した。出典一覧
RoboTTTは、テスト時訓練をVision-Language-Actionポリシーなどのロボット基盤モデルに統合する。出典一覧

本紙の見方

今回の発表は、ロボット基盤モデルにおける文脈長のスケーリングが新たな性能向上の軸となることを示す点で画期的である。従来のロボット基盤モデルは単一ステップまたは短い履歴の視覚運動文脈で動作していたが、RoboTTTは8Kタイムステップという従来の3桁以上に相当する文脈長を実現し、推論遅延を増やさないという点で実用性を両立させている。 本紙の過去報道では、NVIDIAがLGと二足歩行ヒューマノイドロボットの協業を進め、Isaac GR00T基盤モデルとJetson Thorプラットフォームを活用する計画が報じられた。RoboTTTはこうした基盤モデルの性能を直接的に向上させる技術であり、特に長期的なタスクや人間のデモからのワンショット学習など、ヒューマノイドロボットの実用化に必要な能力を強化する可能性がある。また、Mimic Roboticsが発表したVideo-Action Modelsもビデオモデル基盤の利点を主張しており、ロボットポリシーの基盤モデルを巡る競争が激化している。 業界構造への含意として、文脈長のスケーリングが性能向上に直結するという発見は、ロボット基盤モデルの開発競争において、計算資源とデータの重要性をさらに高める。特に、8Kタイムステップの文脈を扱うには大規模なメモリと計算が必要であり、NVIDIAのようなGPUベンダーが優位に立つ可能性がある。 未確定の論点としては、RoboTTTが実際の製品やサービスにいつ組み込まれるのか、また8Kタイムステップの文脈長がどのようなタスクで特に有効かが焦点となる。さらに、文脈長をさらに拡張した場合の性能向上の限界や、他の基盤モデルとの比較も今後の検証が待たれる。

なぜ重要か

RoboTTTは、ロボットポリシーの性能を文脈長のスケーリングによって向上させる新たな手法を示した。これは、ロボット基盤モデルの開発において、モデルアーキテクチャやデータだけでなく、文脈長という新たなスケーリング軸が重要であることを示唆しており、今後のロボットAI研究の方向性に影響を与える可能性がある。