何が起きたか

arXivは2026-09-15付で、「TEMPO: Learning Temporal Context for Dynamic Robot Manipulation」を公開した。動的なロボット操作で、既存のvision-language-action(VLA)モデルが単一観測に依存するために失敗するとして、TEMPOを提案した。Bottle Handoverでは成功率が44%から74%に改善したとしている。 同論文は、既存手法の失敗要因をmotion ambiguityとstate aliasingの2つに整理し、前者には凍結した動画基盤モデルから抽出したmotion summary、後者にはcompact proprioceptive historyを与える設計を採った。あわせて、motion-aware robot perceptionを評価するためのTEMPO-Benchも公開したとしている。

詳細

TEMPOは、事前学習済みのVLAバックボーンに対して2つの時間的入力を追加する。1つは、凍結したvideo foundation modelから抽出したmotion summaryで、動く対象の将来状態を推定しにくいmotion ambiguityへの対処を狙う。もう1つはcompact proprioceptive historyで、見た目が似ていても必要な行動が異なるstate aliasingへの対処を狙う。 論文は、TEMPOがバックボーン本体の改変を必要とせず、学習時・実運用時の追加計算負荷も小さいとしている。4つの動的操作タスクで評価し、Bottle Handoverの成功率は44%から74%に上昇した。state aliasingを解決できたのはTEMPOのみだとしている。さらに、50k超の注釈フレームを含むTEMPO-Benchを公開し、回帰形式と複数選択形式の双方で動きに対応したロボット知覚を評価できるとしている。

Key Facts

TEMPO: Learning Temporal Context for Dynamic Robot Manipulation は arXiv で2026-09-15に公開された。[1]
TEMPOは、motion ambiguityとstate aliasingという2つの表現上の失敗に対処する設計である。[1]
TEMPOは、凍結したvideo foundation model由来のmotion summaryとcompact proprioceptive historyをVLAに追加する。[1]
4つの動的操作タスクで評価され、Bottle Handoverの成功率は44%から74%に改善した。[1]
TEMPO-Benchは50k超の注釈フレームを含むベンチマークとして公開された。[1]

本紙の見方

TEMPOの新しさは、動的操作での失敗をモデル規模や推論遅延ではなく、時間的文脈の欠如として切り分けた点にある。VLAは静的に近い操作では成果を示してきたが、同論文は単一観測では動く対象の将来状態が読めないこと、さらに見た目が似た状態でも必要行動が変わることを、motion ambiguityとstate aliasingに整理した。ここで重要なのは、問題を「もっと大きいモデル」や「もっと遅い推論」で解く方向に置かず、入力表現を足す方向へ転換していることである。 本紙の過去報道はないため、連続性の確認対象は本件の内部構造そのものになる。TEMPOはVLAのバックボーンを改造せず、凍結した動画基盤モデルとproprioceptive historyを足す構成である。つまり、知覚側では映像の時間情報、制御側では身体状態の履歴を別系統で補う設計だ。これは単一の大規模モデルに全てを期待するのではなく、入力の役割分担で失敗モードを分離している点が特徴であり、評価でもstate aliasingを解けたのはTEMPOのみとされる。 業界構造への含意としては、動的操作のボトルネックがロボット本体の能力だけでなく、時系列の観測設計と学習評価に移っていることが読み取れる。50k超の注釈フレームを持つTEMPO-Benchの公開は、手法提案と同時に評価基盤を押さえる動きでもあり、今後はモデル性能だけでなく、どの時系列信号をどう与えたか、どの失敗モードをどこまで切り分けられたかが比較軸になりやすい。加えて、追加計算負荷が小さいとされるため、研究段階だけでなく実機導入時の制約との整合性も論点になる。 未確定の論点は、4タスク以外での再現性、TEMPO-Benchの具体的な構成、video foundation modelやproprioceptive historyの取り込み方の汎用性である。また、Bottle Handover以外の実運用環境で同じ改善幅が出るか、追加入力が異なるロボットやセンサ構成でも成立するかは、今後の検証が必要である。

なぜ重要か

動的な把持や受け渡しでは、単一画像ではなく時間情報を使う必要があることを、arXiv掲載の論文が具体的な失敗モードと実験結果で示した。VLAの改良対象がモデル規模だけではないと明示した点は、ロボット知覚と制御の設計条件を見直す材料になる。

日本への影響

日本のロボット研究や実機開発では、カメラ映像だけでなくproprioceptive historyを含む時系列データ設計が論点になりやすい。特に、動的な受け渡しや操作を扱う場合は、TEMPO-Benchのような評価基盤に近い比較条件をどう整えるかが焦点になる。