何が起きたか
arXivに2026年8月17日付で公開された論文(識別番号2608.16885v1)において、研究チームは階層型ロボット基盤モデル「$τ_0$-VLA」を発表した。同モデルは、高レベルのサブタスク生成を計算スケーラブルな推論問題として扱い、世界モデル誘導のテスト時計算を各推論ステップで実行する。低レベルポリシーは生成されたサブタスクを複数のロボット形態で実行する。モデルは40,115時間の異種実世界データとマルチモーダル共訓練で学習された。
詳細
従来の階層型視覚言語行動(VLA)モデルは、各決定を単一のフォワードパスで行い、困難または重要な選択に追加の計算を割り当てる仕組みがなかった。$τ_0$-VLAは、高レベルポリシーが実行メモリを使用してサブタスクを生成し、必要に応じて代替案を探索してから出力を確定する。低レベルポリシーは生成されたサブタスクを複数のロボット形態で実行する。 モデルは40,115時間の異種実世界データとマルチモーダル共訓練で学習された。ドメイン内および分布シフト設定の両方で、追加のテスト時計算を割り当てることで次サブタスク予測精度が大幅に向上し、これらの利得は長期的なロボット操作タスクの閉ループ成功率の向上につながった。
Key Facts
| 論文はarXivに2026年8月17日付で公開された(識別番号2608.16885v1)。 | [1] |
| モデル名は「$τ_0$-VLA」で、階層型ロボット基盤モデルとされる。 | [1] |
| 高レベルのサブタスク生成を計算スケーラブルな推論問題として定式化し、世界モデル誘導のテスト時計算を導入する。 | [1] |
| 高レベルポリシーは実行メモリを使用してサブタスクを生成し、必要に応じて代替案を探索してから出力を確定する。 | [1] |
| 低レベルポリシーは生成されたサブタスクを複数のロボット形態で実行する。 | [1] |
| モデルは40,115時間の異種実世界データとマルチモーダル共訓練で学習された。 | [1] |
| ドメイン内および分布シフト設定の両方で、追加のテスト時計算により次サブタスク予測精度が大幅に向上した。 | [1] |
| テスト時計算の利得は、長期的なロボット操作タスクの閉ループ成功率の向上につながった。 | [1] |
なぜ重要か
この研究は、ロボット基盤モデルにおけるテスト時計算の重要性を示し、長期的な操作タスクの信頼性向上に寄与する可能性がある。階層的アプローチと世界モデル誘導の組み合わせは、複雑なタスクの分解と実行の新たな枠組みを提供する。