日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2608.16885v1

τ0-VLA: 世界モデル誘導のテスト時計算を備えた階層型ロボット基盤モデル

$τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation

シェア:XThreadsFacebookLINEはてブBluesky

長期的なロボット操作タスクを、高レベル方策がサブタスク生成時にテスト時計算を追加で行える階層型VLAモデルを提案し、実データで性能向上を実証した。

詳しい要約

1. どんなもの?

τ0-VLAは、長期的なロボット操作タスクのための階層型ロボット基盤モデルである。高レベルのサブタスク生成を、世界モデルに導かれたテスト時計算によってスケーラブルな推論問題として定式化する。各推論ステップで、高レベルポリシーは実行メモリを用いてサブタスクを生成し、必要に応じて代替案を探索してから出力を確定する。低レベルポリシーは生成されたサブタスクを複数のロボット形態で実行する。

2. 先行研究と比べてどこがすごい?

従来の階層型VLAモデルは各決定を単一のフォワードパスで行い、困難な選択に追加の計算を割り当てる仕組みがなかった。τ0-VLAは、テスト時に計算を増やすことでサブタスク予測精度を向上させ、長期的なタスクの成功率を高める点が新しい。

3. 技術・手法の肝は?

手法の肝は、高レベルポリシーが実行メモリを使用してサブタスクを生成し、必要に応じて代替案を探索するテスト時計算の仕組みである。また、40,115時間の異種実世界データとマルチモーダル共訓練を用いてポリシーを訓練する。

4. どうやって有効だと検証した?

ドメイン内および分布シフト設定で、追加のテスト時計算が次サブタスク予測精度を大幅に向上させ、その利得が長期的なロボット操作タスクの閉ループ成功率の向上につながることを検証した。

5. 議論はある?

要旨からは、テスト時計算の増加に伴う計算コストや、探索の効率性、異なるロボット形態への一般化の限界などについての議論は不明である。

6. 次に読むべき論文は?

要旨で参照されている関連研究は明示されていないが、階層型VLAモデルや世界モデルを用いたロボット基盤モデルに関する論文が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Xiaowei Cai, Yunuo Cai, Bingao Chen, Jingxiao Chen, Zhi Chen, Siyuan Feng, Tengyu Hou, Jingshun Huang, Han Jiang, Runkun Ju, Dong Li, Mingxiang Li, Shaowei Li, Xinchen Li, Yifan Li, Yi Liu, Zhongyuan Liu, Jianlan Luo, Junwen Miao, Ruiqi Ni, Buqing Nie, Mingjie Pan, Xinlin Ren, Jianheng Song, Jiaxu Wang, Peiqi Wang, Sen Wang, Xiaoyan Wang, Dafeng Wei, Dongming Wu, Pengwei Xie, Pu Yang, Hangjian Ye, Xiangyu Yue, Jinyu Zhang, Qinglin Zhang, Xueyong Zhao, Pengfei Zhou, Yue Zhou

分類: cs.RO

原文アブストラクト

Long-horizon robot manipulation requires a robot to both execute individual skills reliably and sequence them coherently over extended tasks. Most hierarchical vision-language-action (VLA) models make each such decision with a single forward pass, leaving no mechanism to allocate additional computation to difficult or consequential choices. We introduce $τ_0$-VLA, a hierarchical robot foundation model that formulates high-level subtask generation as a compute-scalable inference problem through world-model-guided test-time computation. At each inference step, the high-level policy uses execution memory to generate a subtask and, when needed, searches over alternatives before committing to its output. A low-level policy then executes the generated subtask across multiple robot embodiments. The policy is trained on 40,115 hours of heterogeneous real-world data with multimodal co-training. Across in-domain and distribution-shifted settings, allocating additional test-time computation substantially improves next-subtask prediction accuracy, and these gains translate into higher closed-loop success on long-horizon robot manipulation tasks.