日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2609.36352

StructRL: 長期的視覚-言語-行動タスクのためのオンライン構造化強化学習

StructRL: Online Structured Reinforcement Learning for Long-Horizon Vision-Language-Action Tasks

シェア:XThreadsFacebookLINEはてブBluesky

長期的なロボット操作タスクを検証可能なサブタスクに分解し、前提条件が満たされた段階で中間報酬を与えるオンライン強化学習フレームワークを提案。VLAモデルのポストトレーニング性能を向上させる。

詳しい要約

1. どんなもの?

- 長期的な Vision-Language-Action (VLA) タスクを対象としたオンライン強化学習フレームワーク StructRL を提案。 - 単一コマンドで複数の依存した操作を必要とする long-horizon タスクにおいて、VLA モデルの性能を向上させる。 - タスクを検証可能なサブタスクに分解し、構造化された中間報酬を構築する。 - RoboCasa365 と LIBERO-Long で GR00T-N1.5 と pi 0.5 を用いて評価。 - コードは https://github.com/amazon-science/StructRL で公開。

2. 先行研究と比べてどこがすごい?

- 既存のオンライン RL 手法は、タスク全体が成功した後にのみ報酬を与える終端監督が多く、報酬が疎で早期失敗と部分的な進捗を区別できない。 - StructRL は検証可能なサブタスク完了に基づく構造化された中間監督を構築し、前提サブタスク完了後にのみ中間報酬を与える。 - 報酬を完了ペースに応じてスケーリングすることで、部分的な進捗を適切に評価する。 - 評価されたオンライン RL ベースラインを一貫して上回る性能を示す。

3. 技術・手法の肝は?

- 各タスクを検証可能なサブタスクに分解する。 - 前提となるサブタスクが完了した後にのみ中間報酬を付与する。 - 各報酬を完了ペースに応じてスケーリングする。 - これにより、終端監督の疎さを緩和し、部分的な進捗を区別可能にする。 - オンライン RL フレームワークとして VLA ポリシーの post-training に適用。

4. どうやって有効だと検証した?

- RoboCasa365 と LIBERO-Long のベンチマークで評価。 - GR00T-N1.5 と pi 0.5 の VLA モデルを使用。 - 評価されたオンライン RL ベースラインと比較し、StructRL が一貫して上回ることを確認。 - 検証可能で構造化された中間報酬が long-horizon VLA post-training を改善することを示す。

5. 議論はある?

- 検証可能な構造化中間報酬が long-horizon VLA post-training を改善することを示唆。 - 終端監督の疎さと部分進捗の区別不能性という問題に対処。 - 具体的な限界や議論の詳細は要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究: オンライン RL ベースライン(具体的名称は要旨からは不明)。 - 関連手法: RoboCasa365, LIBERO-Long, GR00T-N1.5, pi 0.5。 - 同分野の定番: Vision-Language-Action (VLA) モデル、Online Reinforcement Learning (RL)。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Ziyi Yin, Sangmin Woo, Kang Zhou, Sungyeon Kim, Aosong Feng, Haibo Ding, Jun Huan

分類: cs.CV, cs.LG, cs.RO

原文アブストラクト

Vision-language-action (VLA) models perform well on shorter-horizon manipulation tasks but still struggle with long-horizon tasks that require multiple dependent manipulations from a single command. Online reinforcement learning (RL) can improve these policies through environment interaction, yet many existing methods provide reward only after the complete task succeeds. However, such terminal supervision is sparse and does not distinguish early failures from rollouts that make substantial partial progress. We propose StructRL, an online RL framework that constructs structured intermediate supervision from verifiable subtask completions. StructRL decomposes each task into verifiable subtasks, grants intermediate rewards only after the prerequisite subtasks have been completed, and scales each reward according to completion pace. Across RoboCasa365 and LIBERO-Long with GR00T-N1.5 and pi 0.5, StructRL consistently outperforms evaluated online RL baselines. These results show that verifiable, structured intermediate rewards improve long-horizon VLA post-training. Code is available at https://github.com/amazon-science/StructRL.

関連論文

PR本紙発行元 EmplifAI