日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2609.20791

StageGuard: エージェント蒸留による長期的ロボットタスクの段階遷移学習

StageGuard: Learning Stage Transitions for Long-Horizon Robot Tasks via Agentic Distillation

シェア:XThreadsFacebookLINEはてブBluesky

大規模VLMの推論を蒸留した軽量モデルで、長期ロボットタスクにおけるサブタスク完了判定とスキル切替を高精度かつ低遅延で行うフレームワークを提案。

詳しい要約

1. どんなもの?

- 長期的なロボットタスクを階層的に計画する際、現在のスキルを終了し次のサブタスクに移るタイミングを決定する問題に取り組む。 - 既存手法は完了信号チェッカーに依存するが、実世界では入手困難。 - 大規模VLMは推論能力が高いが、決定境界がタスク完了基準と一致せず、クラウド展開と長い推論による遅延がリアルタイム監視を制限する。 - 提案するStageGuardは、正確かつ効率的なステージ遷移決定のためのagentic distillationフレームワーク。 - 教師モデルの推論とデモンストレーション軌跡を組み合わせ、サブタスク完了とポリシー切り替えの構造化説明を生成。 - 軽量な学生VLMがこれらの説明から簡潔な自己説明を生成し、教師あり微調整に使用。

2. 先行研究と比べてどこがすごい?

- 既存の階層的計画フレームワークは、事前設計された完了信号チェッカーに依存しており、実世界での入手が難しい。 - 大規模VLMは推論能力を持つが、決定境界がタスク完了基準と整合せず、クラウド展開と長い推論による遅延がリアルタイム監視を妨げる。 - StageGuardは、agentic distillationにより、教師モデルの推論とデモ軌跡から構造化説明を生成し、軽量学生VLMが効率的なオンライン監視を可能にする。 - これにより、既存手法の完了信号チェッカーの問題とVLMの遅延問題を同時に解決。

3. 技術・手法の肝は?

- 教師モデルの推論とデモンストレーション軌跡を組み合わせ、サブタスク完了とポリシー切り替えの構造化説明を生成。 - 軽量な学生VLMがこれらの説明から簡潔な自己説明を生成。 - 生成された自己説明を用いて学生VLMを教師あり微調整。 - これにより、正確かつ効率的なステージ遷移決定を実現。

4. どうやって有効だと検証した?

- 2つのベンチマークの軌跡でステージ遷移予測を評価。 - BEHAVIOR-1K上で階層的ロボット制御に統合し、閉ループタスク成功率を評価。 - さらに実ロボットでも検証。 - 結果、ステージ遷移予測が大幅に改善し、効率的なオンライン監視をサポート。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究や関連手法は明示されていない。 - 同分野の定番として、Hierarchical planning frameworks、Large-scale vision-language models (VLMs)、BEHAVIOR-1K が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jinbang Huang, Yuanzhao Hu, Zhiyuan Li, Ran Qi, Yixin Xiao, Yangzheng Wu, Tengyue Ba, Zhanguang Zhang, Yingxue Zhang

分類: cs.RO

原文アブストラクト

Hierarchical planning frameworks combine skills from multiple robot control policies for long-horizon task execution, where determining when to terminate the current skill and advance to the next subtask is essential. Existing approaches often rely on pre-designed completion signal checkers that are hard to obtain in real-world execution. Large-scale vision-language models (VLMs) offer strong reasoning capabilities, but their decision boundaries are not inherently aligned with task completion criteria, while cloud deployment and lengthy reasoning introduce substantial latency, limiting real-time monitoring. We propose StageGuard, an agentic distillation framework for accurate and efficient stage-transition decisions. StageGuard combines teacher-model reasoning with demonstration trajectories to generate structured explanations of subtask completion and policy switching. A lightweight student VLM uses these explanations to generate compact self-explanations, which are used for supervised fine-tuning. We evaluate stage-transition prediction on trajectories from two benchmarks and assess closed-loop task success through integration into hierarchical robot control on BEHAVIOR-1K, with further validation on real robots. Results show substantial improvements in stage-transition prediction while supporting efficient online monitoring.

関連論文

PR本紙発行元 EmplifAI