日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2609.22085

SeeQ: 長期的ロボットマニピュレーションのための汎用価値関数の学習

SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

サブタスク単位でQ値を学習し、自然言語でサブタスクを自己回帰的に予測することで、長期的なロボット操作タスクの性能を向上させる手法を提案。

詳しい要約

1. どんなもの?

- 長期的なロボット操作タスクにおける汎用的な価値関数を学習する手法「SeeQ」を提案。 - 複数段階からなるタスクや同じ段階で繰り返し試行が必要なタスクにおいて、一般istロボットポリシーの脆弱性を改善する。 - Q値関数を学習し、候補行動のランク付けやポリシー改善を導くことで、タスク成功率を高める。 - サブタスク単位のQ値学習により、クレジット割り当ての地平を短縮し、時間差(TD)学習を可能にする。 - 自然言語でアクティブなサブタスクを自己回帰的に予測し、その価値を推定するアーキテクチャを採用。

2. 先行研究と比べてどこがすごい?

- 従来のQ値学習はスパースなタスクレベル報酬から学習するため、長いクレジット割り当て地平、困難なBellmanバックアップ、広範なデータカバレッジが必要だった。 - SeeQはサブタスクレベルのQ値を学習することで、価値予測の地平を短縮し、TD目的関数での効果的な学習を可能にする。 - オフラインロボットデータに含まれるサブタスクレベルのアノテーションを利用し、広範で潜在的に最適でないデータからも学習できる。 - テスト時に人間のアノテーションやモジュール式サブタスク予測システムを必要とせず、自然言語でサブタスクを予測する点が新しい。

3. 技術・手法の肝は?

- ベースとなるvision-languageバックボーンを使用し、多様なオープンソースのロボット操作データで事前学習し、下流タスクでファインチューニングする。 - Q関数アーキテクチャは、アクティブなサブタスクを自然言語で自己回帰的に予測した後、その価値を推定するように訓練される。 - トレーニング中はオフラインロボットデータに存在するサブタスクレベルのアノテーションを利用して分解を行い、学習を可能にする。 - 時間差(TD)目的関数を用いて、サブタスクレベルのQ値を学習する。

4. どうやって有効だと検証した?

- 2台のbimanualロボットプラットフォーム上で4つの実世界操作タスクを実施。 - SeeQ価値関数がbest-of-Nポリシーステアリングを大幅に改善することを示した。 - 具体的な評価指標やベースラインとの比較詳細は要旨からは不明。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- 要旨で参照/比較されている研究は明示されていない。 - 関連手法として、一般的なQ-learning、TD学習、vision-languageモデル、ロボット操作のための価値関数学習が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Saksham Singh, Zheyuan Hu, Max Sobol Mark, Jeffrey Yu, Zackory Erickson, Aviral Kumar

分類: cs.RO

原文アブストラクト

Despite rapid progress, generalist robot policies remain brittle on complex, long-horizon tasks that comprise multiple stages or require repeated attempts and deliberation on the same underlying stage before success. Q-value functions can improve these policies by ranking candidate actions or guiding policy improvement, but learning from sparse task-level rewards entails long credit-assignment horizons, difficult Bellman backups, and broad data-coverage requirements. We introduce SeeQ (Subtask-elicited Q-functions), which instead learns Q-values for the currently active subtask. This shortens the value-prediction horizon and enables effective learning with temporal-difference (TD) objectives. During training, subtask-level annotations present in offline robot data provide the decomposition and enable learning from broad, potentially suboptimal robot datasets. To eliminate the need for human annotations or modular subtask prediction systems at test time, our Q-function architecture is trained to autoregressively predict the active subtask in natural language before estimating its value. We instantiate SeeQ using a base vision-language backbone, pretrain it on diverse open-source robot manipulation data, and finetune it on downstream tasks. Across four real-world manipulation tasks on two bimanual robot platforms, the SeeQ value function substantially improves best-of-N policy steering.

関連論文

PR本紙発行元 EmplifAI