日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2608.18787

Dream2Reward: 正のデモンストレーションからの遷移整合報酬モデルによるロボット操作

Dream2Reward: Transition-Alignment Reward Models from Positive Demonstrations for Robotic Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

成功デモから遷移レベルの潜在変位を予測し、観測された動作との整合性で密な報酬を生成する手法を提案。失敗アノテーション不要で報酬ハッキングを軽減し、実ロボット操作を含む下流性能を向上させる。

詳しい要約

1. どんなもの?

Dream2Rewardは、ロボット操作タスクにおいて、正のデモンストレーションのみから密な報酬を学習する手法を提案する。言語条件付きの成功遷移フィールドを学習し、観測された遷移を予測された成功遷移と比較することで、誤った方向への動きやオーバーシュート、停滞をペナルティする。失敗アノテーションや進行ラベル、合成ネガティブを必要とせず、因果的な密報酬を生成する。

2. 先行研究と比べてどこがすごい?

従来の進行ベースの報酬は、観測が名目上の成功軌道に沿ってどれだけ進んだかを推定するが、誤った遷移の後でも高い報酬を維持する可能性がある。Dream2Rewardは遷移レベルでの比較により、観測が進行しているように見えても、誤った方向、オーバーシュート、停滞をペナルティする点で優れている。また、失敗アノテーションや進行ラベル、合成ネガティブを必要としない点も新しい。

3. 技術・手法の肝は?

手法の核は、言語条件付きの成功潜在遷移フィールドを学習すること。遷移開始までの視覚履歴を与え、成功実行に関連する潜在変位を予測し、観測された変位を符号付き方向一致と対称的な大きさ一致でスコアリングする。これにより、遷移レベルの比較が可能になり、誤った方向、オーバーシュート、停滞をペナルティする。報酬は因果的で密である。

4. どうやって有効だと検証した?

メカニズム診断と共有軌道評価において、進行ベースの代替手法よりも成功-失敗分離が強く、低品質な行動に対してより情報量の多いフィードバックを提供することを示した。オンラインおよびオフラインのポリシー学習において、同じ凍結報酬モデルが報酬ハッキングを減らし、下流のパフォーマンスを向上させることを実証した。さらに、実ロボット操作でも有効性を確認した。

5. 議論はある?

要旨からは、潜在的な限界や議論についての詳細は不明。ただし、報酬モデルが凍結されているため、分布シフトに対する頑健性や、複雑なタスクへのスケーラビリティなどが議論の対象となる可能性がある。また、言語条件付けの精度が報酬の品質に影響する可能性も考えられる。

6. 次に読むべき論文は?

要旨で参照されている進行ベースの報酬手法(progress-based reward)や、報酬ハッキング(reward hacking)に関する研究、および正のデモンストレーションからの報酬学習(learning from demonstrations)に関する論文が関連する。具体的には、成功軌道に沿った進行を推定する手法や、逆強化学習、アドバンテージ重み付け模倣学習などが挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Haoyu Zhang, Zecui Zeng, Bin Wang, Lusong Li, Liang Lin, Long Cheng

分類: cs.RO

原文アブストラクト

Learning robotic policies requires dense rewards that remain informative when behavior departs from successful demonstrations. Progress-based rewards estimate how far an observation has advanced along a nominal successful trajectory, but may remain high after an incorrect transition. We introduce Dream2Reward, which learns a language-conditioned successful latent transition field from positive demonstrations. Given the visual history up to a transition start, the model predicts the latent displacement associated with successful execution and scores the observed displacement through signed directional and symmetric magnitude agreement. This transition-level comparison penalizes wrong-direction, overshooting, and stagnant motion even when the resulting observation appears to show progress. Dream2Reward requires no failure annotations, progress labels, or synthetic negatives, and produces a dense causal reward. Across mechanism diagnostics and shared-trajectory evaluations, it provides stronger success-failure separation and more informative feedback on low-quality behavior than progress-based alternatives. Across online and offline policy learning, the same frozen reward model reduces reward hacking and supports stronger downstream performance, including in real-robot manipulation. These results show that comparing realized motion with predicted successful change provides an effective way to convert positive demonstrations into dense rewards for robot learning.

関連論文