日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
強化学習arXiv:2608.26571

到達して生き残る:1ビットの失敗信号からの安全な目標条件付きポリシー学習のスケーリング

Arrive and Survive: Scaling Safe Goal-Conditioned Policy Learning from One-Bit Failure Signals

シェア:XThreadsFacebookLINEはてブBluesky

失敗終了型マルコフ決定過程における対比強化学習の理論的欠陥を指摘し、質量重み付きInfoNCEと対数生存質量スコアによる修正を加えたSafe-CRLを提案。12のロボットナビゲーション・歩行タスクで生存率と目標到達性能を向上させた。

詳しい要約

1. どんなもの?

本論文は、失敗終了を伴うマルコフ決定過程(failure-terminated MDP)における目標条件付き強化学習(goal-conditioned RL)のための新しい手法、Safe Contrastive Reinforcement Learning (Safe-CRL) を提案している。対照的強化学習(CRL)の枠組みを拡張し、失敗終了によって除去される確率質量を考慮することで、安全な目標到達行動を学習する。手法は、mass-weighted InfoNCEとlog-survival-mass scoreという2つの最小限の修正から構成され、失敗終了の1ビット信号のみを必要とする。

2. 先行研究と比べてどこがすごい?

従来のCRL(特にScaling-CRL)は、失敗終了MDPにおいて、正のサンプルを構築する際に失敗前の未来の目標のみを考慮し、失敗終了によって除去される確率質量を無視していた。本論文の理論的分析により、この省略が目標到達価値の系統的な過大評価バイアスを引き起こすことを示し、これが失敗に近い軌道からの過剰な成功信号により危険な行動を強化することを明らかにした。Safe-CRLはこのバイアスを補正し、安全なポリシー学習を可能にする点が新しい。

3. 技術・手法の肝は?

手法の核心は2つの補正である。第一に、mass-weighted InfoNCEは、批判者(critic)学習において、短い生存未来の過重評価を補正する。第二に、log-survival-mass scoreは、ポリシー最適化において欠落した生存質量を復元する。これらは失敗終了の1ビット信号のみを使用し、CRLの理論を失敗終了下で完成させる。

4. どうやって有効だと検証した?

12の失敗しやすいロボットナビゲーションおよび移動タスク(failure-prone robot navigation and locomotion tasks)で評価した。Safe-CRLは、生存率(survival)を一貫して改善し、目標到達性能(goal-reaching performance)においてScaling-CRLベースラインを大幅に上回った。また、深いSafe-CRLポリシーは複雑な失敗回避行動を示した。

5. 議論はある?

要旨からは、議論の詳細は不明であるが、理論的貢献としてCRLの失敗終了下での理論を完成させたこと、実用的には安全なRLのスケーラブルな枠組みを提供したことが挙げられる。また、Safe-CRLが失敗終了の1ビット信号のみで動作するため、追加の報酬設計や状態情報を必要としない点が議論の余地があるかもしれない。

6. 次に読むべき論文は?

要旨で参照されているのは、Scaling-CRL(ベースライン)とCRL(対照的強化学習)の一般的な枠組みである。次に読むべき論文としては、Scaling-CRLの元論文や、対照的強化学習の基礎となる論文(例えば、Contrastive RL)が考えられる。また、失敗終了MDPや安全RLの関連研究も有用である。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Guopeng Li, Yiyang Duan, Yiru Jiao, Chengcheng Xu

分類: cs.LG, cs.RO

原文アブストラクト

Contrastive reinforcement learning (CRL) scales effectively in goal-conditioned tasks by casting policy learning into a self-supervised contrastive objective. However, in a failure-terminated Markov decision process, established CRL considers pre-failure future goals only when constructing positive samples, without accounting for the probability mass removed by failure termination. Our theoretical analysis shows that this omission induces a systematic overestimation bias in goal-reaching values. Consequently, near-failure trajectories provide disproportionately strong supervision of success despite retaining little future occupancy. Unsafe actions can thereby be reinforced through catastrophic failure bootstrapping, leading to failed policy learning and unsustainable goal-reaching behaviours. To address this problem, we introduce two minimal yet strong corrections: mass-weighted InfoNCE corrects the overweighting of short surviving futures in critic learning, and a log-survival-mass score restores the missing survival mass in policy optimization. The resulting method, Safe Contrastive Reinforcement Learning (Safe-CRL), requires only the one-bit signal provided by failure termination to scale safe goal-conditioned policy learning. Across twelve failure-prone robot navigation and locomotion tasks, Safe-CRL consistently improves survival and substantially outperforms the Scaling-CRL baseline in goal-reaching performance. Additionally, deep Safe-CRL policies exhibit complex failure-avoidance behaviours. This study completes the CRL theory under failure termination and provides a scalable safe RL framework. The code is available via https://github.com/RomainLITUD/safe-crl.

関連論文