日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2610.11119

FOCUS: 特権状態からRGB-Dへ、モダリティ切替と表現整合を制御する強化学習

FOCUS: From Privileged States to RGB-D with Controlled Modality Switching and Representation Alignment

シェア:XThreadsFacebookLINEはてブBluesky

シミュレーションの特権状態とRGB-D観測のKLダイバージェンスに基づきロールアウトのモダリティを自動調整し、テスト時のRGB-D入力に適応させる単段階PPOフレームワークを提案。

詳しい要約

1. どんなもの?

- ロボット操作のための視覚ベース強化学習フレームワーク - 名称は FOCUS - 単一ステージの PPO ベース - 目的は RGB-D 観測の高次元・ノイズによるサンプル非効率の改善 - 訓練時のみ利用可能な privileged state を活用 - テスト時の RGB-D との modality gap を埋める - 特徴は actor の rollout を RGB-D と privileged-state latents の間で自動制御 - 制御は両モダリティの action distribution 間の KL divergence に基づく - representation alignment で両モダリティ間の行動選択の一貫性を促す

2. 先行研究と比べてどこがすごい?

- 従来は privileged state で訓練しテスト時に RGB-D へ切り替えると train-test modality gap が生じる - または RGB-D のみで訓練するとサンプル非効率 - FOCUS は単一ステージで両モダリティを統合 - 固定の切り替えではなく KL divergence に基づく適応的制御 - 不一致時は RGB-D rollout を抑制し、一致に近づくと RGB-D 露出を増やす - 5 つの manipulation タスクで平均テスト成功率 0.71→0.93 - 各タスクで最強の RGB-D-at-test ベースラインと比較 - 完全な訓練パイプラインを考慮した budget-normalized training-success AUC は 0.47→0.65 - Pick-and-Place ではテスト成功率 0.47→0.86、AUC 0.12→0.61 で学習効率 5.0 倍

3. 技術・手法の肝は?

- 単一ステージ PPO フレームワーク - critic は privileged state で訓練 - actor は RGB-D または privileged-state latents から rollout を収集 - モダリティ切り替えの制御 - 両モダリティが誘導する action distribution 間の KL divergence を指標 - KL が大きい(不一致)ときは RGB-D rollout を制限 - 一致が進むにつれ RGB-D 露出を増やし、on-policy 訓練をテスト時の RGB-D 入力へ移行 - representation alignment - RGB-D と privileged-state latents 間で一貫した行動選択を促す - これによりモダリティ間の表現を揃える

4. どうやって有効だと検証した?

- 5 つの manipulation タスクで評価 - 各タスクで最強の RGB-D-at-test ベースラインと比較 - 平均テスト成功率が 0.71 から 0.93 に向上 - 完全な訓練パイプラインを考慮した budget-normalized training-success AUC が 0.47 から 0.65 に向上 - Pick-and-Place での詳細 - テスト成功率 0.47→0.86 - AUC 0.12→0.61 - 固定 interaction budget に対する学習効率 5.0 倍改善

5. 議論はある?

- 要旨からは不明 - 限界、失敗事例、計算コスト、ハイパーパラメータ感度などは記述なし - 明示されている議論は modality gap とサンプル効率の改善に限定 - KL divergence 閾値や alignment の詳細な設計議論は要旨からは不明

6. 次に読むべき論文は?

- 要旨で参照・比較されている研究 - RGB-D-at-test ベースライン(具体的名称は要旨からは不明) - privileged state を用いる訓練手法(具体的名称は要旨からは不明) - 関連手法として一般に - PPO - privileged learning / asymmetric actor-critic - representation alignment - KL divergence に基づくカリキュラム制御 - RGB-D を用いた視覚ベース強化学習

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Filip Grigorov, Kourosh Darvish, Nandita Vijaykumar

分類: cs.RO

原文アブストラクト

Vision-based reinforcement learning for robotic manipulation is sample-inefficient because RGB-D observations are high-dimensional and noisy. Privileged state information available in simulation can accelerate training, but its absence at test time creates a train-test modality gap. We propose FOCUS, a single-stage PPO framework that trains the critic on privileged state while automatically regulating whether the actor collects rollouts from RGB-D or privileged-state latents. Regulation is driven by the KL divergence between the action distributions induced by the two modalities, while representation alignment encourages consistent action selection across them. Together, these mechanisms limit RGB-D rollouts when the actor's action distributions from RGB-D and privileged-state latents disagree. As they align, RGB-D exposure increases, shifting on-policy training toward the RGB-D inputs used at test time. Across five manipulation tasks, FOCUS raises average test success from 0.71 to 0.93 relative to the strongest RGB-D-at-test baseline on each task. When accounting for each method's complete training pipeline, budget-normalized training-success AUC increases from 0.47 to 0.65. On Pick-and-Place, test success rises from 0.47 to 0.86, while AUC increases from 0.12 to 0.61, a 5.0x improvement in learning efficiency over the fixed interaction budget.

関連論文

PR本紙発行元 EmplifAI