何が起きたか

arXivに2026年8月15日付で公開された論文「Max-Q Selective Imitation for Human-in-the-Loop Online Robot Learning」において、人間参加型(HIL)オンライン強化学習のための新しい訓練手法が提案された。この手法は、MC Q-chunkクリティックとmax-Q選択的模倣の2つの要素から構成される。実機のUSB挿入タスク(20回のデモンストレーション)では、ACT QChunk-MCBCが30分のHIL訓練で99%の成功率を達成し、HIL-SERLは約5時間を要した。シミュレーションのPeg InsertionとSquareタスクでも、ACT/Flow Q-chunk変種は約30分の実効訓練で96%以上の成功率に達し、HIL-SERL、EXPO、E2HiLを成功率と時間のトレードオフで上回った。

詳細

提案手法は、介入軌跡を直接評価するために、リプレイバッファからのモンテカルロリターンに対してチャンクレベルの行動価値を回帰するMC Q-chunkクリティックを導入する。これにより、現在のポリシーによるTDバックアップで希釈されることなく、介入軌跡が評価される。また、max-Q選択的模倣では、各状態において現在のポリシーの行動とバッファサンプルのうち、より高いQ値を持つ方を模倣するハードな勝者総取りルールを採用する。このルールにより、介入からの学習とオン方策の自己改善を自動的に切り替える。自律ポリシーが強い場合、ターゲットがポリシー分布と一致し、実行時の分布シフトを引き起こすポリシーとターゲットサンプルのギャップを減らす。実践では、比較ノイズを減らすために標準的なクリティックアンサンブル平均を使用するが、ターゲットの軟化やスコアギャップ閾値は導入しない。

Key Facts

論文タイトルは「Max-Q Selective Imitation for Human-in-the-Loop Online Robot Learning」で、arXivに2026年8月15日付で公開された。[1]
提案手法はMC Q-chunkクリティックとmax-Q選択的模倣の2つの要素から構成される。[1]
実機USB挿入タスク(20回のデモンストレーション)で、ACT QChunk-MCBCは30分のHIL訓練で99%の成功率を達成した。[1]
HIL-SERLは同じタスクで収束に約5時間を要した。[1]
シミュレーションのPeg InsertionとSquareタスクで、ACT/Flow Q-chunk変種は約30分の実効訓練で96%以上の成功率を達成した。[1]
シミュレーションでHIL-SERL、EXPO、E2HiLを成功率と時間のトレードオフで上回った。[1]
max-Q選択的模倣は、各状態で現在のポリシーの行動とバッファサンプルのうち、より高いQ値を持つ方を模倣するハードな勝者総取りルールを採用する。[1]
MC Q-chunkクリティックは、リプレイバッファからのモンテカルロリターンに対してチャンクレベルの行動価値を回帰する。[1]

なぜ重要か

この研究は、実機ロボット学習における人間の介入を効率的に活用する新しい手法を示し、訓練時間を大幅に短縮できる可能性を示している。特に、介入と自己改善の自動切り替えは、HIL学習の実用性を高める重要な貢献である。