日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2608.17323v1

ORPA: 人間のフィードバックを用いたロボット操作制御のためのオンライン残差ポリシー適応

ORPA: Online Residual Policy Adaptation for Robot Manipulation Control with Human Feedback

シェア:XThreadsFacebookLINEはてブBluesky

模倣学習で訓練された操作ポリシーの実行時エラーを、基盤ポリシーを変更せずに軽量なフィードバック条件付きモジュールで残差補正するフレームワークを提案し、ALOHAプラットフォームでの精密操作タスクで成功率向上を実証した。

詳しい要約

1. どんなもの?

ORPA (Online Residual Policy Adaptation) は、模倣学習で訓練されたロボット操作ポリシー(例:Action Chunking with Transformers (ACT))の実行時エラーや分布シフトに対して、基盤ポリシーのパラメータを変更せずに、軽量なフィードバック条件付きモジュールが関節空間で残差調整を予測し、即座に行動を修正するフレームワーク。ALOHAプラットフォーム上で精密操作タスクを評価し、成功率向上と小さな摂動からの回復を実証。

2. 先行研究と比べてどこがすごい?

従来の失敗修正はデータセット集約と全ポリシーの再訓練を必要とし、計算コストが高くリアルタイム展開に不向き。ORPAはポリシーパラメータを変更せずに、軽量な残差モジュールを追加するだけで実行時適応を可能にし、即時性と計算効率を実現。また、ルールベースの逆運動学補正と比較して、学習ベースの残差予測により柔軟で高精度な修正が可能。

3. 技術・手法の肝は?

ORPAは、事前訓練済みの制御ポリシーに、フィードバック条件付きの軽量モジュールを追加する。このモジュールは、現在の状態と人間のフィードバック(例:成功/失敗の指示)を入力とし、関節空間での残差調整(residual adjustments)を予測する。基盤ポリシーの出力に残差を加算して最終的な行動を生成するため、基盤ポリシーのパラメータは固定されたまま、実行時に適応が可能。

4. どうやって有効だと検証した?

ALOHAプラットフォーム上で、精密操作を要する複数のタスクを設定し、ORPAをベースライン制御ポリシー(ACTなど)およびルールベースの逆運動学補正と比較。成功率の向上と、小さな摂動(外乱)からの回復能力を評価し、ORPAが優れることを示した。

5. 議論はある?

要旨からは、ORPAの限界や一般化に関する議論は不明。ただし、残差モジュールがフィードバックに依存するため、フィードバックの質や頻度が性能に影響する可能性が考えられるが、要旨には明記されていない。また、評価がALOHAプラットフォームに限定されており、他のロボットやタスクへの汎用性は要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されている研究は、Action Chunking with Transformers (ACT) と、ルールベースの逆運動学補正。次に読むべき論文としては、ACTの元論文("Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware")や、残差ポリシー学習(Residual Policy Learning)に関する一般的な研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

分類: cs.RO, cs.AI

原文アブストラクト

Robotic manipulation policies trained via imitation learning, such as Action Chunking with Transformers (ACT), can achieve strong performance under ideal conditions but often remain sensitive to small execution errors and distribution shifts. Correcting these failures typically requires dataset aggregation and full-policy retraining, which is computationally expensive and unsuitable for real-time deployment. In this work, we propose Online Residual Policy Adaptation (ORPA), a framework that enables immediate, feedback-driven correction of robot actions without modifying the underlying policy parameters. ORPA augments a pretrained control policy with a lightweight, feedback-conditioned module that predicts residual adjustments directly in joint space, allowing the system to adapt its behavior at runtime. We evaluate ORPA on a set of precision-sensitive manipulation tasks using the ALOHA platform, demonstrating improvements in success rate and recovery from small perturbations compared to baseline control policies and rule-based inverse kinematics corrections.