日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2609.18164

力と仕事を考慮したロボットマニピュレーションのためのエネルギー正則化模倣学習

Energy-Regularized Imitation Learning for Force- and Work-Aware Robotic Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

関節トルクと角変位から仕事量を推定する微分可能な予測器を学習し、事前学習済みマニピュレーションポリシーの微調整に正則化として組み込むことで、成功率を維持しつつ物理的に無駄な動作を削減した。

詳しい要約

1. どんなもの?

- ロボットマニピュレーションにおけるエネルギーを考慮した学習問題を扱う研究。 - joint-space mechanical-work proxyをjoint torqueとangular displacementから定義。 - ロボットの状態と行動からこのworkを推定する微分可能なenergy predictorを訓練。 - 非微分可能なシミュレータ側の物理量を微分可能な正則化項に変換し、事前学習済みマニピュレーションポリシーをfine-tuning。 - RVT-2をRLBench上でインスタンス化し、12のタスクで評価。

2. 先行研究と比べてどこがすごい?

- 従来の模倣学習はエネルギー効率を明示的に考慮しないことが多い。 - 本手法は微分可能なenergy predictorを介してworkを正則化に利用し、物理的に非効率な動作を抑制。 - 明示的な微分可能ダイナミクスモデルを必要とせずにwork-awareなポリシー最適化を実現。 - 先行研究との具体的な比較は要旨からは不明。

3. 技術・手法の肝は?

- joint torqueとangular displacementからjoint-space mechanical-work proxyを定義。 - ロボット状態と行動を入力とし、workを推定する微分可能なenergy predictorを訓練。 - このpredictorを微分可能な正則化項としてfine-tuningに組み込む。 - 事前学習済みポリシー(RVT-2)をRLBench上でfine-tuning。 - 非微分可能なシミュレータ物理量を微分可能な形で扱う点が肝。

4. どうやって有効だと検証した?

- RLBench上でRVT-2を用いて12のマニピュレーションタスクを評価。 - タスクはobject contact, articulated motion, placement, pushing, sweepingを含む。 - fine-tuningにより平均mechanical workが208.8Jから204.4Jへ2.1%減少。 - 平均タスク成功率も86.2%から86.9%へわずかに向上。 - これによりwork-awareなポリシー最適化が物理的に非効率な動作を抑制できることを示した。

5. 議論はある?

- 明示的な微分可能ダイナミクスモデルを必要とせずにwork-awareな最適化が可能であることを示唆。 - エネルギー効率の改善は2.1%と限定的であり、成功率の向上もわずか。 - より大きな改善や他タスクへの一般化については要旨からは不明。 - エネルギー正則化の強度やトレードオフに関する議論は要旨からは不明。

6. 次に読むべき論文は?

- RVT-2(本手法で使用されたベースポリシー) - RLBench(評価に用いられたベンチマーク) - 模倣学習におけるエネルギー効率や物理的正則化に関する関連研究(具体的な論文名は要旨からは不明)

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Toshiki Otani, Hiromu Taketsugu, Norimichi Ukita

分類: cs.RO, cs.CV

原文アブストラクト

This paper studies energy-aware manipulation as a physically grounded learning problem. We define a joint-space mechanical-work proxy from joint torque and angular displacement, and train a differentiable energy predictor that estimates this work from robot states and actions. The predictor converts a non-differentiable simulator-side physical quantity into a differentiable regularizer for fine-tuning a pretrained manipulation policy. We instantiate the framework with RVT-2 on RLBench and evaluate 12 manipulation tasks involving object contact, articulated motion, placement, pushing, and sweeping. The proposed fine-tuning reduces the average mechanical work from 208.8J to 204.4J (i.e., 2.1% reduction), while the mean task success rate also increases slightly from 86.2% to 86.9%. These results show that work-aware policy optimization can suppress physically inefficient motion without requiring an explicit differentiable dynamics model.

関連論文

PR本紙発行元 EmplifAI