日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
模倣学習/操作arXiv:2608.03103v1

時間変動力を要する操作タスクのための階層的模倣学習アプローチ

A Hierarchical Approach to Imitation Learning for Manipulation Tasks Requiring Time Varying Forces

シェア:XThreadsFacebookLINEはてブBluesky

拡散ポリシーによる低周波プランニングと、力条件付きの高速インピーダンス制御を組み合わせた階層的アーキテクチャを提案し、接触を伴う分解タスクを高周波で安定に実行する。

詳しい要約

1. どんなもの?

本論文は、接触を伴う分解作業(例:バッテリー分解)における模倣学習のための階層的アプローチであるDiffusion Policy Augmented by Fast Trajectory Generation (DPA-FTG)を提案する。高周波の力制御と低周波のプランニングを分離し、拡散ポリシーの推論遅延とオープンループ実行の問題を解決する。

2. 先行研究と比べてどこがすごい?

従来のDiffusion Policyは複雑なマルチモーダル行動を学習できるが、反復的ノイズ除去による推論遅延で高周波制御が困難。Action-chunkingは遅延を緩和するがオープンループで力の過渡変化に対応できない。また、視覚触覚アプローチは位置補正に焦点を当てるが、DPA-FTGは力調整を分離し、高周波の力変動に対応する点が新しい。

3. 技術・手法の肝は?

DPA-FTGは2層構造を持つ。高レベル(5 Hz)では条件付き拡散モデルがタスクプリミティブの語彙から戦略を選択するための潜在パラメータ列を予測する。低レベル(60 Hz)では、力条件付きの軽量ポリシーがニューラルインピーダンスコントローラとして機能し、接触安定性を維持するために実行をリアルタイムで調整する。

4. どうやって有効だと検証した?

両腕バッテリー分解タスク(柔軟シートの分離を含む)で検証。Reactive Diffusion Policy (RDP)を含む最先端ベースラインと比較し、DPA-FTGが優れた性能を示した。

5. 議論はある?

要旨からは、提案手法の限界や一般化に関する議論は不明。ただし、高周波制御と低周波プランニングの分離が有効であることが示唆されるが、他のタスクへの適用可能性や、力条件付きポリシーの設計詳細については要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されているReactive Diffusion Policy (RDP)や、関連するDiffusion Policy、Action-chunking、視覚触覚模倣学習の研究。具体的には、拡散ポリシーの基礎論文や、接触リッチな操作のための模倣学習に関する論文が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Rishabh Shukla, Adithya Santhosh, Shaili Gandhi, Samrudh Moode, Satyandra K. Gupta

分類: cs.RO, cs.AI

原文アブストラクト

Diffusion policies have shown strong performance in learning complex, multi-modal behaviors for robotic manipulation. However, their application to contact-rich disassembly tasks remains limited by a key trade-off: the iterative denoising process introduces inference latencies that makes high frequency control difficult, which is essential for realizing dynamic interactions such as chiseling and prying. Recent action-chunking techniques mitigate latency but use an open-loop execution window, rendering the system blind to rapid force transients caused by fracture events. To bridge this gap, we introduce the Diffusion Policy Augmented by Fast Trajectory Generation (DPA-FTG). Compared to recent visual-tactile approaches that focus on positional correction, DPA-FTG decouples low-frequency planning from high-frequency force regulation. At the high level ($5$ Hz), a conditional diffusion model predicts a sequence of latent parameters for selecting a strategy from a learned vocabulary of task primitives. At the low level ($60$ Hz), a lightweight, force-conditioned policy acts as a neural impedance controller, modulating execution in real-time to maintain contact stability. We validate our approach on a bimanual battery disassembly task involving the separation of a compliant sheet. Experimental evaluation demonstrates that DPA-FTG outperforms state-of-the-art baselines, including Reactive Diffusion Policy (RDP).