日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2609.08743

FOCIポリシー:関係的操作ポリシーのためのオブジェクト中心相互作用に焦点を当てる

FOCI Policy: Focus on Object-Centric Interactions for Relational Manipulation Policies

シェア:XThreadsFacebookLINEはてブBluesky

物体間の相対運動に基づく相互作用中心のフレームワークを提案し、デモから重要な相互作用区間を抽出してスキルを表現することで、少ないデータで高い性能を達成する操作ポリシーを開発した。

詳しい要約

1. どんなもの?

FOCI Policyは、オブジェクト中心の操作ポリシーを改善するためのフレームワークである。剛体の関係的操作タスクの多くが、タスク関連オブジェクト間の相対運動が厳しく制約される短い相互作用フェーズによって支配されるという観察に基づき、時間的・空間的に抽象化を行う。時間的にはデモンストレーションからコンパクトな相互作用セグメントを自動抽出し、空間的にはスキルをタスク関連オブジェクト間の相対SE(3)運動として表現することで、シーン構成やロボットの身体性に対する不変性を実現する。

2. 先行研究と比べてどこがすごい?

既存のオブジェクト中心ポリシーは、オブジェクトの動きをモデル化することでロボットのアクション直接予測よりも一般化を向上させるが、表現が単純すぎて相互作用ダイナミクスを捉えられないか、密度が高すぎて学習効率が悪いという限界がある。FOCI Policyは、相互作用フェーズに焦点を当てた2段階の抽象化により、これらの限界を克服し、少ない訓練データで高い性能を達成する点が優れている。

3. 技術・手法の肝は?

手法の肝は、時間的抽象化と空間的抽象化の2つである。時間的には、デモンストレーションから自動的にコンパクトな相互作用セグメントを抽出する。空間的には、スキルをタスク関連オブジェクト間の相対SE(3)運動として表現する。これにより、シーン構成やロボットの身体性に依存しない表現を得る。

4. どうやって有効だと検証した?

RLBench、COLOSSEUM、および実世界のタスクで実験を行い、FOCI Policyが既存のオブジェクト中心およびアクション中心のポリシーと比較して、大幅に少ない訓練データで強い性能を達成することを示した。

5. 議論はある?

要旨からは、提案手法の限界や潜在的な欠点についての議論は不明である。ただし、剛体の関係的操作タスクに焦点を当てており、非剛体や連続的な相互作用を伴うタスクへの適用可能性は議論の余地があるかもしれない。

6. 次に読むべき論文は?

要旨で参照されている先行研究や関連手法は明示されていないが、オブジェクト中心の操作ポリシーや関係的操作タスクに関する研究が関連する。具体的には、オブジェクト中心の表現学習や、SE(3)運動を利用した操作スキル学習に関する論文が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Ze Fu, Pinhao Song, Yutong Hu, Renaud Detry

分類: cs.RO

原文アブストラクト

Object-centric manipulation policies improve generalization by modeling object motion instead of directly predicting robot actions. However, existing methods are often limited by representations which are either too simplistic to capture interaction dynamics or too dense to learn efficiently. We observe that many rigid relational manipulation tasks are governed by short interaction phases where the relative motion between task-relevant objects is tightly constrained. Based on this observation, we propose \textsc{Foci Policy}, an interaction-centric framework that achieves a two-fold abstraction: (1) temporally, by automatically extracting compact interaction segments from demonstrations;(2) spatially, by representing skills as relative $SE(3)$ motion between task-relevant objects, yielding invariance to scene configurations and robot embodiment. Experiments on RLBench, COLOSSEUM, and real-world tasks show that \textsc{Foci Policy} achieves strong performance with substantially less training data than prior object-centric and action-centric policies. These results suggest that modeling object-object interactions provides a simple and efficient inductive bias for rigid relational manipulation. Project page: \href{https://fitz0401.github.io/foci-page/}{fitz0401.github.io/foci-page/}.

関連論文