日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2609.01596v1

Facet-0: 接触を伴う精密操作のためのロボット基盤モデル

Facet-0: A Robotic Foundation Model for Contact-Rich Precise Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

接触の結果を予測・評価するロボット基盤モデルを提案し、サブミリ精度の組立タスクで高い成功率を達成した。

詳しい要約

1. どんなもの?

Facet-0は、サブミリメートル精度を要する実世界の組立作業向けに設計されたロボット基盤モデルです。因果的なwrench履歴を視覚言語セマンティクスや運動学的状態と統合し、flow matchingを用いてアクションとそれが誘発する将来のwrist-wrenchプロファイルを生成します。展開時には分布型Action-Wrench Criticを訓練し、接触結果の違いを評価します。さらに、軽量なbounded actorが凍結表現を再利用してオンロボット適応を行い、RLは実行可能なCartesianアクション上で定義されます。ManuFacet-1Kという1,000時間の力同期コーパスで訓練され、5つのサブミリ組立タスクで平均成功率82%を達成します。

2. 先行研究と比べてどこがすごい?

先行研究と比べて、Facet-0は接触リッチな精密操作において、アクションとそれが誘発するwrench(力・トルク)の関係を明示的にモデル化し、予測と評価を行う点が革新的です。従来の基盤モデルは視覚と言語に焦点を当て、接触力学を無視することが多かったのに対し、Facet-0は因果的なwrench履歴を視覚言語セマンティクスと統合し、flow matchingでアクションとwrenchプロファイルを同時生成します。また、分布型Action-Wrench Criticを導入し、タスク進捗が類似しても接触結果が異なる動作を区別することで、より精密な制御を可能にしています。さらに、軽量なbounded actorによるオンロボット適応を可能にし、凍結表現を再利用することで効率的な適応を実現しています。

3. 技術・手法の肝は?

技術の肝は、アクションとwrenchの結合提案を中心に据えた統一アーキテクチャです。具体的には、因果的なwrench履歴を視覚言語セマンティクスと運動学的状態に整列させ、flow matchingを用いて各アクションチャンクとそれが誘発する将来のwrist-wrenchプロファイルを生成します。展開時には、分布型Action-Wrench Criticを訓練し、類似したタスク進捗を持つが接触結果が異なる動作を区別します。また、位相認識報酬と接触選択的クレジットを用いて、決定的な相互作用に政策改善を集中させます。部品固有のダイナミクスに対応するため、軽量なbounded actorが凍結表現を再利用してオンロボット適応を行い、RLは実行可能なCartesianアクション上で定義され、補助的なwrenchヘッドが予測的で非指令のアクション-接触結合を保持します。

4. どうやって有効だと検証した?

有効性の検証は、ManuFacet-1Kという1,000時間の力同期コーパスを用いて行われました。このコーパスは3つの異なるembodimentと複数の製造セルをカバーしています。訓練後、bounded task-adapted systemを5つのサブミリメートル精度を要するコンピュータ組立タスクで評価し、平均成功率82%を達成しました。これは最強のベースラインの15%と比較して大幅な改善です。また、0.5mmの配置精度と50msのコマンドレイテンシを達成しています。

5. 議論はある?

議論としては、Facet-0はサブミリメートル精度の組立タスクで高い成功率を示しましたが、一般化やスケーラビリティに関する限界が考えられます。具体的には、ManuFacet-1Kコーパスは特定のembodimentと製造セルに限定されており、多様な環境への適応性は不明です。また、bounded actorによる適応は軽量ですが、複雑な部品固有のダイナミクスには限界があるかもしれません。さらに、wrench予測の精度や、接触失敗からの回復能力についての詳細な分析は要旨からは不明です。

6. 次に読むべき論文は?

次に読むべき論文は、要旨で参照されているベースライン手法や関連するロボット基盤モデル、接触リッチ操作に関する研究です。具体的には、ロボット操作における視覚言語モデル、強化学習を用いた精密組立、wrenchや力制御に焦点を当てた研究が挙げられます。また、ManuFacet-1Kデータセットの詳細や、Facet-0の前身となるモデルに関する論文も関連します。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Haoyuan Deng, Haichao Liu, Wenkai Guo, Yuan Ling, Zaijia Yang, Yuanjiang Xue, Haosheng Sun, Liangzi Wang, Ziwei Wang

分類: cs.RO, cs.LG

原文アブストラクト

Real-world robotic assembly at sub-millimeter tolerances demands spatial precision, compliant interaction, and robustness to contact failures. We present Facet-0, a robotic foundation model that predicts and values the contact consequences of its actions. Facet-0 unifies multimodal representation learning and reinforcement learning (RL) post-training around a joint action-wrench proposal: a causal wrench history is aligned with vision-language semantics and kinematic state, and flow matching generates each action chunk together with the future wrist-wrench profile it is expected to induce. Deployment rollouts train a distributional Action-Wrench Critic to distinguish motions with similar task progress but different contact outcomes, while phase-aware rewards and contact-selective credit concentrate policy improvement on decisive interactions. To accommodate part-specific dynamics, a lightweight bounded actor reuses the frozen representation for on-robot adaptation; RL remains defined over executable Cartesian actions, while an auxiliary wrench head preserves predictive, non-commanded action-contact coupling. Trained on ManuFacet-1K, a 1,000-hour force-synchronized corpus spanning three embodiments and multiple manufacturing cells, the bounded task-adapted system reaches 82% mean success on five sub-millimeter computer-assembly tasks, compared with 15% for the strongest baseline, with 0.5 mm placement accuracy and 50 ms command latency.

関連論文