日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2609.14133

可動穴へのペグ挿入のための視覚・力アドミタンス学習

Vision-Force Admittance Learning for Peg Insertion into a Movable Hole

シェア:XThreadsFacebookLINEはてブBluesky

視覚フィードバックと高頻度の力ベースモデルを融合し、動的な環境でもミリメートル精度でペグ挿入を実現する枠組みを提案。

詳しい要約

1. どんなもの?

本論文は、動的環境下でのpeg insertion(ペグ挿入)を高精度に行うためのVision-Force Admittance Learning (VFAL)フレームワークを提案する。移動ロボットベースや未知の動きをする対象により生じる動的環境では不確実性が大きく、peg-in-the-holeのような精密作業が困難である。VFALは非同期の視覚フィードバックと高周波の力ベースモデルを融合し、視覚による姿勢推定を正則化項として用いることで、オンラインで挿入戦略を適応させ、ミリメートル精度を維持する。視覚姿勢推定にはstate-of-the-artのvision foundation modelsを利用し、失敗回復機構も組み込む。実世界実験で高い成功率と様々なペグ・動的環境への適応性を示した。

2. 先行研究と比べてどこがすごい?

要旨からは不明。動的環境での精密作業における先行研究との具体的な比較は述べられていない。

3. 技術・手法の肝は?

技術の肝は、非同期の視覚フィードバックと高周波の力ベースモデルを融合するVision-Force Admittance Learning (VFAL)フレームワークにある。視覚による姿勢推定を正則化項として用い、オンラインで挿入戦略を適応させる。低周波のロバストな姿勢情報を得るためにstate-of-the-artのvision foundation modelsを採用し、さらに失敗回復機構を組み込むことで全体のロバスト性を高めている。

4. どうやって有効だと検証した?

実世界実験により検証している。高い成功率と、様々なペグおよび動的環境への強い適応性を示した。

5. 議論はある?

要旨からは不明。議論や限界については述べられていない。

6. 次に読むべき論文は?

要旨で参照/比較されている研究は明示されていない。関連手法として、visual servoing、admittance control、force-based assembly、vision foundation models(例:SAM, DINO等)が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yuzhong Chen, Yongqing Liang, Yunzhi Xu, Irving Fang, Chase Kidder, Hui-ping Wang, Raihan Haque, Yubiao Zhang, Chen Feng

分類: cs.RO

原文アブストラクト

Precise manipulation in dynamic environments, whether induced by a mobile robot base or a target with unknown motion, remains a major challenge in robotics. Manipulation in dynamic environments introduces substantial uncertainty, which fundamentally conflicts with the tight precision requirement of precise tasks such as peg-in-the-hole. We propose a Vision-Force Admittance Learning (VFAL) framework that fuses asynchronous visual feedback with a high-frequency force-based model, using visual pose estimations as a regularization term. VFAL adapts insertion strategies online to dynamic motion while maintaining millimeter-level precision. To obtain robust, low-frequency pose information, we employ state-of-the-art vision foundation models for visual pose estimation. Additionally, we incorporate failure recovery mechanisms to enhance overall robustness. We validate our approach in real-world experiments, demonstrating high success rates and strong adaptability to various pegs and dynamic environments.

関連論文