日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
模倣学習arXiv:2608.16058v1

SurgVIL: オープンソース手術動画による手術ロボット模倣学習の大規模化

SurgVIL: Scaling Surgical Robot Imitation Learning with Open-source Surgical Videos

シェア:XThreadsFacebookLINEはてブBluesky

手術ロボットの模倣学習において、実組織の動画データから弱い教師信号として運動学を推定し、ファントムデータと組み合わせて学習することで、実組織や分布外環境への汎化性能を向上させるフレームワークを提案した。

詳しい要約

1. どんなもの?

SurgVILは、手術ロボットの模倣学習を大規模化するためのフレームワークである。同期したビデオとロボットのアクションラベルを持つデータは臨床や現実の組織では稀だが、研究プラットフォームのファントムデータは正確なアクションラベルを持つ一方で視覚的多様性に欠ける。SurgVILは、キネマティクスでラベル付けされたファントムロボットのデモンストレーションと、オープンソースデータセットやオンラインソースからの手術ビデオを組み合わせてポリシー学習を行う。ビデオにはロボットのモーションラベルがないため、近似的なキネマティクスを弱い教師信号として推定する。

2. 先行研究と比べてどこがすごい?

従来の学習ベースの手術ロボット自律性は、大規模なデモンストレーションを必要とするが、そのようなデータは臨床や現実の組織では非常に稀であり、ロボットのキネマティクスは通常、制御された研究システムの外ではアクセスできない。一方、研究プラットフォームで収集されたファントムデータは正確なアクションラベルを提供するが、現実の組織の視覚的多様性に欠ける。SurgVILは、これらの制約を克服するために、ファントムデータと手術ビデオを組み合わせることで、スケーラブルな学習経路を提供する点が新しい。

3. 技術・手法の肝は?

SurgVILの手法の肝は、キネマティクスでラベル付けされたファントムロボットのデモンストレーションと、オープンソースの手術ビデオを組み合わせてポリシー学習を行うことである。ビデオにはロボットのモーションラベルがないため、近似的なキネマティクスを弱い教師信号として推定する。これにより、視覚的多様性を提供するビデオデータを活用しつつ、アクションラベルの不足を補う。

4. どうやって有効だと検証した?

SurgVILは、da Vinciロボットの2つのタスク(針のピックアップと胆嚢摘出の切開)で評価された。ACT、π0、GR00T-Hのバックボーンにわたって、手術ビデオを追加することで、現実の組織や分布外の設定への一般化が大幅に向上した。

5. 議論はある?

要旨からは、議論の詳細は不明である。ただし、手術ビデオからの近似キネマティクスの推定精度や、弱い教師信号がポリシー学習に与える影響についての議論が考えられる。また、ファントムデータとビデオデータの組み合わせ方や、タスクの複雑さによる効果の違いなども議論の対象となり得る。

6. 次に読むべき論文は?

要旨で参照されている研究は、ACT、π0、GR00T-Hのバックボーンである。次に読むべき論文としては、これらのバックボーンに関する論文が挙げられる。具体的には、ACT(Action Chunking with Transformers)、π0(おそらくPi Zero)、GR00T-H(おそらくGR00T Humanoid)の各手法の詳細を説明した論文が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Xinhao Chen, JuoTung Chen, Nigel Nelson, Antony Goldenberg, Jesse Haworth, Sean D. Huver, Axel Krieger

分類: cs.RO

原文アブストラクト

Learning-based surgical robot autonomy requires large-scale demonstrations with synchronized videos and robot actions, but such data are exceedingly rare in clinical or realistic tissue settings because robot kinematics are typically inaccessible outside controlled research systems. In contrast, phantom data collected on research platforms provide accurate action labels but lack the visual diversity of real tissue. We propose SurgVIL, a framework for scaling surgical robot imitation learning using open-source surgical videos. SurgVIL combines kinematically labeled phantom robot demonstrations with surgical videos from open-source datasets and online sources for policy learning. Since these videos lack robot motion labels, we estimate approximate kinematics as weak supervision. We evaluate SurgVIL on two da Vinci robot tasks: needle pick-up and cholecystectomy cutting. Across ACT, $π_0$, and GR00T-H backbones, adding surgical videos substantially improves generalization to real-tissue and out-of-distribution settings, suggesting a scalable path from phantom training toward generalizable surgical robot policies.