日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
手術ロボット操作/階層的世界モデルarXiv:2608.13103v1

S2-HWM: 長期的な手術ロボット操作のためのスパースイベント構造を持つ階層的世界モデル

S2-HWM: Sparse Event-Structured Hierarchical World Model for Long-Horizon Surgical Robot Manipulation

シェア:XThreadsFacebookLINEはてブBluesky

手術ロボットの長期的な操作タスクにおいて、スパースなイベント証拠を学習して階層的な世界モデルを構築し、イベントレベルのマネージャーとプリミティブステップのワーカーを調整することで、報酬がスパースな環境での成功率を大幅に向上させた。

詳しい要約

1. どんなもの?

S2-HWMは、長期的な手術ロボット操作タスクのためのスパースなイベント構造を持つ階層的世界モデルを提案する。プリミティブ軌跡からスパースなイベント証拠を学習し、イベントレベルのマネージャーとプリミティブステップのワーカーを調整する。イベント証拠はマネージャーの目標更新をスケジュールし、選択された潜在目標が次の更新までワーカーの行動を条件付ける。また、イベント遷移モデル(ETM)が可変長セグメントを形成し、次の境界確率状態、セグメント持続時間、累積報酬を予測する。これにより、プリミティブ想像地平線を超えた可変長の継続を提供し、マネージャーの学習を可能にする。

2. 先行研究と比べてどこがすごい?

既存の世界モデルエージェントはプリミティブステップ解像度で想像し、可変長のタスク進行が暗黙的である。手動指定のステージは中間構造を提供するが、タスク固有の境界を状態依存の相互作用遷移と整合させるのが難しい。S2-HWMは、スパースなイベント証拠を学習することで、手動指定なしに可変長のイベント構造を自動的に獲得し、マネージャーとワーカーの階層的学習を可能にする点が新しい。

3. 技術・手法の肝は?

手法の核は、プリミティブ潜在軌跡からスパースなイベント証拠を学習すること。イベント証拠はマネージャーの目標更新をスケジュールし、各目標はワーカーの行動を条件付ける。また、イベント証拠は可変長セグメントを形成し、ETMが次の境界状態、持続時間、累積報酬を予測する。これにより、マネージャーはプリミティブ想像地平線を超えた可変長の継続を学習でき、ワーカーはプリミティブステップのactor-critic学習を維持する。

4. どうやって有効だと検証した?

SurRoLベースのPegTransferタスクで検証し、成功率98.7%を達成。フラットなGAS DreamerV3ベースラインを22.7パーセントポイント上回った。

5. 議論はある?

要旨からは、提案手法の限界や議論についての詳細は不明。ただし、タスク固有の手動指定ステージと比較して、学習されたイベント構造がより柔軟である可能性が示唆されるが、他のタスクや環境での汎用性については要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されているGAS DreamerV3ベースライン、および関連する世界モデル手法(DreamerV3など)や階層的強化学習手法(HRL)が挙げられる。また、SurRoLシミュレータに関する論文も関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Shuzhe Zhang, Xin Zhu, Yinling Qian, Qiong Wang

分類: cs.RO, eess.SY

原文アブストラクト

Long-horizon surgical robot manipulation is challenging because task rewards are sparse, while meaningful interaction changes occur at irregular intervals. Existing world-model agents typically imagine at primitive-step resolution, leaving variable-duration task progress implicit. Manually specified stages can provide intermediate structure, but their task specific boundaries are difficult to align with state-dependent interaction transitions. We propose S2-HWM, a Sparse Event-Structured Hierarchical World Model that learns sparse event evidence from primitive latent trajectories to coordinate an event-level manager and a primitive-step worker. The event evidence schedules manager goal updates, and each selected latent goal conditions the worker's primitive actions until the next update. The learned event evidence also forms variable-duration segments for an Event Transition Model (ETM), which predicts the next?boundary stochastic state, segment duration, and accumulated segment reward. Chaining these event-level predictions provides a variable-duration continuation beyond the primitive imagination horizon for manager learning, while the worker retains primitive-step actor-critic learning. On a SurRoL-based PegTransfer task, S2-HWM achieves a success rate of 98.7%, outperforming the flat GAS DreamerV3 baseline by 22.7 percentage points.