日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
マニピュレーションarXiv:2609.18685

WeaveRL:知覚的強化学習のためのシーン認識型ファブリックへの再構成の織り込み

WeaveRL: Weaving Reconstruction into Scene-Aware Fabrics for Perceptive Reinforcement Learning

シェア:XThreadsFacebookLINEはてブBluesky

GPU加速により数千の並列シミュレーションでシーンをサーフェルとして再構成し、センサ由来の幾何情報に基づく衝突回避型強化学習を実現した。複雑な操作タスクで性能とsim-to-real転移、未知障害物への堅牢性を向上。

詳しい要約

1. どんなもの?

- ロボットの複雑なマニピュレーションのための強化学習(RL)手法。 - 衝突回避コントローラ(geometric fabrics)上で学習するが、従来は静的な手指定のシーン表現に依存。 - 本研究では、GPU加速により数千の並列シミュレーションインスタンスでアクティブロールアウト中にシーンをsurfelの集合として再構成。 - これにより、手指定ではなくセンサ由来のジオメトリ上でポリシーを操作可能に。 - 衝突が密集したタスク群で、surfel fabricsがプリミティブベースのベースラインが失敗する複雑なシーンに対処し、sim-to-real転送も維持。 - テスト時に新しいジオメトリが導入されても、シーン認識ファブリックで学習したポリシーはより堅牢で、未見障害物下での衝突なしタスク完了率が35%から61%に向上。 - 再構成システム、トレーニングコード、テストデータセットを公開。

2. 先行研究と比べてどこがすごい?

- 従来のgeometric fabricsは静的で手指定のシーン表現に依存していた。 - 本研究はアクティブなオンライン3D知覚を大規模並列RLトレーニングに統合。 - これにより、手指定ではなくセンサ由来のジオメトリ上でポリシーが動作可能に。 - プリミティブベースのベースラインが失敗する幾何学的に複雑なシーンに対処可能。 - テスト時の新規ジオメトリに対する堅牢性が向上(未見障害物下での衝突なしタスク完了率35%→61%)。

3. 技術・手法の肝は?

- GPU加速により、数千の並列シミュレーションインスタンスでアクティブロールアウト中にシーンをsurfelの集合として再構成。 - この再構成により、ポリシーがセンサ由来のジオメトリ上で動作可能。 - 衝突回避コントローラ(geometric fabrics)上で強化学習を行う。 - シーン認識ファブリック(surfel fabrics)を学習に利用。

4. どうやって有効だと検証した?

- 衝突が密集したマニピュレーションタスク群で評価。 - surfel fabricsがプリミティブベースのベースラインが失敗する複雑なシーンに対処できることを確認。 - sim-to-real転送を維持することを確認。 - テスト時に新しいジオメトリを導入し、未見障害物下での衝突なしタスク完了率が35%から61%に向上することを検証。

5. 議論はある?

- 要旨からは不明。

6. 次に読むべき論文は?

- geometric fabrics(衝突回避コントローラ) - プリミティブベースのベースライン - surfelベースのシーン再構成手法

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Remo Steiner, Vikram Ramasamy, David Tingdahl, Sam Mady, Karl Van Wyk, Nathan Ratliff, David Recasens Lafuente, Soha Pouya, Tuur Stuyck, Alex Millane

分類: cs.RO

原文アブストラクト

Reinforcement learning allows robots to acquire complex skills, but producing policies for geometrically complex manipulation remains difficult. A promising approach is to learn on top of collision-avoidant controllers, such as geometric fabrics. However, these approaches have relied on static, hand-specified representations of the scene. Integrating active, online 3D perception into massively parallel RL training has so far been inaccessible. We introduce a GPU-accelerated method that reconstructs the scene as a collection of surfels across thousands of parallel simulation instances during active rollouts. This lets policies operate over sensor-derived, rather than hand-specified, geometry. On a suite of collision-dense manipulation tasks, our surfel fabrics enable policies to tackle geometrically complex scenes where primitive-based baselines fail, while maintaining sim-to-real transfer. Furthermore, policies learned with a scene-aware fabric are more robust to the introduction of novel geometry at test time, improving collision-free task completion under unseen obstacles from 35% to 61%. We release our reconstruction system, training code and test dataset to spur research in this direction.

関連論文

PR本紙発行元 EmplifAI