日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
幾何知覚arXiv:2608.27497v1

相対幾何を超えて:ロボットのためのメトリック認識幾何知覚

Beyond Relative Geometry: Metric-Aware Geometry Perception for Robotics

シェア:XThreadsFacebookLINEはてブBluesky

ロボットの操作に必要な実世界スケールの幾何再構成を実現する、プラグアンドプレイのフレームワークMAGPを提案。カメラパラメータと深度観測からメトリック幾何を再構成し、絶対誤差を大幅に削減する。

詳しい要約

1. どんなもの?

本論文は、ロボット操作のためのメトリック(実スケール)な幾何再構成を実現するフレームワーク Metric-Aware Geometry Perception (MAGP) を提案する。既存の再構成手法は相対的な幾何のみを再構成し、スケールが任意であるため、物体の寸法や空間距離がシーンや視点、入力構成によって変動し、実世界スケールで定義されるロボットのアクションと直接整合しない。MAGP はカメラパラメータと深度観測からメトリック幾何を再構成するエンドツーエンドのプラグアンドプレイ型フレームワークであり、ロボットポリシーにシームレスに統合できる。

2. 先行研究と比べてどこがすごい?

先行研究の再構成手法は相対的な幾何のみを扱い、スケールの不整合が生じる。MAGP は Metric Scale Equivariant Augmentation により、カメラパラメータと深度観測からメトリックスケールを復元し、絶対誤差を 2.01m から 0.07m へと一桁以上削減する。また、Flexible Metric Conditioning により、任意の視点数とカメラ・深度入力の組み合わせをサポートし、異種のロボットセンサ構成に対するロバスト性を向上させる。これにより、シーンやセンシング条件をまたいで幾何的に一貫した再構成を実現し、ロボットポリシーの性能を向上させる点が優れている。

3. 技術・手法の肝は?

手法の核は2つの設計にある。1つ目は Metric Scale Equivariant Augmentation で、モデルがカメラパラメータと深度観測からメトリック幾何を再構成するよう促し、観測で指定されたメトリックスケールに従うことを保証する。2つ目は Flexible Metric Conditioning で、任意の視点数とカメラ・深度入力の組み合わせをサポートし、異種のロボットセンサ構成に対するロバスト性を向上させる。これらにより、幾何的に一貫した再構成を生成し、物体の寸法と空間距離を安定させる。

4. どうやって有効だと検証した?

ETH3D、MegaDepth、ScanNet++ のデータセットで評価し、相対幾何精度を維持しつつ絶対誤差を 2.01m から 0.07m へと一桁以上削減することを示した。また、複数のロボットポリシーに統合し、LIBERO、RoboTwin、ゼロショット LIBERO-Plus で性能が向上し、RoboTwin では最大 6.26% の改善を達成した。

5. 議論はある?

要旨からは、提案手法の限界や議論についての詳細は不明。ただし、メトリック幾何の再構成がロボット操作に有効であることを示す一方で、異なるセンサ構成やシーンでの一般化に関する議論が考えられる。また、絶対誤差の削減が相対精度に与える影響や、計算コスト、実ロボットへの適用時の課題などが議論の対象となり得るが、要旨には明記されていない。

6. 次に読むべき論文は?

要旨で参照されているデータセットは ETH3D、MegaDepth、ScanNet++、LIBERO、RoboTwin、LIBERO-Plus である。関連手法としては、既存の reconstruction methods が挙げられるが、具体的な論文名は不明。次に読むべき論文としては、これらのデータセットを提案した論文や、メトリック再構成に関する既存研究(例えば、Metric3D や ZoeDepth など)が考えられるが、要旨からは特定できない。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Fengjun Zhong, Congjia Chen, Zhaoxu Liu, Jinyang Du, Yuchen Gong, Enqi Mao, Ruihao Gong, ShuJie Wang, Xianglong Liu, Zhongliang Qiao

分類: cs.RO

原文アブストラクト

Recent embodied models increasingly leverage geometric representations to improve spatial reasoning and robotic manipulation. However, existing reconstruction methods only reconstruct relative geometry with arbitrary scales, causing predicted object dimensions and spatial distances to vary across scenes, viewpoints, and input configurations. This inconsistency prevents geometric perception from being directly aligned with robotic actions defined on the real-world scale. To address this limitation, we propose Metric-Aware Geometry Perception (MAGP), an end-to-end, plug-and-play framework for metric geometry reconstruction that can be seamlessly integrated into robotic policies. At its core, Metric Scale Equivariant Augmentation encourages the model to reconstruct metric geometry from camera parameters and depth observations, ensuring that the reconstructed geometry follows the metric scale specified by observations. Flexible Metric Conditioning further enables MAGP to support arbitrary view counts and combinations of camera and depth inputs, improving robustness to heterogeneous robotic sensing configurations. Together, these designs produce geometrically consistent reconstructions with stable object dimensions and spatial distances across scenes and sensing conditions. Experiments on ETH3D, MegaDepth, and ScanNet++ demonstrate that MAGP maintains strong relative geometry accuracy while reducing the absolute error by over an order of magnitude, from 2.01m to 0.07m. When integrated into multiple robotic policies, MAGP consistently improves performance on LIBERO, RoboTwin, and zero-shot LIBERO-Plus, with gains of up to 6.26% on RoboTwin. These results demonstrate the effectiveness and generalizability of metric geometry for robotic manipulation.