日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
3D再構成arXiv:2608.27407

大規模再構成モデルを用いた人と物体のインタラクション再構成

Reconstructing Humans and Objects in Interaction using Large Reconstruction Models

シェア:XThreadsFacebookLINEはてブBluesky

単一画像から人と物体の3Dインタラクションを再構成するフレームワークMILOを提案。大規模再構成モデル(LRM)の幾何学的特性を活用し、従来法より高精度な再構成を実現。

詳しい要約

1. どんなもの?

MILOは、単一画像から3DのHuman-Object Interaction (3D HOI)を再構成するフレームワーク。Large Reconstruction Models (LRMs)の視覚能力を活用し、LRMが生成するメッシュを人間と物体に分割し、パラメトリックな人体モデルと物体テンプレートをフィッティングすることで、相互作用の詳細な3D再構成を実現する。

2. 先行研究と比べてどこがすごい?

既存手法は主に再投影と接触制約を用いてパラメトリックな人体モデルと物体テンプレートを2D画像にフィッティングするが、MILOはLRMが提供する幾何学的な足場を利用し、相対的な人間と物体の配置や近接の手がかりを保持することで、再構成手順を単純化し、深度の曖昧さやオクルージョン、物体形状の多様性に対処する。

3. 技術・手法の肝は?

MILOの肝は、LRMメッシュを解釈することにある。具体的には、LRMメッシュを人間と物体のコンポーネントにセグメンテーションし、人間部分にはパラメトリックなボディモデルをフィッティングし、物体部分には(テンプレートが利用可能な場合)物体テンプレートをオプションで整列させる。これにより、再構成問題をLRMメッシュの解釈として再構成する。

4. どうやって有効だと検証した?

複数のベンチマークと相互作用シナリオにわたって、既存のベースラインと比較して強い再構成精度を達成し、優れていることを検証した。

5. 議論はある?

要旨からは、物体テンプレートが利用できない場合の扱いや、LRMのメッシュ品質への依存性、計算コストなどに関する議論は不明。また、単一画像からの再構成に焦点を当てており、複数視点や動的な相互作用への拡張については言及されていない。

6. 次に読むべき論文は?

要旨で参照されている既存手法(再投影と接触制約を用いたパラメトリックモデルフィッティング手法)や、Large Reconstruction Models (LRMs)の関連研究が挙げられる。具体的には、3D HOI再構成のベースライン手法や、LRMの基盤となるモデル(例:LRMの元論文)が該当する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Agniv Chatterjee, Georgios Pavlakos

分類: cs.CV

原文アブストラクト

Estimation of Human-Object Interactions in 3D (3D HOI) is a fundamental problem in 3D computer vision with applications in AR/VR, robotics, and embodied AI. However, reconstructing these interactions in 3D remains challenging due to depth ambiguities, occlusions, and object shape variability. Existing approaches are primarily concerned with reprojection and contact constraints, fitting parametric human models and object templates to 2D images. In this paper, we explore a different avenue. We present MILO, a framework that leverages the visual capabilities of Large Reconstruction Models (LRMs) to recover detailed 3D human-object interactions from a single image. Our key observation is that LRMs provide a powerful geometric scaffold that preserves relative human-object arrangement and proximity cues. This significantly simplifies the reconstruction procedure, reframing the problem as interpreting the LRM mesh: we segment it into human and object components, fit a parametric body model to the human part, and optionally align an object template to the object part (if such a template is available). MILO achieves strong reconstruction accuracy and outperforms existing baselines across multiple benchmarks and interaction scenarios. Our code is available at https://ac5113.github.io/MILO.

関連論文