日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
手の動き復元arXiv:2608.20308v2

ACE-Ego-Hand: ビデオ拡散モデルを転用した、遮蔽に頑健な自己中心視点3D手の動き復元

ACE-Ego-Hand: Repurposing Video Diffusion Models for Occlusion-Robust Egocentric 3D Hand Motion Recovery

シェア:XThreadsFacebookLINEはてブBluesky

ビデオ拡散モデルを決定的な幾何エンコーダとして転用し、遮蔽やフレーム外の手も含めた3D手の軌跡を単一パスで復元する新しいフレームワークDreamHandを提案。5つのベンチマークでSOTAを達成し、特に遮蔽の多いデータで誤差を大幅削減。

詳しい要約

1. どんなもの?

本論文は、拡散モデルを利用した、オクルージョンに頑健な自己中心視点の3Dハンドモーションリカバリ手法を提案する。従来の単一フレームやウィンドウベースの回帰手法は、手がフレームから外れると失敗するが、提案手法はビデオ拡散モデルを決定論的なジオメトリエンコーダとして再利用し、クリーンな潜在表現への単一のフォワードパスで、オクルードやフレーム外の手を含むシーンコンテンツを抽出する。オフラインのクリップレベルフレームワークであるDreamHandは、Deterministic Clean-Latent EncoderとBidirectional Spatiotemporal Decoderを用いて、連続的な両手の軌跡をメトリック配置で復元し、外部検出器を必要としない。また、Ray-Based Camera Solverにより、テスト時のカメラ内部パラメータを必要としない設定もサポートする。

2. 先行研究と比べてどこがすごい?

既存の単一フレームやウィンドウベースの時間回帰手法は、手がフレームから外れると失敗する。また、最近のビデオ拡散モデルは、ピクセル空間のレンダラーとして重く確率的な多段階サンプリングに依存する。提案手法は、VDMを決定論的なジオメトリエンコーダとして再利用することで、単一のフォワードパスでオクルードやフレーム外の手を扱える点が新しい。さらに、外部検出器やテスト時のカメラ内部パラメータを必要としない点も優れている。

3. 技術・手法の肝は?

手法の肝は、ビデオ拡散モデルを決定論的なジオメトリエンコーダとして再利用すること。具体的には、クリーンな潜在表現への単一のフォワードパスで、現在の観測を超えたシーンコンテンツを抽出する。抽出した特徴は、Bidirectional Spatiotemporal Decoderでデコードされ、連続的な両手の軌跡をメトリック配置で復元する。また、Ray-Based Camera Solverにより、テスト時のカメラ内部パラメータを必要としない設定を実現する。

4. どうやって有効だと検証した?

5つの自己中心視点ベンチマークで評価し、新しいSOTAを達成。オクルージョンが多いARCTICでMPJPE-pを30%、HOT3Dで40%削減。フレーム外の手を含む評価では、改善率は46%から61%に達した。

5. 議論はある?

要旨からは、提案手法の限界や議論についての詳細は不明。ただし、オフラインのクリップレベルフレームワークであるため、リアルタイム適用には課題がある可能性が考えられる。また、ビデオ拡散モデルをエンコーダとして再利用する際の計算コストや、他のタスクへの適用可能性については議論の余地がある。

6. 次に読むべき論文は?

要旨で参照されている研究は明示されていないが、関連する分野として、ビデオ拡散モデル(Video Diffusion Models)、自己中心視点のハンドトラッキング、オクルージョンロバストな3Dハンドリカバリの研究が挙げられる。具体的には、HOT3DやARCTICデータセットを用いた研究や、拡散モデルを利用した3Dハンドリカバリの先行研究を読むことが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Yufei Liu, Xixi Wang, Hao Li, Ganlong Zhao, Kaitong Cai, Chengkai Jin, Chunxiao Liu, Jianbo Liu, Siyuan Huang, Xingang Pan, Hongsheng Li

分類: cs.CV

原文アブストラクト

Egocentric video offers scalable manipulation data for embodied AI, yet recovering metric 3D hand trajectories remains challenging due to severe object occlusion and frequent out-of-sight gaps. Existing single-frame and windowed temporal regressors fail when a hand shortly leaves the frame, while recent video diffusion models (VDMs) rely on heavy, stochastic multi-step sampling as pixel-space renderers. We instead repurpose VDM into a deterministic geometry encoder. A single forward pass over the clean latent exposes scene content beyond current observations, including occluded and out-of-sight hands. We introduce DreamHand, an offline clip-level framework that extracts features via a Deterministic Clean-Latent Encoder and decodes them with a Bidirectional Spatiotemporal Decoder. DreamHand recovers continuous bimanual trajectories with metric placement and no external detector, while a Ray-Based Camera Solver supports a second configuration that requires no test-time camera intrinsics. Across five egocentric benchmarks, DreamHand sets a new state of the art, cutting MPJPE-p by 30% on occlusion-heavy ARCTIC and 40% on HOT3D. These gains reach 46%-61% once out-of-sight hands are included in the evaluation, offering a scalable path from everyday human video to robot manipulation data.