日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
動画生成/マニピュレーションarXiv:2610.01092

Ego2Act: 一人称視点動画生成における目標指向マニピュレーションの評価

Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation

シェア:XThreadsFacebookLINEはてブBluesky

一人称視点の動画生成モデルが、高レベルの目標から多段階の物体操作をどれだけ現実的にシミュレートできるかを評価するベンチマークEgo2Actと、参照不要の評価器Ego2ActJudgeを提案した。

詳しい要約

1. どんなもの?

- 一人称視点の動画生成モデルを評価するベンチマーク Ego2Act を提案。 - 110 の実世界タスクからなる 2,640 本の動画を含み、日々の環境・物体の混雑度・多段階の複雑さが異なる。 - 初期シーン画像と高レベル目標を与え、手が物体を操作してタスクを遂行する現実的な一人称動画を生成できるかを評価する。 - 参照不要の評価パイプライン Ego2ActJudge も導入。

2. 先行研究と比べてどこがすごい?

- 既存ベンチマークは単一の短い行動や段階的指示に焦点を当てており、多段階の物理推論が未探索だった。 - Ego2Act は高レベル目標を達成するために複数の実世界操作を計画・実行する一人称動画生成を評価対象とする点で新しい。 - Ego2ActJudge は参照不要で、関連ベースラインよりもタスク完了と物理的妥当性の評価で人間の合意との整合性が高い。

3. 技術・手法の肝は?

- 初期シーン画像と高レベル目標を入力とし、手による物体操作の一人称動画を生成させる。 - タスクは 110 の実世界タスク、2,640 本の動画で構成され、物体の混雑度や多段階複雑性を変化させる。 - 評価には参照不要の Ego2ActJudge パイプラインを用い、タスク完了と物理的妥当性を評価する。

4. どうやって有効だと検証した?

- Ego2ActJudge が関連ベースラインと比較して、タスク完了と物理的妥当性の評価で人間の合意との整合性が高いことを示した。 - 生成モデルのシミュレーションを評価し、段階のスキップや部分実行、後続段階の依存状態欠如、目標未達成などの失敗を明らかにした。 - 複雑な物体操作や持続的な世界モデリングにおける細粒度の物理ダイナミクスで一貫した失敗を確認した。

5. 議論はある?

- モデルは多段階タスクで段階をスキップまたは部分的に実行し、後続段階に必要な依存状態が欠落して目標が未達成になる。 - 複雑な物体操作や持続的な世界モデリングなど、細粒度の物理ダイナミクスで一貫して失敗する。 - Ego2Act が物理的に妥当で目標指向のシミュレーションへ向けた厳密なテストベッドとなることを期待。

6. 次に読むべき論文は?

- 要旨で参照・比較されている研究は明示されていない。 - 同分野の定番として、一人称視点の動画生成モデル、embodied planning のための world simulator、参照不要の動画評価手法に関する研究が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Patrick Amadeus Irawan, Iskandar Muda Rizky Parlambang, Rava Maulana, Qinrong Cui, Erland Hilman Fuadi, Zayd M. K. Zuhri, Nanda Ryaas Absar, Ahmed Elshabrawy, Wilfried Ariel Mulyawan, Shoubin Yu, Yue Zhang, Mohit Bansal, Alham Fikri Aji

分類: cs.CV

原文アブストラクト

Video generation models are increasingly being explored as world simulators for embodied planning and learning. To do so effectively, these models must not only generate visually appealing frames, but also predict how environments dynamically evolve when executing goal-directed actions. While evaluating these capabilities is crucial, existing benchmarks focus mainly on single short actions or step-by-step instructions. This leaves multi-step physical reasoning underexplored, especially in egocentric video generation that requires planning to simulate proper execution to accomplish high-level goals by carrying out multiple real-world manipulations. We introduce Ego2Act, a goal-directed benchmark featuring 2,640 videos from 110 real-world tasks across day-to-day settings, varying object clutter and multi-step complexity. Given an initial scene image and a high-level goal, Ego2Act evaluates whether video generation models can produce realistic egocentric videos of a hand manipulating objects to carry out the task. To support scalable evaluation, we also introduce Ego2ActJudge, a reference-free evaluation pipeline that achieves better task completion and physics plausibility evaluation alignment with human consensus compared to relevant baselines. Our findings reveal that models' generated simulations often skip or partially execute steps, leaving later steps missing dependent states, which leads to unfulfilled goal. Furthermore, models consistently fail at fine-grained physical dynamics, particularly during complex object manipulation and persistent world modeling. We hope Ego2Act provides a rigorous testbed for advancing video models toward physically plausible, goal-directed simulation.

PR本紙発行元 EmplifAI