日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
動画生成/物理推論arXiv:2610.01162

PhysicsLENS:動画生成モデルにおける物理的性質の盲目性を診断する

PhysicsLENS: Diagnosing Physical Property Blindness in Video Generation Models

シェア:XThreadsFacebookLINEはてブBluesky

ロボット動画生成モデルが、重さや摩擦などの視覚的に隠れた物理的性質を無視しているかを評価するデータセットとベンチマークを提案し、見た目がもっともらしい動画でも指定された物理的性質を無視する傾向があることを示した。

詳しい要約

1. どんなもの?

- ビデオ生成モデルが物理的性質を無視する問題を診断するためのデータセットとベンチマーク「PhysicsLENS」を提案。 - ロボティクスに基づく物理的性質の妥当性を評価する。 - 同じ条件フレームとタスクを持ちながら、シーン記述で物理を変化させたマッチしたシナリオペアを使用。 - 公開ロボットビデオから収集し、衝突、重力、運動量、摩擦、変形、流体、因果性の7領域で注釈付け。 - 4つのビデオ生成モデルを評価し、400以上の人間注釈ラベルを生成。

2. 先行研究と比べてどこがすごい?

- 既存のビデオ生成ベンチマークは、視覚的に隠れた物理(重さ、粘性、摩擦など)を除外している。 - そのため、ビデオモデルは物理の忠実性ではなく、物理の基礎的な正確性で評価されていた。 - PhysicsLENSは、ロボティクスに基づく物理的性質の妥当性を評価する点で新しい。 - マッチしたシナリオペアを用いることで、物理の変化を制御して評価できる。

3. 技術・手法の肝は?

- 同じ条件フレームとタスクを持ち、シーン記述で物理を変化させたマッチしたシナリオペアを使用。 - 公開ロボットビデオからシナリオを収集し、7つの物理領域で注釈付け。 - 4つのビデオ生成モデルを評価し、400以上の人間注釈ラベルを生成。 - 物理的性質を記述することで、生成ビデオの妥当性がどう変化するかを分析。

4. どうやって有効だと検証した?

- 4つのビデオ生成モデルを評価し、400以上の人間注釈ラベルを生成。 - 結果、見た目が妥当なビデオはしばしば記述された性質を無視している(47中34)。 - 性質を記述しても妥当性はわずかに低下するだけで、有意ではない。

5. 議論はある?

- 見た目が妥当なビデオが記述された物理的性質を無視する傾向がある。 - 性質を記述しても妥当性の低下はわずかで有意ではない。 - ビデオ生成モデルが物理的性質を正確に反映していない可能性を示唆。 - ロボティクスにおける信頼性に課題。

6. 次に読むべき論文は?

- 要旨からは不明(参照/比較されている研究が明記されていないため)。同分野の定番として、ビデオ生成モデル(例:Video Diffusion Models, Imagen Video, Phenakiなど)や物理ベースのベンチマーク(例:Physion, IntPhysなど)が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Isaiah Milkey, Som Sagar, Aditya Taparia, Xinyuan Liu, Jiqing Wen, Ransalu Senanayake

分類: cs.CV, cs.RO

原文アブストラクト

Reliable video world models could provide scalable predictive environments for robot learning, planning, and evaluation. However, generated robot videos can violate physical principles and complete tasks through physically implausible behavior, limiting their reliability for robot learning and planning. Current video-generation benchmarks exclude physics that are inherently hidden by visuals (e.g., weight, viscosity, friction). Due to this, video models are evaluated on the fidelity of physics, not the underlying accuracy of physics. We introduce PhysicsLENS, a dataset and benchmark for evaluating plausibility of physical properties grounded in robotics. PhysicsLENS uses matched scenario pairs that hold the same conditioning frame and task, while varying underlying physics in the scene description. Scenarios are curated from public robot video sources and annotated across seven physical domains: collision, gravity, momentum, friction, deformation, fluid, and causality. We evaluate across four video generation models, producing over 400 human-annotated labels. Results show that plausible-looking videos often ignore the stated property (34 of 47), and that stating the property lowers plausibility only slightly and not significantly.

関連論文

PR本紙発行元 EmplifAI