日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
シーン生成arXiv:2608.18840

配置と可動性を超えて:身体化インタラクションのための使用駆動型コードシーン

Beyond Placement and Articulation: Usage-Driven Code Scenes for Embodied Interaction

シェア:XThreadsFacebookLINEはてブBluesky

室内シーン生成において、物体の配置や可動性だけでなく、機能的な使用法をモデル化するフレームワークRoomWrightを提案。各アンカーをタスク中心とし、必要な物体とそのアフォーダンスを推論し、コードエージェントがインタラクションをトリガー・条件・効果のルールにコンパイルして因果関係を更新する。

詳しい要約

1. どんなもの?

RoomWrightは、身体性インタラクションのための3Dシーンをコードとして生成するエージェントベースのフレームワーク。従来のコードベースシーン生成が視覚的構築とオブジェクトレベルの関節に焦点を当てていたのに対し、シーンの機能的用途をモデル化する。各アンカーをタスク中心として扱い、タスクに必要なオブジェクトとそのaffordanceを考慮するusage-driven object reasoningを実行する。また、コードエージェントが各インタラクションをtrigger, condition, effectルールにコンパイルし、オブジェクト間の因果依存関係を捉える。さらに、操作対象の向きの曖昧さをannotation-informed usage-guided orientationで緩和する。生成されたシーンは実行可能で、編集可能、シミュレーション対応であり、embodied AIやポリシー学習のためのインタラクティブな環境を提供する。

2. 先行研究と比べてどこがすごい?

先行研究のコードベースシーン生成手法は、視覚的構築とオブジェクトレベルの関節に焦点を当てており、シーンの機能的用途がモデル化されていなかった。RoomWrightは、シーンの機能的用途を明示的にモデル化し、タスク中心のオブジェクト推論とインタラクションの因果ルールを導入することで、このギャップを埋める。また、操作対象の向きの曖昧さを扱う点も新しい。

3. 技術・手法の肝は?

手法の肝は、usage-driven object reasoningとコードエージェントによるインタラクションのコンパイル。各アンカーをタスク中心とし、タスクに必要なオブジェクトとそのaffordanceを推論する。コードエージェントは各インタラクションをtrigger, condition, effectルールに変換し、オブジェクトの状態を更新して因果依存関係を捉える。さらに、annotation-informed usage-guided orientationにより、操作対象の向きを決定する。

4. どうやって有効だと検証した?

広範な実験により有効性を検証した。具体的な評価指標や比較対象は要旨からは不明だが、生成されたシーンが実行可能で、編集可能、シミュレーション対応であることを示し、embodied AIやポリシー学習に有用であることを実証した。

5. 議論はある?

要旨からは、議論の余地や限界についての具体的な言及は不明。ただし、操作対象の向きの曖昧さをannotation-informedで緩和する点は、アノテーションに依存する可能性があり、そのコストや一般化に関する議論が考えられる。また、生成されたシーンの複雑さやスケーラビリティに関する議論も想定されるが、要旨には記載がない。

6. 次に読むべき論文は?

要旨で参照されている先行研究は明示されていないが、コードベースのシーン生成手法(例: CodeIt, SceneCraftなど)や、embodied AIのためのシーン合成に関する研究が関連する。また、affordance学習やインタラクションの因果モデリングに関する研究も関連する。具体的には、要旨の「Recent code-based scene generation methods」に該当する論文を読むことが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Zijian Xiao, Zipeng Ye, Jinkun Hao, Xiong Yang, Yuchen Xie, Ran Yi

分類: cs.RO, cs.CV

原文アブストラクト

Indoor scene synthesis provides essential environments for embodied AI, robotic manipulation, and simulation-based policy learning. Recent code-based scene generation methods produce editable and extensible environments, yet they remain focused on visual construction and object-level articulation, leaving the functional usage of scenes largely unmodeled. To address this problem, we present RoomWright, an agentic usage-driven framework for generating 3D scenes represented entirely as code for embodied interaction. RoomWright performs usage-driven object reasoning, which treats each anchor as a task centre and admits task-required objects and their affordances. A code agent further enables multi-part interaction by compiling each interaction into a trigger, condition, effect rule that updates structured object states, capturing causal dependencies across objects. Moreover, since manipuland orientation is ambiguous and hard to recover from pixels, RoomWright alleviates this via annotation-informed usage-guided orientation. Extensive experiments demonstrate the effectiveness of our method. The resulting scenes are executable, editable, and simulation-ready, providing interactive environments for embodied AI and policy learning.

関連論文