日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
3Dシーン生成arXiv:2604.10772

HOG-Layout: 視覚言語モデルによる階層的3Dシーン生成・最適化・編集

HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models

シェア:XThreadsFacebookLINEはてブBluesky

大規模言語モデルと視覚言語モデルを用いて、テキストから階層的に3Dシーンを生成・最適化・編集する手法を提案した。物理的整合性と意味的一貫性を向上させ、リアルタイム編集を実現する。

著者: Haiyan Jiang, Deyu Zhang, Dongdong Weng, Weitao Song, Henry Been-Lirn Duh

分類: cs.CV

原文アブストラクト

3D layout generation and editing play a crucial role in Embodied AI and immersive VR interaction. However, manual creation requires tedious labor, while data-driven generation often lacks diversity. The emergence of large models introduces new possibilities for 3D scene synthesis. We present HOG-Layout that enables text-driven hierarchical scene generation, optimization and real-time scene editing with large language models (LLMs) and vision-language models (VLMs). HOG-Layout improves scene semantic consistency and plausibility through retrieval-augmented generation (RAG) technology, incorporates an optimization module to enhance physical consistency, and adopts a hierarchical representation to enhance inference and optimization, achieving real-time editing. Experimental results demonstrate that HOG-Layout produces more reasonable environments compared with existing baselines, while supporting fast and intuitive scene editing.

関連論文