日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
レイアウト生成arXiv:2608.01106

SG-Layout: LLMを用いた構造化シーングラフ誘導レイアウト生成

SG-Layout: Structured Scene Graph-Guided Layout Generation with LLMs

シェア:XThreadsFacebookLINEはてブBluesky

自然言語から空間的に一貫したレイアウトを生成するため、シーングラフの構造知識をLLMに明示的に組み込むフレームワークSG-Layoutを提案した。

詳しい要約

1. どんなもの?

SG-Layoutは、自然言語から空間的に整合性のあるレイアウトを生成するためのフレームワークである。LLMに構造化された空間知識を明示的に組み込むことで、オブジェクト間の幾何学的関係や構造的依存関係の理解を向上させる。2段階のトレーニングパラダイムを採用し、画像レイアウト生成、屋内シーン合成、ロボット物体再配置タスクで評価されている。

2. 先行研究と比べてどこがすごい?

既存のLLMは自然言語からレイアウトを生成する際、明示的な幾何学的関係や構造的依存関係を捉えるのが難しい。SG-Layoutは、シーングラフを利用して構造化された空間知識をLLMに明示的に組み込む点で優れている。また、グラフ言語特徴アライメントとLoRAベースの命令チューニングにより、バックボーンを凍結したまま効率的に微調整できる。

3. 技術・手法の肝は?

手法の肝は、2段階のトレーニングパラダイムにある。第1段階では、リレーショナルグラフエンコーダとプロジェクタを訓練し、シーングラフの埋め込みをLLMの言語空間にマッピングする。第2段階では、LoRAベースのアダプタを用いて命令駆動のレイアウト生成のための効率的な微調整を行い、バックボーンは凍結したままにする。

4. どうやって有効だと検証した?

画像レイアウト生成、屋内シーン合成、ロボット物体再配置の3つのタスクで評価した。実験結果は、SG-Layoutがコンパクトなオープンソースのバックボーンと比較して、空間推論の精度と幾何学的整合性を向上させることを示した。特に、関係が密集し、構成的に複雑なシーンで明確な利点が見られた。

5. 議論はある?

要旨からは、SG-Layoutの限界や潜在的な欠点についての議論は不明である。また、他の手法との比較や、実世界の応用における課題についても言及がない。

6. 次に読むべき論文は?

要旨で参照されている研究は明示されていないが、関連する手法として、シーングラフ生成やLLMを用いたレイアウト生成の研究が考えられる。具体的には、シーングラフを利用した画像生成や、LLMの空間推論能力を向上させる研究が関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Junsheng Wang, Chao Chen, Mengying Xie, Mingyan Li, Fuqiang Gu

分類: cs.CV, cs.AI

原文アブストラクト

Understanding and generating spatially coherent layouts from natural language remains a fundamental yet challenging task for large language models (LLMs). Existing LLMs often struggle to capture explicit geometric relationships and structural dependencies between objects. To address this issue, we propose SG-Layout, a graph-guided layout generation framework that explicitly incorporates structured spatial knowledge into LLMs. SG-Layout follows a two-stage training paradigm: (1) a graph-language feature alignment stage, where a relational graph encoder and a projector are trained to map scene-graph embeddings into the LLM's linguistic space; and (2) an instruction tuning stage, where LoRA-based adapters enable efficient fine-tuning for instruction-driven layout generation while keeping the backbone frozen. We evaluate SG-Layout on image layout generation, indoor scene synthesis and robotic object rearrangement tasks. Experimental results show that SG-Layout improves spatial reasoning accuracy and geometric consistency over the compact open-source backbone, with particularly clear advantages in relation-dense and compositionally complex scenes. These results highlight the effectiveness of graph-structured feature alignment for enhancing controllable layout generation.