Shuhong Zheng
収録論文 5本 ・ フィジカルAI/ロボット学習
3D再構成3D/4D生成拡散モデル3Dシーン理解
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 良いトークンの狩り方:視覚幾何学トランスフォーマーにおけるトークン選択の手引き3D再構成2026/5/1
視覚幾何学トランスフォーマーの計算コストを削減するため、フレーム間・フレーム内の2段階でトークンを選択する手法を提案し、精度を保ちつつ85%以上の高速化を実現した。
- 追跡・修復・再スプラット:被写体駆動型3D/4D生成のための漸進的テクスチャ補完3D/4D生成2025/10/1
既存の3D生成モデルが作った3Dアセットに対し、動画トラッキングで修正領域を特定し、被写体駆動型の2Dインペインティングで段階的に補完した後、再スプラッティングで3Dに戻すことで、特定被写体の同一性を保った3D/4D生成を実現する手法を提案。
- Diff-2-in-1:拡散モデルによる生成と高密度知覚の橋渡し拡散モデル2024/11/1
拡散モデルの脱ノイズ過程を活用し、マルチモーダルデータ生成と高密度視覚知覚を同時に扱う統合フレームワークを提案。生成データを自己改善学習に用いることで、様々な知覚バックボーンの性能を向上させる。
- Lexicon3D: 複雑な3Dシーン理解のための視覚基盤モデルを探る3Dシーン理解2024/9/1
画像・動画・3Dの視覚基盤モデル7種を4つの3Dシーン理解タスクで比較評価し、各モデルの強みと弱みを明らかにした研究。
- 3D-LLM: Injecting the 3D World into Large Language Models2023/7/1