Sixiao Zheng
収録論文 2本 ・ フィジカルAI/ロボット学習
3D視覚グラウンディングVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LLM駆動の空間推論によるオープンボキャブラリ3D視覚グラウンディングのためのニューラル表現フレームワーク3D視覚グラウンディング2025/7/1
大規模言語モデルで言語クエリの空間関係を推論し、視覚特性を強化した階層的特徴場を構築することで、自由記述の指示から3D空間内の対象物体を高精度に特定する手法を提案。
- TriVLA: エピソード的世界モデリングを備えた三システム統合型視覚-言語-行動モデルによる汎用ロボット制御VLA2025/7/1
エピソード記憶の概念を取り入れ、VLMによるマルチモーダル理解と動画拡散モデルによる時系列予測、フローマッチングによる行動生成を統合した三システム構成のVLAモデルを提案し、実世界のマニピュレーションタスクで高い性能を示した。