Xu Zheng
収録論文 9本 ・ フィジカルAI/ロボット学習
LLMエージェント空間推論セグメンテーション/ドメイン適応親和性予測VLAセグメンテーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 軌跡グラフを活用したエージェント型LLMシステムの実行前エラー診断LLMエージェント2026/7/29
LLMエージェントの長期的なタスクにおけるエラーを事前に診断するため、過去の軌跡を確率的グラフとしてモデル化し、グラフニューラルネットワークで失敗に繋がる行動パターンを特定するフレームワークを提案した。
- OmniCoT:グローバルかつ多段階のパノラマ推論のためのベンチマーク空間推論2026/6/29
パノラマ画像におけるマルチモーダル大規模言語モデルの空間推論能力を評価・向上させるため、グローバルな証拠と多段階推論に焦点を当てたベンチマークOmniCoTを提案し、訓練データと評価データを整備した。
- SpaMEM: 身体化環境における知覚-記憶統合による動的空間推論のベンチマーク空間推論2026/4/24
マルチモーダル大規模言語モデルの身体化環境での長期的空間推論能力を評価する大規模ベンチマークSpaMEMを提案し、行動系列による空間状態変化を伴うタスクでモデルの限界を明らかにした。
- 視野を超えて:外挿型ドメイン適応パノラマセグメンテーションセグメンテーション/ドメイン適応2026/3/1
局所視点画像で学習し、360度パノラマ画像でテストする外挿型ドメイン適応セグメンテーション手法を提案。視野の幾何学的ずれと未知クラスの意味的不確実性を扱う。
- パノラマ親和性予測親和性予測2026/3/1
360度画像を用いた親和性予測の新タスクを提案し、大規模データセットPAP-12Kと訓練不要のパイプラインPAPを導入した。
- PhysToolBench:マルチモーダル大規模言語モデルの物理ツール理解を評価するベンチマークVLA2025/10/1
MLLMが物理ツールをどれだけ理解しているかを評価する初のVQAベンチマークを構築し、32モデルを評価した結果、ツール理解に大きな欠陥があることを明らかにした。
- 制約からの解放:ソースフリー遮蔽認識シームレスセグメンテーションセグメンテーション2025/6/1
ソースデータやラベルなしで全景画像のセグメンテーションを行う新しいタスクSFOASSを提案し、UNLOCKという手法で360度視点と遮蔽認識を実現した。
- 言語ガイダンスでSAM2を活用するRGB-熱画像セマンティックセグメンテーションセグメンテーション2025/3/1
大規模学習済みのSAM2を言語ガイダンスで適応させ、RGBと熱画像の融合セグメンテーションを高精度化するSHIFNetを提案。
- Chasing Day and Night: Towards Robust and Efficient All-Day Object Detection Guided by an Event Camera2023/9/1