Xin Tan
収録論文 13本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Exemplar2VQA:マルチエージェントコーディングによる模範駆動型視覚質問応答生成フレームワークVLA2026/9/29
マルチエージェントコーディングにより、幾何学的ユーティリティを活用して大規模な空間QAデータを合成し、MLLMの空間知能を向上させるフレームワークを提案。
- GroupForward: インスタンスグループ化フィードフォワードガウシアンスプラッティングによる参照可能な3Dシーン構築3Dシーン理解2026/8/18
疎な多視点画像から3Dシーンの幾何・外観・インスタンス構造・意味を同時に再構成するフィードフォワード型の3Dガウシアンスプラッティングモデルを提案し、インスタンスグループ化により参照表現による複雑なシーン推論を可能にした。
- Scene-SAM3D: 微調整不要の多視点シーン資産生成3D生成2026/7/18
単一画像から3Dオブジェクトを生成するSAM3Dを、キャリブレーション済みの多視点画像から3Dシーン資産を生成するフレームワークに拡張した。冗長な視点を削減しつつ、隠れた領域の情報を補完し、潜在速度融合と軽量なガウス最適化により高品質なシーンを生成する。
- ReScene: マルチビューキャプチャからの構造化屋内シーン再構築3D再構築2026/6/26
マルチビュー画像から物理的に整合性のある構造化3Dシーンを再構築するフレームワークを提案し、幾何・画質・知覚品質で最先端を達成した。
- MUSE: 記憶に基づく段階的要件充足によるエージェント型3Dシーン作成3Dシーン生成2026/6/12
テキストから3Dシーンを生成・編集する際に、既存のシーンを保ちながら要件を段階的に満たすマルチエージェントフレームワークMUSEを提案し、要件レベルの制御と保存を評価するベンチマークも導入した。
- TrackRef3D: 3Dガウススプラッティングにおけるオープンワールド参照セグメンテーションのための多視点一貫トラック・アンド・ラベル手法3Dセグメンテーション2026/5/26
3Dガウススプラッティングにおいて、手動アノテーションなしで自然言語によるオブジェクトセグメンテーションを実現する自動パイプラインを提案。物体発見と意味的接地を分離し、軌跡認識型セマンティックコンセンサスモジュールで多視点一貫性を確保する。
- World2Minecraft: 占有駆動によるシミュレーションシーン構築シミュレーション環境構築2026/4/30
実世界のシーンを3Dセマンティック占有予測に基づいてMinecraft環境に変換する手法を提案し、データ収集パイプラインと大規模データセットMinecraftOccを導入して、占有予測の性能向上とカスタマイズ可能な具現化AI研究プラットフォームを実現した。
- DailyArt: 潜在ダイナミクスによる単一静止画像からの関節構造の発見関節推定2026/4/9
単一の閉じた状態の画像から、物体の関節パラメータを推定する新しい手法を提案。まず開いた状態の画像を合成して関節の手がかりを露出させ、観測画像との差分から全関節を同時に推定する。
- 3Dガウススプラッティング強化マルチモーダル検索拡張生成によるゼロショットロボット操作マニピュレーション2026/3/1
ロボット操作のゼロショット汎化を改善するため、3Dガウススプラッティングとマルチモーダル検索拡張生成を組み合わせたフレームワークを提案し、物体の姿勢推定精度を向上させた。
- CompassNav: ナビゲーションにおける経路模倣から意思決定理解への転換ナビゲーション2025/10/1
視覚言語モデルによるナビゲーションを「経路の模倣」から「意思決定の理解」へと転換する新パラダイムを提案し、全行動にA*距離を注釈したデータセットとギャップ認識型ハイブリッド報酬で訓練した7Bエージェントが目標ナビゲーションでSOTAを達成した。
- T2S: 生涯模倣学習のためのトークン化スキルスケーリング模倣学習2025/8/1
モデルパラメータをトークン化し、言語ガイド付きでスキルを拡張することで、破滅的忘却を防ぎつつ新しいスキルを効率的に学習する生涯模倣学習フレームワークを提案。
- NaviMaster: GUIナビゲーションと身体性ナビゲーションを統合する統一ポリシーの学習VLA2025/8/1
GUI操作と身体性ナビゲーションを同一のMDPとして捉え、視覚的軌跡収集と強化学習で単一のエージェントを訓練し、両タスクで高性能を達成した。
- DORAEMON: 記憶強化型分散オントロジー認識エージェントによるナビゲーションナビゲーション2025/5/1
人間の脳の腹側・背側経路を模したフレームワークで、VLMと階層的意味空間融合・トポロジーマップを組み合わせ、未知環境でのゼロショット自律ナビゲーションを高精度に実現した。