Guofeng Zhang
収録論文 24本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Exo2EgoHOI: 手と物体のインタラクションを考慮した三人称視点から一人称視点への動画生成動画生成2026/9/29
三人称視点の操作動画を一人称視点に変換する際、手と物体のインタラクションを保つための4D事前情報と物体中心のアテンション機構を導入した動画生成フレームワーク。
- 孤立したオブジェクトを超えて:3Dシーングラフ解析による関係認識型オープンボキャブラリシーン理解3Dシーン理解2026/7/1
3Dシーングラフを用いてオブジェクト間の関係を推論し、オープンボキャブラリの3Dシーン理解を向上させるフレームワークRelGraphOVを提案。
- INTACT: 検索不要の世界モデルのための同型意図-行動学習世界モデル2026/7/1
行動ラベル付き軌跡から、検索なしで意図を行動に変換するエンドツーエンドのJEPAモデルを提案し、LeWMタスクで高い成功率を達成した。
- 屋内視覚的再位置特定のためのオープンボキャブラリ理解を備えたコンパクトなオブジェクトレベル表現視覚的再位置特定2026/6/1
シーン内のオブジェクト情報を構造化マップに整理し、オブジェクト単位のみでカメラ再位置特定を駆動するシステムOpenReLocを提案。基礎モデルを活用した2D-3Dオブジェクトマッチングと、オブジェクト指向参照フレームによる高精度な位置推定を実現。
- R3D: 3Dポリシー学習の再考模倣学習/3Dポリシー2026/4/1
3Dポリシー学習の不安定性と過学習の原因を診断し、3Dデータ拡張の欠如とバッチ正規化の悪影響を特定。スケーラブルなトランスフォーマー型3Dエンコーダと拡散デコーダを組み合わせた新しいアーキテクチャを提案し、操作ベンチマークで最先端を達成した。
- CUS-GS: マルチモーダルシーン表現のためのコンパクト統合構造化ガウシアンスプラッティングフレームワーク3Dシーン表現2025/11/1
複数の基盤モデルから得たマルチモーダル特徴をボクセルアンカー構造に統合し、外観・幾何・意味を一貫して表現する軽量な3Dガウシアンスプラッティング手法を提案。
- SGFormer: 衛星・地上融合による3Dセマンティックシーン補完3Dセマンティックシーン補完2025/3/1
視覚的遮蔽に強い3Dセマンティックシーン補完のため、衛星画像と地上画像を並列に符号化して統合する初の衛星・地上協調フレームワークを提案した論文。
- SLC²-SLAM: 共有潜在コードを用いた意味誘導ループ閉じ込みによるNeRF SLAMSLAM2025/1/1
NeRF SLAMで蓄積するドリフト誤差を抑えるため、再構成に使われる潜在コードを局所特徴として再利用し、意味情報で集約してループ検出を行う手法を提案した。
- DiffPano: 球面エピポーラ対応拡散によるスケーラブルで一貫性のあるテキストからのパノラマ生成生成モデル2024/10/1
大規模なパノラマ動画テキストデータセットを構築し、LoRAで微調整した単視点テキスト→パノラマ拡散モデルと球面エピポーラ対応の多視点拡散モデルを組み合わせ、未見のテキストとカメラポーズから一貫性のある多様な360度パノラマ画像を生成する手法を提案。
- XRDSLAM:深層学習ベースSLAMのための柔軟でモジュール式フレームワークSLAM2024/10/1
XRDSLAMは、モジュール式設計とマルチプロセス実行により、データセット管理や可視化、評価などの共通基盤を提供し、NeRFや3DGSベースのSLAMを含む複数の最先端アルゴリズムを統合・比較評価できる柔軟なSLAMフレームワークである。
- 自律ロボットのためのNeRFベンチマーク:概観NeRF2024/5/1
NeRFを自律ロボットの知覚・自己位置推定・ナビゲーション・意思決定に活用する研究を網羅的に調査し、既存手法の性能を比較評価したサーベイ。
- CG-SLAM: 一貫性のある不確実性考慮型3Dガウシアンフィールドによる高効率な高密度RGB-D SLAMSLAM2024/3/1
3Dガウシアンスプラッティングを基に、不確実性を考慮した一貫性の高い3Dガウシアンフィールドを構築し、最大15Hzで動作する高効率な高密度RGB-D SLAMを実現した。
- CP-SLAM: Collaborative Neural Point-based SLAM System2023/11/1
- RD-VIO: Robust Visual-Inertial Odometry for Mobile Augmented Reality in Dynamic Environments2023/10/1
- Descriptor Distillation for Efficient Multi-Robot SLAM2023/3/1
- Vox-Fusion: Dense Tracking and Mapping with Voxel-based Neural Implicit Representation2022/10/1
- Generative Category-Level Shape and Pose Estimation with Semantic Primitives2022/10/1
- VIP-SLAM: An Efficient Tightly-Coupled RGB-D Visual Inertial Planar SLAM2022/7/1
- PVO: Panoptic Visual Odometry2022/7/1
- D$^3$FlowSLAM: Self-Supervised Dynamic SLAM with Flow Motion Decomposition and DINO Guidance2022/7/1
- RNNPose: Recurrent 6-DoF Object Pose Refinement with Robust Correspondence Field Estimation and Pose Optimization2022/3/1
- Robust Self-Supervised LiDAR Odometry via Representative Structure Discovery and 3D Inherent Error Modeling2022/2/1
- Deep-CNN based Robotic Multi-Class Under-Canopy Weed Control in Precision Farming2021/12/1
- SelfVoxeLO: Self-supervised LiDAR Odometry with Voxel-based Deep Neural Networks2020/10/1