Jianke Zhu
収録論文 21本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- AgentVLN:エージェント型視覚言語ナビゲーションに向けてナビゲーション2026/3/1
視覚言語ナビゲーション(VLN)のための新しいフレームワークAgentVLNを提案。VLMを高次推論に用い、3Dトポロジカルウェイポイントを画像平面に投影して視覚プロンプトを生成し、自己補正と能動探索で長期的なナビゲーション誤差を抑制する。
- DynFlowDrive: フローベース動的世界モデルによる自動運転自動運転/世界モデル2026/3/1
拡散フローで運転行動に応じたシーン状態の遷移を学習する潜在世界モデルを提案し、安定性を考慮した軌道選択で自動運転の計画信頼性を向上させた。
- 空間知能の構築:自律システムのためのマルチモーダル事前学習ロードマップマルチモーダル事前学習2025/12/1
自動運転車やドローンなどの自律システムに向けて、カメラやLiDARなどのマルチモーダルセンサーデータを活用した事前学習技術を整理し、統一的な分類と今後の課題・ロードマップを提示したサーベイ論文。
- 自動運転のための視覚-言語-行動モデル:過去・現在・未来VLA2025/12/1
自動運転における視覚-言語-行動(VLA)フレームワークの進化を整理し、End-to-End型とDual-System型の2つのパラダイムに分類して、その特徴と課題を概観したサーベイ論文。
- 3D・4D世界モデリングのサーベイ世界モデル2025/9/1
RGB-D画像や占有グリッド、LiDAR点群といったネイティブな3D/4D表現を用いた世界モデリング研究を初めて体系的に整理し、定義・分類・データセット・評価指標をまとめたサーベイ。
- 粗から細へのアプローチによるマルチモーダル3D占有グラウンディング3Dグラウンディング2025/8/1
自然言語記述に基づき3D空間内の物体をボクセル単位で特定する新しいベンチマークと、視覚・テキスト・点群を統合したエンドツーエンドモデルGroundingOccを提案。
- SAM4D: カメラとLiDARストリームを横断するセグメンテーションモデルマルチモーダルセグメンテーション2025/6/1
カメラとLiDARの両ストリームでプロンプト可能なセグメンテーションを行うマルチモーダル基盤モデルを提案し、自動運転シーンでの時系列一貫性とアノテーション効率を大幅に向上させた。
- ReliOcc: 不確実性学習による信頼性の高い意味的占有予測自動運転/占有予測2024/9/1
カメラベースの意味的占有予測の信頼性を評価し、不確実性を組み込んだプラグアンドプレイ手法ReliOccで予測の信頼性を向上させた研究。
- スクリブル注釈によるラベル効率的な意味的シーン補完意味的シーン補完2024/5/1
スパースなスクリブル注釈と密な幾何ラベルを組み合わせた新しいベンチマークScribbleSCを構築し、Scribble2Sceneという手法で完全教師ありに匹敵する性能を少ないラベルで実現した。
- すべてのボクセルは平等ではない:自己蒸留を用いた難易度認識型セマンティックシーン補完セマンティックシーン補完2024/4/1
3D空間のボクセルごとに難易度を考慮し、学習が難しい領域を重点的に学習する自己蒸留ベースのセマンティックシーン補完手法を提案。
- HVOFusion: ハイブリッドボクセルオクツリーによるインクリメンタルメッシュ再構成3D再構成2024/4/1
オクツリーとボクセルを組み合わせたハイブリッド構造で、逐次的に高品質なメッシュと色を再構成する手法を提案。
- 自動運転向けハイブリッド伝播によるオフボード占有予測の精緻化自動運転/3Dシーン理解2024/3/1
車載の視覚ベース3D意味シーン補完(SSC)予測を、オフボードで局所・大域の二段階伝播により高精度化するフレームワークOccFinerを提案し、SemanticKITTIで最先端性能を達成した。
- Traj-LIO: A Resilient Multi-LiDAR Multi-IMU State Estimator Through Sparse Gaussian Process2024/2/1
- Mesh-LOAM: Real-time Mesh-Based LiDAR Odometry and Mapping2023/12/1
- Traj-LO: In Defense of LiDAR-Only Odometry Using an Effective Continuous-Time Trajectory2023/9/1
- LiDAR2Map: In Defense of LiDAR-Based Semantic Map Construction Using Online Camera Distillation2023/4/1
- ECTLO: Effective Continuous-time Odometry Using Range Image for LiDAR with Small FoV2022/6/1
- Meta-RangeSeg: LiDAR Sequence Semantic Segmentation Using Multiple Feature Aggregation2022/2/1
- Homography Decomposition Networks for Planar Object Tracking2021/12/1
- Efficient LiDAR Odometry for Autonomous Driving2021/4/1
- SuPer: A Surgical Perception Framework for Endoscopic Tissue Manipulation with Surgical Robotics2019/9/1