Wenwei Zhang
収録論文 17本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LapaTrack-3D:腹腔鏡手術のための術前形状を用いた6自由度トラッキング手術支援/トラッキング2026/9/17
腹腔鏡映像と術前CTなどの3D形状をリアルタイムに位置合わせする6自由度トラッキング手法を提案し、生体内・生体外実験で有効性を示した。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- 画像からLiDARへのデータ事前学習における時空間一貫性の強化LiDAR事前学習2025/3/1
連続するLiDAR-カメラペアを用いて時空間的手がかりを統合するSuperFlow++を提案し、11の異なるLiDARデータセットで最先端性能を達成した。
- LargeAD: 自動運転のための大規模クロスセンサデータ事前学習自動運転/3D知覚2025/1/1
2D画像から視覚基盤モデルでスーパーピクセルを抽出しLiDAR点群と対応付けることで、自動運転向けのクロスモーダル3D表現を大規模事前学習するフレームワークを提案。
- VLMは自動運転に本当に使えるのか?信頼性・データ・評価指標の観点からの実証研究VLA2025/1/1
自動運転向けVLMの信頼性を17設定・約2万フレームで評価するベンチマークDriveBenchを構築し、VLMが視覚ではなく一般知識やテキスト手がかりに依存しがちであることを明らかにした。
- 腹腔鏡手術のためのSLAM支援3Dトラッキングシステム医療ロボティクス/ARナビゲーション2024/9/1
術前の3D形状を事前情報としてORB-SLAM2を拡張し、腹腔鏡下の臓器をリアルタイムに単眼3D追跡する手法を提案。生体・摘出臓器での実験で高速運動や視野外・部分遮蔽などに対応できることを示した。
- 4DコントラスティブSuperFlow:密な3D表現学習器3D知覚2024/7/1
LiDARとカメラの連続ペアを用いた時空間事前学習フレームワークSuperFlowを提案し、点群密度変化への不感性と流れベースのコントラスティブ学習で3D知覚モデルを効率的に学習する。
- 最先端LiDARセグメンテーションモデル訓練の実証研究LiDARセグメンテーション2024/5/1
LiDARセグメンテーション研究を統一するツールボックスMMDetection3D-lidarsegを提案し、多様なモデル・データ拡張・疎畳み込みバックエンドを統合してベンチマークを効率化した。
- 自動運転向けマルチモーダルなデータ効率の良い3Dシーン理解3Dシーン理解2024/5/1
LiDARセマンティックセグメンテーションの半教師あり学習において、LiDARとカメラの対応や言語知識を活用するLaserMix++を提案し、少ないアノテーションで高精度を実現した。
- 自動運転におけるBird's Eye View知覚のロバスト性のベンチマークと改善BEV知覚2024/5/1
BEV知覚モデルのロバスト性を評価するベンチマークRoboBEVを提案し、33モデルを検証してCLIPベースの改善手法を設計した。
- RoboDriveチャレンジ:あらゆる条件でいつでもどこでも走行する自動運転知覚2024/5/1
悪天候やセンサ故障など想定外の状況でも頑健に知覚できる自動運転技術を競う2024年RoboDriveチャレンジの報告で、BEV検出や地図セグメンテーションなど4タスクで140チームが参加した。
- Calib3D:信頼できる3Dシーン理解のためのモデル選好の校正3Dシーン理解2024/3/1
3Dシーン理解モデルの不確実性推定の信頼性を評価するベンチマークCalib3Dを提案し、28モデル・10データセットで検証。校正を改善する深度対応スケーリング手法DeptSも導入。
- EmbodiedScan: A Holistic Multi-Modal 3D Perception Suite Towards Embodied AI2023/12/1
- Segment Any Point Cloud Sequences by Distilling Vision Foundation Models2023/6/1
- RoboBEV: Towards Robust Bird's Eye View Perception under Corruptions2023/4/1
- Robo3D: Towards Robust and Reliable 3D Perception against Corruptions2023/3/1
- MV-FCOS3D++: Multi-View Camera-Only 4D Object Detection with Pretrained Monocular Backbones2022/7/1