Runwei Guan
収録論文 21本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Talk2Sensors: センサ適応型物理的手がかりマッチングによる自動運転の3D視覚グラウンディング3D視覚グラウンディング/自動運転/マルチセンサ2026/8/5
カメラ・LiDAR・4Dレーダーのマルチセンサデータを用いた自動運転向け3D視覚グラウンディングのデータセットと、言語クエリに応じてセンサ情報を動的に統合するTransformerベースのフレームワークを提案した。
- 身体化知能における触覚ベースのマルチモーダル融合:視覚・言語・接触駆動パラダイムのサーベイ触覚/サーベイ2026/5/1
触覚と視覚・言語を統合するマルチモーダル触覚融合の研究を包括的に調査し、データセットと手法の階層的分類法を提案した論文。
- AutoFly: 実環境でのUAV自律ナビゲーションのための視覚-言語-行動モデルVLA2026/2/1
RGB入力から擬似深度特徴を抽出するエンコーダと二段階学習を組み合わせ、粗い指示のみでUAVが自律的に経路計画と障害物回避を行うVLAモデルを提案し、自律行動に焦点を当てた新データセットも構築した。
- HyperDet: ハイパー4Dレーダー点群による3D物体検出3D物体検出/4Dレーダー2026/2/1
LiDARを訓練時のみ用いて4Dレーダー点群を時空間蓄積・前景生成・ドップラー整合拡張で強化し、推論時はレーダーのみで標準3D検出器を高精度化する枠組み。
- WaterVideoQA:マルチモーダルエージェントによるASV中心の知覚と規則準拠推論VLA2026/2/1
水上航行環境に特化した大規模動画QAベンチマークWaterVideoQAと、マルチエージェント神経記号システムNaviMindを提案し、ASVの認知・推論能力を評価・向上させる。
- 4D-CAAL: 自動運転のための4Dレーダー・カメラキャリブレーションと自動ラベリングキャリブレーション/自動ラベリング2026/1/1
4Dレーダーとカメラのキャリブレーションを効率化するため、チェッカーボードとコーナーリフレクターを組み合わせた二目的ターゲットと、カメラのセグメンテーションをレーダー点群に転送する自動ラベリング手法を提案した。
- MMDrive: マルチ表現融合による視覚を超えた対話的シーン理解VLA2025/12/1
占有マップ・LiDAR点群・テキスト記述を統合し、質問に応じて適応的に融合する自動運転向けマルチモーダル視覚言語モデルを提案。DriveLMとNuScenes-QAで高精度を達成。
- AerialMind:UAVシナリオにおける参照マルチオブジェクト追跡に向けてVLA2025/11/1
UAV(ドローン)映像で自然言語指示に基づくマルチオブジェクト追跡を行うための大規模ベンチマークAerialMindと、半自動ラベリング手法COALA、追跡手法HawkEyeTrackを提案した論文。
- 自動運転における軌道予測のための大規模基盤モデル:包括的サーベイ軌道予測2025/9/1
自動運転の軌道予測に大規模言語モデルやマルチモーダル基盤モデルを活用する研究を体系的にレビューし、手法・評価・課題を整理したサーベイ。
- Da Yu:水上監視とシーン理解のためのUSV向け画像キャプショニングVLA2025/6/1
水上環境の画像キャプションデータセットWaterCaptionを構築し、USV向けのエッジ展開可能なマルチモーダル大規模言語モデルDa Yuを提案した。
- USVTrack: 内陸水路の自動運転のためのUSVベース4Dレーダーカメラ追跡データセット自律航行2025/6/1
内陸水路での自律航行に向けて、4Dレーダーと単眼カメラを搭載した無人水上艇で収集した初の追跡データセットUSVTrackを構築し、レーダーカメラマッチング手法RCMの有効性を示した。
- OptiPMB: 最適化ポアソン多ベルヌーイフィルタによる3D多物体追跡の強化3D多物体追跡2025/3/1
自律走行向けの3D多物体追跡において、最適化されたポアソン多ベルヌーイフィルタを用いたモデルベース手法を提案し、nuScenesとKITTIで最先端の精度を達成した。
- DRIVE: 自動運転における信頼性・堅牢性・解釈性を備えた視覚アンサンブルフレームワーク自動運転2024/9/1
自動運転のEnd-to-Endモデルにおける説明の不安定性を解決するため、一貫性・安定性・信頼性を備えた解釈可能なアンサンブルフレームワークDRIVEを提案した。
- NanoMVG: プロンプト誘導カメラと4Dミリ波レーダーによるUSV中心の低消費電力マルチタスク視覚グラウンディングVLA2024/8/1
水上自律走行体(USV)向けに、カメラと4Dミリ波レーダーを自然言語で誘導し、物体の位置を特定する低消費電力マルチタスク視覚グラウンディングモデルNanoMVGを提案。WaterVGデータセットで競争力のある性能を示し、厳しい環境でも長時間運用可能。
- Talk2Radar: 自然言語と4Dミリ波レーダーを結ぶ3D参照表現理解VLA2024/5/1
4Dミリ波レーダーの点群と自然言語を対応付ける初のデータセットTalk2Radarを構築し、3D参照表現理解のための新モデルT-RadarNetを提案した。
- WaterVG: テキスト誘導型視覚とミリ波レーダーによる水路の視覚的グラウンディングVLA2024/3/1
USVの水路知覚向けに、テキストプロンプトで視覚とミリ波レーダーを統合した初の視覚的グラウンディングデータセットWaterVGと、低消費電力モデルPotamoiを提案した。
- Achelous++: Power-Oriented Water-Surface Panoptic Perception Framework on Edge Devices based on Vision-Radar Fusion and Pruning of Heterogeneous Modalities2023/12/1
- ASY-VRNet: Waterway Panoptic Driving Perception Model based on Asymmetric Fair Fusion of Vision and 4D mmWave Radar2023/8/1
- Achelous: A Fast Unified Water-surface Panoptic Perception Framework based on Fusion of Monocular Camera and 4D mmWave Radar2023/7/1
- WaterScenes: A Multi-Task 4D Radar-Camera Fusion Dataset and Benchmarks for Autonomous Driving on Water Surfaces2023/7/1
- Radar-Camera Fusion for Object Detection and Semantic Segmentation in Autonomous Driving: A Comprehensive Review2023/4/1