Qian Zhang
収録論文 26本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ACEsplat: RGBと姿勢のみによる高速3Dガウスシーン回帰3D再構成2026/6/1
外部の3D事前情報を使わず、RGB画像とカメラ姿勢のみから3Dガウス表現を高速に再構成するフレームワークを提案。自己教師ありのシーン座標回帰で内部の幾何事前を構築し、軽量な初期化ヘッドで3DGS最適化を行う。
- SPACE: 群知能フェロモン場による適応的衝突回避探索群制御2026/6/1
多数のロボット群による未知環境探索で、混雑時の衝突を減らしつつ効率的な探索を実現するため、蟻の採餌行動に着想を得た分散協調手法SPACEを提案した。実建物のフロアプランで最大256台の群れを評価し、衝突率を大幅に低減しつつ探索時間はほぼ同等であることを示した。
- REAP: ガウススプラッティングシミュレータを用いた強化学習によるエンドツーエンド自動駐車とReal2Sim2Real転送自動駐車2026/5/1
強化学習とガウススプラッティングシミュレータを組み合わせ、エンドツーエンドの自動駐車を実現し、実世界への転送を可能にする手法を提案した論文。
- ResAD: 正規化残差軌道モデリングによるエンドツーエンド自動運転自動運転2025/10/1
慣性参照からの残差を予測し、点ごとの正規化で最適化の偏りを抑えることで、エンドツーエンド自動運転の軌道予測精度を向上させた研究。
- CityNavAgent:階層的意味計画とグローバルメモリによる都市空中ビジョン言語ナビゲーション空中VLN2025/5/1
ドローンが自然言語指示に従って都市環境をナビゲートする空中VLNタスクに対し、LLMを活用した階層的意味計画と履歴をトポロジカルグラフで保持するグローバルメモリを組み合わせたエージェントを提案し、最先端性能を達成した。
- LiloDriver: ロングテール自動運転シーンにおける閉ループ運動計画のための生涯学習フレームワーク自動運転/運動計画2025/5/1
大規模言語モデルと記憶拡張型プランナ生成を組み合わせ、再学習なしで新たなロングテール走行シーンに適応する生涯学習型の閉ループ運動計画フレームワークを提案し、nuPlanベンチマークで有効性を示した。
- AlphaDrive:強化学習と推論で自動運転におけるVLMの能力を引き出す自動運転VLA2025/3/1
自動運転向けにGRPOベースの強化学習報酬と2段階の計画推論訓練を組み合わせたVLMフレームワークを提案し、計画性能と訓練効率を改善した。
- RAD: 大規模3DGSベース強化学習によるエンドツーエンド自動運転ポリシーの学習自動運転/強化学習2025/2/1
3Dガウシアンスプラッティングで構築したフォトリアルな閉ループ環境で強化学習を行い、模倣学習を正則化として併用することで、衝突率を大幅に低減した自動運転ポリシーを学習する手法を提案。
- 変調トランスフォーマーに基づく拡散ポリシーモデルMTDP模倣学習/拡散ポリシー2025/2/1
拡散ポリシーにトランスフォーマーを組み込む際の条件統合の課題を解決するModulated Attentionを提案し、ロボット操作タスクの成功率を向上させた。
- DiffusionDrive:切り詰め拡散モデルによるエンドツーエンド自動運転自動運転2024/11/1
拡散モデルのノイズ除去ステップを切り詰め、マルチモードアンカーを導入することで、自動運転の行動生成を2ステップで多様かつ高品質にし、リアルタイム速度を実現した。
- スパイキングTransformer拡散ポリシーによる脳模倣行動生成VLA2024/11/1
スパイキングニューラルネットと拡散モデルを組み合わせたTransformerベースのポリシーを提案し、ロボット操作タスクで従来手法を上回る性能を示した。
- Senna: 大規模視覚言語モデルとEnd-to-End自動運転の橋渡し自動運転/VLA2024/10/1
LVLMが自然言語で高レベル計画を立て、End-to-Endモデルが精密な軌道を予測する自動運転システムSennaを提案。DriveX事前学習とnuScenes微調整で計画誤差と衝突率を大幅削減した。
- ComDrive: 快適性重視のエンドツーエンド自動運転自動運転2024/10/1
拡散モデルで時間的に一貫した軌道を生成し、快適性を考慮したスコアラで選択するエンドツーエンド自動運転システムを提案。
- OccRWKV: 線形計算量で効率的な3D意味占有予測の再考3D意味占有予測2024/9/1
RWKVアーキテクチャを応用し、意味・占有・特徴融合を分岐させた効率的な3D意味占有予測ネットワークを提案。BEV空間での特徴強化により22.2FPSのリアルタイム推論を実現し、SemanticKITTIで最高精度を達成。
- 占有を点集合として表現する3D占有予測3D占有予測2024/7/1
多視点画像から3D占有を予測するため、関心点(PoI)の集合でシーンを表現する点ベースの新手法OSPを提案し、従来のボリュームベース手法を上回る性能と柔軟性を示した。
- VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning2024/2/1
- MapTRv2: An End-to-End Framework for Online Vectorized HD Map Construction2023/8/1
- Interpretable Motion Planner for Urban Driving via Hierarchical Imitation Learning2023/3/1
- Lane Graph as Path: Continuity-preserving Path-wise Modeling for Online Lane Graph Construction2023/3/1
- VAD: Vectorized Scene Representation for Efficient Autonomous Driving2023/3/1
- Perceive, Interact, Predict: Learning Dynamic and Static Clues for End-to-End Motion Prediction2022/12/1
- Towards Accurate Ground Plane Normal Estimation from Ego-Motion2022/12/1
- MapTR: Structured Modeling and Learning for Online Vectorized HD Map Construction2022/8/1
- Autonomous Underwater Vehicle-Manipulator Systems Path Planning with RRTAUVMS Algorithm2021/9/1
- Deep Online Correction for Monocular Visual Odometry2021/3/1
- On Efficient and Robust Metrics for RANSAC Hypotheses and 3D Rigid Registration2020/11/1