Wolfram Burgard
University of Freiburg
収録論文 149本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Wrench-ACT: 直接的な力制御による接触の多い動作のためのロボットポリシー強化マニピュレーション2026/9/29
接触の多いマニピュレーションタスクにおいて、力(レンチ)を唯一の行動出力として予測する模倣学習ポリシーを提案し、位置ベースのベースラインを上回る性能を示した。
- TACTIC: 接触の多いロボットマニピュレーション政策のための触覚エンコーダと条件付けの理解触覚2026/9/25
視覚ベース触覚センサを用いた接触の多いマニピュレーションタスクにおいて、様々な触覚エンコーダと融合戦略を実世界で2000回以上評価し、最適な設計はタスクに強く依存することを示した研究。
- VLMベース視覚言語ナビゲーションモデルは何に依存しているのか:方策行動の解釈と操作VLA2026/9/21
VLMベースの視覚言語ナビゲーションモデルが視覚・指示・記憶をどう統合し、内部表現を操作することで未知環境での性能を向上できるかを解明した研究。
- Norm2Tex: 視触覚シミュレーションをテクスチャで拡張触覚2026/9/21
ノーマルマップから高周波の表面詳細を視覚ベース触覚シミュレータに組み込み、シミュレーションと実世界の触覚データのギャップを埋めるプラグイン手法を提案。
- 適応的世界記憶3D基盤モデル:スケーラブルな3Dマッピング・自己位置推定・レンダリング3D基盤モデル/SLAM2026/9/18
Transformerベースのゲート付き更新と時空間調整を組み合わせた適応的世界記憶機構により、長期記憶・大規模マッピング・ガウシアンレンダリングを単一モデルで統合した3D基盤モデルを提案。
- DUET-DINO: ロボットマニピュレーションの潜在計画のための同時クロスビュー世界モデリングマニピュレーション2026/9/9
側面カメラと手首カメラの観測をクロスビュー条件付けで統合し、7自由度エンドエフェクタ制御のための行動条件付き潜在世界モデルを学習する手法を提案。到達・角度付き到達・把持持ち上げタスクで単一視点や独立二視点のベースラインを上回る性能を達成した。
- 空中MLLMエージェントのゼロショットミッションレベル評価VLA/評価2026/7/1
空中3D環境での長期的なタスクを評価するベンチマークMissionBenchを提案し、22のMLLMモデルが人間の84.4%に対し35%未満の成功率であることを示した。
- 任意形状物体の協調運搬のためのマルチエージェント強化学習による隊列形成群制御2026/6/1
マルチエージェント強化学習を用いて、複数ロボットが任意形状・不均一質量分布の物体を安全に支える隊列を自律形成する手法を提案した。
- DuoBench: シミュレーションと実世界における両腕操作の再現可能なベンチマーク両腕操作/ベンチマーク2026/6/1
両腕ロボット操作のためのベンチマークフレームワークDuoBenchを提案し、シミュレーションと実世界で11タスクを実装して、既存の両腕模倣学習やVLAポリシーの性能を評価した。
- FlowTouch: 視点不変な視覚-触覚予測触覚2026/3/1
物体の局所3Dメッシュを用いて、カメラ画像から触覚画像を予測する視点不変なモデルを提案し、シミュレーションから実環境への一般化と把持安定性予測への応用を示した。
- DINOへの報酬付与:視覚基盤モデルによる密な報酬の予測ロボット操作/報酬学習2026/3/1
ロボット操作タスクにおいて、カメラ画像から言語条件付きの密な報酬関数を学習する手法「Rewarding DINO」を提案。デモ軌跡ではなくタスクの意味を学習し、シミュレーションと実世界の両方で汎化性能を示した。
- 時間離散・時間連続の速度フィードフォワードによる視覚言語行動モデルの動的追従の実現VLA/制御2026/3/1
視覚言語行動モデルに速度フィードフォワード項を統合する2つの手法を提案し、接触を伴うタスクでの追従性能と成功率を改善した。
- OGScene3D: シーン理解のための漸進的オープンボキャブラリ3Dガウシアンシーングラフマッピングシーン理解2026/3/1
ロボットが環境を漸進的に探索しながら、オープンボキャブラリの3Dセマンティックマップとシーングラフを構築するシステムを提案した。
- VLAgents: VLA推論を効率化するポリシーサーバVLA2026/1/1
VLAモデルの推論を統一プロトコルで抽象化し、共有メモリと圧縮ストリーミングで通信を最適化するモジュラーポリシーサーバを提案。
- 能動学習によるラベル効率の良い点群セグメンテーション点群セグメンテーション2025/12/1
点群を2Dグリッドで分割し、ネットワークアンサンブルで不確実性を推定して注釈対象を選ぶ能動学習手法を提案し、複数のデータセットで高性能を示した。
- ConPoSe: LLMガイドによる協調物体押し出しのための接触点選択のスケーラブル化マニピュレーション2025/10/1
複数ロボットで物体を押す際の接触点選択に、大規模言語モデルの推論と局所探索を組み合わせる手法を提案し、従来の解析的手法よりスケーラブルで高性能なことを示した。
- 実環境における関節物体の推定関節物体推定2025/9/1
動的なカメラ移動と部分観測の下で、RGB-D動画から関節物体のパーツ軌跡と関節軸を推定するフレームワークArtiPointを提案し、新データセットArti4Dで評価した。
- MetricNet: 生成ナビゲーションポリシーにおけるメートルスケールの復元ナビゲーション2025/9/1
生成ナビゲーションポリシーが出力する抽象的な軌跡にメートル距離を与え、障害物を回避しつつ目標へ向かう制御を可能にする手法を提案。
- Robot Control Stack:大規模ロボット学習のための軽量エコシステムVLA2025/9/1
VLAや強化学習ポリシーの学習・実機実験を支援する、シミュレーションと実機を統一インターフェースで扱う軽量なロボット制御フレームワークを提案し、OctoやOpenVLAなどの性能を評価した。
- DiWA: 世界モデルによる拡散ポリシーの適応拡散ポリシー/世界モデル/オフラインRL2025/8/1
世界モデルを活用し、拡散ポリシーをオフライン強化学習でファインチューニングするフレームワークDiWAを提案。実環境との相互作用を大幅に削減し、CALVINベンチマークで8タスクの性能を向上させた。
- ロボティクスにおけるAIのロードマップロボティクスAI2025/7/1
1990年代以降のロボティクスAIの成果を評価し、多様なタスク・環境に対応するデータセットや汎用性の高いアルゴリズム設計など、短期・中期的な研究課題と展望をまとめたロードマップを提案する。
- ロボットナビゲーションと操作のためのマルチモーダル空間言語マップVLA2025/6/1
視覚・言語・音声の特徴を3D環境再構成に融合した空間マップを構築し、LLMと組み合わせて自然言語指示やマルチモーダルな目標を地図上に定位してロボットのナビゲーションと操作を可能にする手法を提案。
- ロボットのための拡張現実(ARRO):視覚運動ポリシーの視覚的ロバスト性を目指して視覚運動ポリシー/ロバスト性/拡張現実2025/5/1
ARROは、ゼロショットのオープンボキャブラリセグメンテーションと物体検出を用いて、追加学習なしでリアルタイムにタスク無関係領域をマスクし、仮想ガイドを重ねることで、視覚運動ポリシーのシーン変化に対するロバスト性を向上させる手法である。
- REGRACE: 一貫性評価を用いた堅牢で効率的なグラフベース再位置推定アルゴリズム再位置推定2025/3/1
LiDARサブマップとグラフニューラルネットワークを用いて、回転不変な物体特徴と近傍文脈を学習し、スケーラブルなBag-of-Wordsで再訪を検出する再位置推定手法を提案。幾何的一貫性で再訪を判定し、従来手法と同等の精度で2倍高速化を実現。
- 洗練されたポリシー蒸留:VLA汎用モデルからRLエキスパートへVLA2025/3/1
VLAモデルを教師として強化学習で蒸留し、マニピュレーションタスクにおいてVLAを上回る高性能なエキスパートポリシーを効率的に学習する手法を提案。
- LLM-Pack: 大規模言語モデルによる直感的な詰め込みマニピュレーション2025/3/1
言語・視覚基盤モデルを活用し、食料品を人間のように順序立てて詰め込む手法を提案。追加学習なしで新規商品に対応できる。
- ラベル効率的なLiDARパノプティックセグメンテーションLiDARセグメンテーション2025/3/1
少量のラベル付き画像から2Dネットワークで疑似ラベルを生成し、点群の幾何特性を活かした3D精緻化モジュールで精度を高めてLiDARパノプティックセグメンテーションを学習する手法を提案。
- LUMOS: 世界モデルを用いた言語条件付き模倣学習VLA2025/3/1
学習した世界モデルの潜在空間で長期ロールアウトを練習し、言語指示で操作可能なスキルを実機ロボットにゼロショット転移する模倣学習フレームワーク。
- 視覚基盤モデルによるLiDAR位置合わせ位置推定2025/2/1
周囲カメラ画像から得たDINOv2特徴を点記述子として使い、RANSACやICPと組み合わせることで、季節変化や長期経過後でもLiDARスキャンを3Dマップに頑健に位置合わせする手法を提案。
- BYE: 探索データ1シーケンスだけで長期動的シーン理解を実現するエンコーダ構築動的シーン理解2024/12/1
1回の探索データ系列のみで学習するクラス非依存の点群エンコーダを提案し、VLMとのアンサンブルで動的環境での物体対応付けを高精度化した研究。
- FlowNav: フローマッチングと深度事前分布を組み合わせた効率的なナビゲーションナビゲーション2024/11/1
フローマッチングと既存の基盤モデルから得られる深度事前分布を組み合わせて、ロボットナビゲーションの行動方策を学習する手法を提案し、従来法より高精度・高速なナビゲーションを実現した。
- CloudTrack: クラウドセマンティクスによるスケーラブルなUAV追跡UAV追跡2024/9/1
UAVの限られた計算資源でも動作するよう、意味的条件付きオープンボキャブラリ物体追跡をクラウドと連携して行う手法を提案し、行方不明者捜索での有効性を示した。
- VLM-Vac: VLM知識蒸留と言語誘導経験再生によるスマート掃除機の高度化VLA2024/9/1
視覚言語モデル(VLM)の知識を小型モデルに蒸留し、言語誘導型経験再生で継続学習することで、ロボット掃除機が多様な背景でも物体を回避・吸引できるようにした研究。
- 知覚が重要:不確実性を考慮したセマンティックセグメンテーションによる身体性AIの強化物体探索2024/8/1
物体探索タスクにおいて、知覚モデルの不確実性を校正し時系列で集約することで、既存の探索手法を追加学習なしに改善する手法を提案した。
- LetsMap: 意味的BEVマッピングのための教師なし表現学習BEVマッピング2024/5/1
単眼前方画像から意味的BEVマップを生成するため、ラベルなしでシーン幾何と意味を別々に事前学習し、少量のBEVラベルで微調整する手法を提案。
- 良い基盤は多くのラベルに値する:ラベル効率的なパノプティックセグメンテーションセグメンテーション2024/5/1
視覚基盤モデルを活用し、少数のラベル付きデータで軽量なセグメンテーションヘッドを訓練し、自己訓練と融合モジュールでパノプティックセグメンテーションを高精度に実現する手法を提案。
- 運動と深層点対応を用いたターゲット不要のカメラ-LiDAR自動キャリブレーションキャリブレーション2024/4/1
視覚・LiDARオドメトリの運動推定と深層学習による2D-3D点対応を組み合わせ、専用ターゲットや人手を要さずにカメラ-LiDAR間の外部キャリブレーションを最適化で求める手法を提案。
- 分散型マルチエージェント協調運転のためのエージェント非依存集中学習マルチエージェント協調運転2024/3/1
単一エージェント強化学習とマスク付き注意ネットワークを用い、エージェント固有の設計を必要とせずに自動運転車の分散協調運転ポリシーを学習する手法を提案し、ボトルネックでの交通流改善を実証した。
- BEVCar: カメラとレーダーの融合によるBEVマップと物体セグメンテーションBEVセグメンテーション2024/3/1
カメラと車載レーダーを融合し、生のレーダーデータを点ベースで符号化して画像特徴のBEV空間への持ち上げを初期化することで、悪天候や夜間でも頑健なBEV物体・マップセグメンテーションを実現した。
- 言語に基づくロボットナビゲーションのための階層的オープン語彙3Dシーングラフナビゲーション2024/3/1
オープン語彙の視覚基盤モデルを用いて、床・部屋・物体の階層を持つ3Dシーングラフを構築し、多階層建物内での言語指示に基づくロボットナビゲーションを実現した。
- ロボットマニピュレーションにおけるサンプル効率の良い方策改善のためのベイズ最適化マニピュレーション2024/3/1
少数のデモンストレーションからガウス混合モデルでスキルを学習し、ベイズ最適化で自律実行を改善するハイブリッド手法を提案し、サンプル効率の高さを実証した。
- uPLAM: 知覚の不確かさを活用したロバストなパノプティック自己位置推定とマッピング自己位置推定・マッピング2024/2/1
パノプティックCNNの画素ごとの不確かさを確率的な自己位置推定・マッピングに統合し、より正確な地図と位置推定を実現する手法を提案。評価用データセットも公開。
- Evaluation of a Smart Mobile Robotic System for Industrial Plant Inspection and Supervision2024/2/1
- CenterGrasp: Object-Aware Implicit Representation Learning for Simultaneous Shape Reconstruction and 6-DoF Grasp Estimation2023/12/1
- Care3D: An Active 3D Object Detection Dataset of Real Robotic-Care Environments2023/10/1
- Robot Skill Generalization via Keypoint Integrated Soft Actor-Critic Gaussian Mixture Models2023/10/1
- Lan-grasp: Using Large Language Models for Semantic Object Grasping and Placement2023/10/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Few-Shot Panoptic Segmentation With Foundation Models2023/9/1
- Collaborative Dynamic 3D Scene Graphs for Automated Driving2023/9/1
- A Smart Robotic System for Industrial Plant Supervision2023/8/1
- POV-SLAM: Probabilistic Object-Aware Variational SLAM in Semi-Static Environments2023/7/1
- Learning Continuous Control with Geometric Regularity from Robot Intrinsic Symmetry2023/6/1
- End-to-end 2D-3D Registration between Image and LiDAR Point Cloud for Vehicle Localization2023/6/1
- Fast yet predictable braking manoeuvers for real-time robot control2023/6/1
- The Treachery of Images: Bayesian Scene Keypoints for Deep Policy Learning in Robotic Manipulation2023/5/1
- FM-Loc: Using Foundation Models for Improved Vision-based Localization2023/4/1
- CoVIO: Online Continual Learning for Visual-Inertial Odometry2023/3/1
- CoDEPS: Online Continual Learning for Depth Estimation and Panoptic Segmentation2023/3/1
- Audio Visual Language Maps for Robot Navigation2023/3/1
- Improving Deep Dynamics Models for Autonomous Vehicles with Multimodal Latent Mapping of Surfaces2023/3/1
- Learning and Aggregating Lane Graphs for Urban Automated Driving2023/2/1
- SkyEye: Self-Supervised Bird's-Eye-View Semantic Mapping Using Monocular Frontal View Images2023/2/1
- Grounding Language with Visual Affordances over Unstructured Data2022/10/1
- Uncertainty-aware LiDAR Panoptic Segmentation2022/10/1
- Visual Language Maps for Robot Navigation2022/10/1
- PADLoC: LiDAR-Based Deep Loop Closure Detection and Registration Using Panoptic Attention2022/9/1
- T3VIP: Transformation-based 3D Video Prediction2022/9/1
- Latent Plans for Task-Agnostic Offline Reinforcement Learning2022/9/1
- TrackletMapper: Ground Surface Segmentation and Mapping from Traffic Participant Trajectories2022/9/1
- USegScene: Unsupervised Learning of Depth, Optical Flow and Ego-Motion with Semantic Guidance and Coupled Networks2022/7/1
- Uncertainty-aware Panoptic Segmentation2022/6/1
- What Matters in Language Conditioned Robotic Imitation Learning over Unstructured Data2022/4/1
- Continual SLAM: Beyond Lifelong Simultaneous Localization and Mapping Through Continual Learning2022/3/1
- Affordance Learning from Play for Sample-Efficient Policy Learning2022/3/1
- CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks2021/12/1
- Adaptively Calibrated Critic Estimates for Deep Reinforcement Learning2021/11/1
- Robot Skill Adaptation via Soft Actor-Critic Gaussian Mixture Models2021/11/1
- Robust Monocular Localization in Sparse HD Maps Leveraging Multi-Task Uncertainty Estimation2021/10/1
- Correct Me if I am Wrong: Interactive Learning for Robotic Manipulation2021/10/1
- Courteous Behavior of Automated Vehicles at Unsignalized Intersections via Reinforcement Learning2021/6/1
- Lane Graph Estimation for Scene Understanding in Urban Driving2021/5/1
- Pre-training of Deep RL Agents for Improved Learning under Domain Randomization2021/4/1
- EfficientLPS: Efficient LiDAR Panoptic Segmentation2021/2/1
- Composing Pick-and-Place Tasks By Grounding Language2021/2/1
- Kineverse: A Symbolic Articulation Model Framework for Model-Agnostic Mobile Manipulation2020/12/1
- Modality-Buffet for Real-Time Object Detection2020/11/1
- An Efficient Real-Time NMPC for Quadrotor Position Control under Communication Time-Delay2020/10/1
- PillarFlow: End-to-end Birds-eye-view Flow Estimation for Autonomous Driving2020/8/1
- Driving Through Ghosts: Behavioral Cloning with False Positives2020/8/1
- Neural Ray Surfaces for Self-Supervised Learning of Depth and Ego-motion2020/8/1
- Hindsight for Foresight: Unsupervised Structured Dynamics Models from Physical Interaction2020/8/1
- Beyond Single Stage Encoder-Decoder Networks: Deep Decoders for Semantic Image Segmentation2020/7/1
- Self-supervised Transfer Learning for Instance Segmentation through Physical Interaction2020/5/1
- MOPT: Multi-Object Panoptic Tracking2020/4/1
- HeatNet: Bridging the Day-Night Domain Gap in Semantic Segmentation with Thermal Images2020/3/1
- Learning Object Placements For Relational Instructions by Hallucinating Scene Representations2020/1/1
- Self-Supervised Visual Terrain Classification from Unsupervised Acoustic Feature Learning2019/12/1
- Building an Aerial-Ground Robotics System for Precision Farming: An Adaptable Solution2019/11/1
- Closed-Form Full Map Posteriors for Robot Localization with Lidar Sensors2019/10/1
- Adaptive Curriculum Generation from Demonstrations for Sim-to-Real Visuomotor Control2019/10/1
- Adversarial Skill Networks: Unsupervised Robot Skill Learning from Video2019/10/1
- A Maximum Likelihood Approach to Extract Polylines from 2-D Laser Range Scans2019/10/1
- A Maximum Likelihood Approach to Extract Finite Planes from 3-D Laser Scans2019/10/1
- DCT Maps: Compact Differentiable Lidar Maps Based on the Cosine Transform2019/10/1
- An Analytical Lidar Sensor Model Based on Ray Path Information2019/10/1
- Long-Term Urban Vehicle Localization Using Pole Landmarks Extracted from 3-D Lidar Scans2019/10/1
- Self-supervised 3D Shape and Viewpoint Estimation from Single Images for Robotics2019/10/1
- Learning User Preferences for Trajectories from Brain Signals2019/9/1
- Combined Task and Action Learning from Human Demonstrations for Mobile Manipulation Applications2019/8/1
- DeepTemporalSeg: Temporally Consistent Semantic Segmentation of 3D LiDAR Scans2019/6/1
- CMRNet: Camera to LiDAR-Map Registration2019/6/1
- Vision-Based Autonomous UAV Navigation and Landing for Urban Search and Rescue2019/6/1
- Robot Localization in Floor Plans Using a Room Layout Edge Extraction Network2019/3/1
- Scheduled Intrinsic Drive: A Hierarchical Take on Intrinsically Motivated Exploration2019/3/1
- Robust, Compliant Assembly via Optimal Belief Space Planning2018/11/1
- Accurate Pouring with an Autonomous Robot Using an RGB-D Camera2018/10/1
- Learning a Local Feature Descriptor for 3D LiDAR Scans2018/9/1
- Vision-based Autonomous Landing in Catastrophe-Struck Environments2018/9/1
- Multimodal Interaction-aware Motion Prediction for Autonomous Street Crossing2018/8/1
- VLocNet++: Deep Multitask Learning for Semantic Visual Localization and Odometry2018/4/1
- Curiosity-driven Exploration for Mapless Navigation with Deep Reinforcement Learning2018/4/1
- Deep Spatiotemporal Models for Robust Proprioceptive Terrain Classification2018/4/1
- The Limits and Potentials of Deep Learning for Robotics2018/4/1
- 3D Human Pose Estimation in RGBD Images for Robotic Task Learning2018/3/1
- Deep Auxiliary Learning for Visual Localization and Odometry2018/3/1
- VR-Goggles for Robots: Real-to-sim Domain Adaptation for Visual Control2018/2/1
- The signature of robot action success in EEG signals of a human observer: Decoding and visualization using deep convolutional neural networks2017/11/1
- Socially Compliant Navigation through Raw Depth Inputs with Generative Adversarial Imitation Learning2017/10/1
- Why did the Robot Cross the Road? - Learning from Multi-Modal Sensor Data for Autonomous Road Crossing2017/9/1
- From Plants to Landmarks: Time-invariant Plant Localization that uses Deep Pose Regression in Agricultural Fields2017/9/1
- Brain Responses During Robot-Error Observation2017/8/1
- Deep Detection of People and their Mobility Aids for a Hospital Robot2017/8/1
- Acting Thoughts: Towards a Mobile Robotic Service Assistant for Users with Limited Communication Skills2017/7/1
- Optimization Beyond the Convolution: Generalizing Spatial Relations with End-to-End Metric Learning2017/7/1
- Learning to Singulate Objects using a Push Proposal Network2017/7/1
- Choosing Smartly: Adaptive Multimodal Fusion for Object Detection in Changing Environments2017/7/1
- Topometric Localization with Deep Learning2017/6/1
- Neural SLAM: Learning to Explore with External Memory2017/6/1
- Deep Semantic Classification for 3D LiDAR Data2017/6/1
- Metric Learning for Generalizing Spatial Relations to New Objects2017/3/1
- Deep Reinforcement Learning with Successor Features for Navigation across Similar Environments2016/12/1
- A Survey of Deep Network Solutions for Learning Control in Robotics: From Reinforcement to Imitation2016/12/1
- Collaborative Filtering for Predicting User Preferences for Organizing Objects2015/12/1
- Multimodal Deep Learning for Robust RGB-D Object Recognition2015/7/1
- Monte Carlo Localization in Hand-Drawn Maps2015/4/1
- Metric Localization using Google Street View2015/3/1
- Fast and Robust Feature Matching for RGB-D Based Localization2015/2/1
- A Probabilistic Framework for Learning Kinematic Models of Articulated Objects2014/5/1