Stefan Leutenegger
収録論文 54本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Scalix: 不確実性を考慮したスケール一貫性のある単眼SLAMSLAM2026/8/18
単眼SLAMのスケール曖昧性を解決するため、学習された深度情報を確率的因子グラフに統合し、ピクセル単位とフレーム単位の不確実性を考慮してメートルスケールの状態推定を実現するフレームワークを提案した。
- SpotlessGS: 動的照明下でのロボット知覚のための再照明可能な3Dガウシアンスプラッティング3D再構成/ロボット知覚2026/8/11
暗所でロボットの照明が不均一になる問題を解決するため、3Dガウシアンスプラッティングに照明パラメータの同時最適化、球面調和関数による低周波照明モデル、MLPベースのBRDFを導入し、再照明可能な3D再構成を実現した。
- SPEAR: 写実的な具現化AI研究のためのシミュレータシミュレーション2026/7/1
Unreal EngineをPythonから制御できる高速・高機能な写実シミュレータを提案し、多様なエージェント制御やデータ生成を実現した。
- ロボットの自己改善:人間のビデオからの力学モデルを用いてロボット学習2026/6/1
人間のビデオから学習した行動・力学・価値表現をロボットに転移し、失敗状態を修正するDGAC法を提案。7つの実世界操作タスクで成功率を40%から81%に向上させ、ロボットの自己改善を実証した。
- AERO-VIS: 非同期イベントベースのリアルタイムオンボード視覚慣性SLAMSLAM2026/5/1
イベントカメラのストリームを非同期に処理するステレオイベント慣性SLAMシステムを提案し、UAV搭載で閉ループ制御と大規模状態推定を実現した。
- OpenSGA: オープンワールドにおける効率的な3Dシーングラフアライメント3Dシーングラフ2026/5/1
3Dシーングラフ間のオブジェクト対応を推定する統一フレームワークを提案し、視覚言語・テキスト・幾何特徴を融合して大規模座標ずれでも高精度なアライメントを実現。大規模データセットScanNet-SGも導入。
- HumanFlow: 拡散駆動による人間追跡・予測・制御の密結合で実現するMAVの人間環境ナビゲーションナビゲーション2026/5/1
3Dシーン文脈を条件とした潜在拡散モデルで人間の動作追跡と予測を統合し、重い遮蔽下でも高精度・高効率な予測を実現。さらに、その潜在表現をフローマッチングに基づく近似MPCポリシーに密結合し、実人間軌跡を用いたシミュレーションでMAVの社会的ナビゲーション性能を向上させた。
- DigiForest: 持続可能な林業のためのデジタル分析とロボティクス林業ロボティクス2026/4/1
森林管理の持続可能性向上を目指し、自律ロボット群による樹木データ収集、自動特性抽出、意思決定支援、低影響伐採を統合した大規模精密林業システムを提案・実証した論文。
- OKVIS2-X: 高密度深度やLiDAR、GNSSに対応可能なキーフレームベース視覚慣性SLAMSLAM2025/10/1
視覚・慣性・深度・LiDAR・GNSSを統合し、高密度ボリュメトリックマップをリアルタイム生成するSLAMシステムを提案。大規模環境でもスケールし、高精度な軌道推定を実現。
- HumanHalo:人間環境下での安全かつ効率的な3Dナビゲーションを実現する最小保守的MPCナビゲーション2025/10/1
人間の動きをデータ駆動で予測し、到達可能性に基づく安全制約を初期入力のみに課すMPCで、ドローンが人間の間を安全かつ効率的に3Dナビゲーションする手法を提案。
- GOPLA: 人間の配置の合成拡張による汎化可能な物体配置学習マニピュレーション2025/10/1
人間の配置デモを合成データで拡張し、MLLMと拡散プランナを組み合わせて、意味的・幾何的制約を考慮した汎用的な物体配置を学習する階層的フレームワーク。
- Actron3D: 動画から操作可能な神経関数を学習し、転移可能なロボットマニピュレーションを実現マニピュレーション2025/10/1
未キャリブレーションの単眼RGB人間動画2〜3本から、物体中心の神経アフォーダンス関数を学習し、6自由度マニピュレーションスキルを転移させるフレームワーク。
- FindAnything: 任意環境でのロボット探索のためのオープンボキャブラリかつオブジェクト中心のマッピングマッピング2025/4/1
視覚言語特徴をオブジェクト単位で集約し、大規模未知環境でもリアルタイムに動作するオープンボキャブラリな3Dマッピング手法を提案。
- REGRACE: 一貫性評価を用いた堅牢で効率的なグラフベース再位置推定アルゴリズム再位置推定2025/3/1
LiDARサブマップとグラフニューラルネットワークを用いて、回転不変な物体特徴と近傍文脈を学習し、スケーラブルなBag-of-Wordsで再訪を検出する再位置推定手法を提案。幾何的一貫性で再訪を判定し、従来手法と同等の精度で2倍高速化を実現。
- VidBot: 野生の2D人間動画から汎化可能な3D行動を学習し、ゼロショットロボットマニピュレーションを実現VLA2025/3/1
インターネット上の一人称RGB動画から3Dハンド軌跡を抽出し、粗から細へのアフォーダンス学習と拡散モデルでロボットのゼロショット操作を可能にするフレームワークを提案。
- FrontierNet: 視覚的手がかりで探索する学習モデル探索2025/1/1
RGB画像と単眼深度からフロンティアを提案し情報利得を予測する視覚ベースの探索システムを開発し、3D地図依存の手法より初期探索効率を15%改善した。
- 不確かさを考慮した視覚慣性SLAMとボリュメトリック占有マッピングSLAM2024/9/1
深層学習による深度予測と不確かさを確率的に融合し、視覚慣性SLAMと密な占有マップ生成を統合した手法を提案。局所化・マッピング精度で最先端を上回り、リアルタイムでロボット計画に使える占有情報を提供する。
- LiDARと深度カメラに対応した視覚慣性SLAMによるサブマップベースのMAV自律探索探索2024/9/1
サブマップ単位の視覚慣性SLAMとサンプリングベースの次善視点計画を組み合わせ、LiDARまたは深度カメラのどちらでも動くMAVの自律探索フレームワークを提案し、シミュレーションと実機で有効性を示した。
- IN-Sight: 視覚による対話型ナビゲーションナビゲーション2024/8/1
RGB-D観測から走行可能性を推定し、障害物と対話しながら経路計画を行う自己教師ありナビゲーション手法を提案し、四足歩行ロボットANYmalで実環境へのゼロショット転移を実証した。
- 密結合LiDAR-視覚-慣性SLAMと大規模ボリュメトリック占有マッピングSLAM2024/3/1
LiDAR・視覚・慣性を密結合したSLAMと、サブマップ戦略による大規模3D占有マッピングを提案し、高精度な姿勢推定とグローバルに整合した占有マップを実現した。
- DynamicGlue: グラフニューラルネットワークによる動的環境でのエピポーラ・時間情報を活用したデータ対応付けSLAM2024/3/1
動的環境でのSLAM向けに、エピポーラ幾何と時間情報をグラフに組み込んだGNNベースのスパース特徴マッチングネットワークを提案し、動物体上のキーポイントを除外しつつ高精度な対応付けを実現した。
- 移動ロボットシステムによるオンライン樹木再構成と森林インベントリ森林計測/移動ロボット2024/3/1
移動型レーザースキャナを用いて、森林内を移動しながらリアルタイムで樹木を検出・再構成し、森林インベントリをオンライン生成するシステムを提案した。ポーズグラフLiDAR SLAMでデータを逐次更新し、TLSや手動測定に匹敵する精度を達成した。
- 視覚慣性SLAMと制御バリア関数による複雑環境下での安全なMAV遠隔操作安全制御/遠隔操作2024/3/1
非専門家によるMAV遠隔操作において、機載の視覚慣性SLAMと制御バリア関数を組み合わせた安全フィルタを構築し、複雑な未知環境での衝突回避を実現した。
- LiDAR不要のVisual-Inertial SLAMと高密度サブマップによるスケーラブルな屋外自律ドローン飛行自律飛行2024/3/1
低コストな視覚・慣性センサのみを用いたVI-SLAMと高密度占有サブマップを組み合わせ、森林のような非構造屋外環境で最大3m/sの自律飛行を衝突なしに実現したシステムを提案。
- FuncGrasp: Learning Object-Centric Neural Grasp Functions from Single Annotated Example Object2024/2/1
- Anthropomorphic Grasping with Neural Object Shape Completion2023/11/1
- BodySLAM++: Fast and Tightly-Coupled Visual-Inertial Camera and Human Motion Tracking2023/9/1
- GloPro: Globally-Consistent Uncertainty-Aware 3D Human Pose Estimation & Tracking in the Wild2023/9/1
- SimpleMapping: Real-Time Visual-Inertial Dense Mapping with Deep Multi-View Stereo2023/6/1
- Finding Things in the Unknown: Semantic Object-Centric Exploration with an MAV2023/2/1
- Visual-Inertial Multi-Instance Dynamic SLAM with Object-level Relocalisation2022/8/1
- Learning to Complete Object Shapes for Object-level Mapping in Dynamic Scenes2022/8/1
- Visual-Inertial SLAM with Tightly-Coupled Dropout-Tolerant GPS Fusion2022/8/1
- Dense RGB-D-Inertial SLAM with Map Deformations2022/7/1
- DeepFusion: Real-Time Dense 3D Reconstruction for Monocular SLAM using Single-View Depth and Gradient Predictions2022/7/1
- Towards the Probabilistic Fusion of Learned Priors into Standard Pipelines for 3D Reconstruction2022/7/1
- BodySLAM: Joint Camera Localisation, Mapping, and Human Motion Tracking2022/5/1
- Symmetry and Uncertainty-Aware Object SLAM for 6DoF Object Pose Estimation2022/5/1
- Volumetric Occupancy Mapping With Probabilistic Depth Completion for Robotic Navigation2020/12/1
- Multi-Resolution 3D Mapping with Explicit Free Space Representation for Fast and Accurate Mobile Robot Motion Planning2020/10/1
- Elastic and Efficient LiDAR Reconstruction for Large-Scale Exploration Tasks2020/10/1
- Deep Probabilistic Feature-metric Tracking2020/8/1
- Aerial Manipulation Using Hybrid Force and Position NMPC Applied to Aerial Writing2020/6/1
- Fast Frontier-based Information-driven Autonomous Exploration with an MAV2020/2/1
- Towards Bounding-Box Free Panoptic Segmentation2020/2/1
- Nonlinear MPC with Motor Failure Identification and Recovery for Safe and Aggressive Multicopter Flight2020/2/1
- Event-based Vision: A Survey2019/4/1
- MID-Fusion: Octree-based Object-Level Multi-Instance Dynamic SLAM2018/12/1
- InteriorNet: Mega-scale Multi-sensor Photo-realistic Indoor Scenes Dataset2018/9/1
- Towards an Embodied Semantic Fovea: Semantic 3D scene reconstruction from ego-centric eye-tracker videos2018/7/1
- Deep Learning a Grasp Function for Grasping under Gripper Pose Uncertainty2016/8/1
- A Primer on the Differential Calculus of 3D Orientations2016/6/1
- Pairwise Decomposition of Image Sequences for Active Multi-View Recognition2016/5/1
- Place Recognition with Event-based Cameras and a Neural Implementation of SeqSLAM2015/5/1