Hermann Blum
University of Bonn
収録論文 39本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ForceTwin: 計測された人間の操作からロボットマニピュレーションのための物理情報デジタルツインを構築マニピュレーション2026/9/18
力覚グリッパで人間が物体を操作した際の姿勢と力を用い、慣性・摩擦・機構動力学を含む物理情報デジタルツインを同定する手法を提案し、インピーダンス制御のフィードフォワードモデルとして目標達成率を大幅に改善した。
- DINOcular: 自己教師あり視空間表現の学習視覚表現学習2026/8/27
RGB-D観測から視覚と空間情報を同時に学習する自己教師ありフレームワークを提案し、3D認識性能を向上させつつセマンティック転移も維持する。
- Map-Det3D: ストリーミング入力からの多視点3D物体検出のためのメトリックフィードフォワード3D再構築事前知識3D物体検出2026/8/12
単眼ビデオから直接メトリック3D空間で物体検出を行うため、RGBから3D再構築するフィードフォワードモデルを幾何学的バックボーンとして利用し、2Dから3Dへのリフティングを回避する新しいオンライン多視点3D物体検出モデルを提案した。
- DVPSFormer: 自動運転のための効率的なオンライン深度対応ビデオパノプティックセグメンテーションパノプティックセグメンテーション2026/7/28
自動運転向けに、深度・セマンティックセグメンテーション・インスタンス追跡を統合したオンライン4Dシーン理解アーキテクチャを提案。明示的なシーン離散化とオンライン多数決により、リアルタイム処理を実現し、ベンチマークでSOTAを達成。
- コンタクトフロー:異なる身体構造間で転移可能なビデオ行動条件付け世界モデル2026/7/1
操作における接触点の3D軌跡を行動表現として用いることで、人間のデモと異なるロボット間で共有可能な世界モデルを構築し、物理的に妥当な操作結果を予測する手法を提案した。
- LIME: 一人称視点ビデオから意図を考慮したカメラモーションを学習するカメラモーション生成2026/7/1
ロボットが自然言語の指示に基づいて次に観察すべきカメラの相対姿勢を生成する手法を提案。一人称ビデオから多様な意図とカメラ動作のペアを学習し、観察利得の予測と連続的なフローマッチングによる姿勢生成を組み合わせる。
- ArtiTwinSplat: RGB-Dビデオからのガウシアンスプラッティングによるインタラクティブなデジタルツイン再構築デジタルツイン/3D再構築2026/6/1
RGB-Dビデオから物体の可動部構造と関節運動を自動推定し、写真のようにリアルで操作可能なデジタルツインを構築するフレームワークを提案。CADモデルや手動アノテーションを不要とし、実世界の観測から直接ロボットの計画・学習に使えるモデルを生成する。
- SYMBOLIZER: VLMを用いたシンボル不要のモデルフリータスクプランニングタスクプランニング2026/4/1
視覚言語モデル(VLM)を用いて画像からシンボル状態を推定し、アクションモデルを必要としないドメイン非依存の探索でタスクプランニングを行うフレームワークを提案した。
- OpenFrontier: 視覚言語に基づくフロンティアを用いた汎用ナビゲーションナビゲーション2026/3/1
視覚言語モデルを活用し、フロンティアを意味的アンカーとして用いることで、タスク固有の学習や微調整なしに効率的なゼロショットナビゲーションを実現するフレームワークを提案。
- 開世界モバイルマニピュレーションのための関節3Dシーングラフモバイルマニピュレーション2026/2/1
RGB-D動画から物体の関節運動を推定し、親子関係を含む意味的・運動学的3Dシーングラフを構築するフレームワークMoMa-SGを提案。
- Hoi!:力に基づくクロスビュー関節物体操作のマルチモーダルデータセットマニピュレーション2025/12/1
人間とロボットの4つの操作形態で関節物体を操作した3048シーケンスを収録し、視覚・力・触覚を統合したデータセットを構築した。
- ActLoc: 能動的視点選択による移動中の自己位置推定ナビゲーション2025/8/1
地図構築時のカメラ姿勢を学習し、任意の3D位置でのヨー・ピッチ方向の自己位置推定精度を予測する注意機構モデルを提案。これを経路計画に組み込み、タスク・運動制約下で自己位置推定が最も頑健になる視点を能動的に選ぶ枠組み。
- osmAG-LLM: セマンティックマップと大規模言語モデルの推論によるゼロショットオープンボキャブラリ物体ナビゲーション物体ナビゲーション2025/7/1
高精細な地図ではなく環境の文脈とLLMの意味的知識を組み合わせ、物体が移動・未マップでも能動的に探索して目的物体へ到達するナビゲーションシステムを開発した。
- Spot-On: 複数ロボット協調のための複合現実インターフェース複合現実/群制御2025/5/1
複合現実(MR)を用いて複数の四足歩行ロボットを操作し、引き出しやドア、照明スイッチなどの協調作業を可能にするフレームワークを提案し、ユーザビリティを検証した。
- FunGraph: 機能を考慮した3Dシーングラフによる言語プロンプトに基づくシーン操作3Dシーングラフ2025/3/1
3Dリソースから2Dデータを生成して学習した検出器で、アフォーダンスに関わる部位を細粒度で検出し、3Dシーングラフ生成パイプラインを拡張することで、言語指示に基づく機能的なシーン操作を可能にした研究。
- 二視点ループ閉じによる再構築不要なスケーラブル軌道推定VSLAM2025/3/1
再構築を行わず、二視点ループ閉じと単眼深度事前分布を活用して、スケーラブルなVisual SLAMを実現する2GOシステムを提案。
- FrontierNet: 視覚的手がかりで探索する学習モデル探索2025/1/1
RGB画像と単眼深度からフロンティアを提案し情報利得を予測する視覚ベースの探索システムを開発し、3D地図依存の手法より初期探索効率を15%改善した。
- ロスト&ファウンド:一人称視点観測による3D動的シーングラフの変化追跡動的シーングラフ2024/11/1
一人称視点の記録から物体の6DoF姿勢を追跡し、動的シーングラフをオンライン更新する手法を提案。ロボットの教示・再現に応用可能。
- HoloSpot: 複合現実のドラッグ&ドロップによる直感的な物体操作遠隔操作2024/10/1
スキャンした部屋を縮小模型のホログラムとして表示し、ドラッグ&ドロップで指示した物体操作をSpotロボットの実動作に変換するMRインターフェースを開発した。
- SpotLight: インタラクションとアフォーダンス検出によるロボットのシーン理解アフォーダンス2024/9/1
VLMを用いたアフォーダンス予測で照明スイッチの操作を実現し、物理的インタラクションを通じてシーングラフの関係を学習するフレームワークを提案。
- NeuSurfEmb: CADモデル不要の密対応ベース6D物体姿勢推定パイプライン6D姿勢推定2024/7/1
少数の実画像からNeural Surface表現を学習し、その新規視点合成とカット&ペースト拡張で姿勢推定器を訓練することで、CADモデルなしで高精度な6D物体姿勢推定を実現した。
- どこを見るべきかを学習:幾何情報を用いた能動的定位のための自己教師あり視点選択能動的定位2024/7/1
幾何情報を活用した自己教師あり学習により、ロボットが定位精度を高めるための視点をリアルタイムに選択する手法を提案し、合成・実データで既存手法を上回る性能を示した。
- Spot-Compose: 点群におけるオープンボキャブラリ物体検索と引き出し操作のフレームワークマニピュレーション2024/4/1
市販の3Dスキャナで得た点群を使い、オープンボキャブラリなインスタンス分割と把持姿勢推定を組み合わせて、実環境で物体の動的ピッキングと引き出し開けを行うフレームワークを構築した。
- SNI-SLAM: Semantic Neural Implicit SLAM2023/11/1
- Active Visual Localization for Multi-Agent Collaboration: A Data-Driven Approach2023/10/1
- A 3D Mixed Reality Interface for Human-Robot Teaming2023/10/1
- Unsupervised Continual Semantic Adaptation through Neural Rendering2022/11/1
- SCIM: Simultaneous Clustering, Inference, and Mapping for Open-World Semantic Scene Understanding2022/6/1
- Embodied Active Domain Adaptation for Semantic Segmentation via Informative Path Planning2022/3/1
- SL Sensor: An Open-Source, ROS-Based, Real-Time Structured Light Sensor for High Accuracy Construction Robotic Applications2022/1/1
- Continual Adaptation of Semantic Segmentation using Complementary 2D-3D Data Representations2021/11/1
- See Yourself in Others: Attending Multiple Tasks for Own Failure Detection2021/10/1
- Self-Improving Semantic Perception for Indoor Localisation2021/5/1
- Precise Robot Localization in Architectural 3D Plans2020/6/1
- Accurate Mapping and Planning for Autonomous Racing2020/3/1
- A Fully-Integrated Sensing and Control System for High-Accuracy Mobile Robotic Building Construction2019/12/1
- Active Learning for UAV-based Semantic Mapping2019/8/1
- Learning Densities in Feature Space for Reliable Segmentation of Indoor Scenes2019/8/1
- Modular Sensor Fusion for Semantic Segmentation2018/7/1