Rainer Stiefelhagen
Karlsruhe Institute of Technology
収録論文 65本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboFind: 視覚障害者のためのマルチエージェント個人向け物体探索物体探索2026/9/17
スマホで対象物を教示し、四足ロボットが探索・照合するマルチエージェントシステムを構築し、実機実験で高い成功率と誤検出の低減を示した。
- GuideFetch: 支援ロボット犬における並行ナビゲーションと物体回収のためのタスク調整フレームワーク群制御2026/8/18
盲人ユーザーを案内するロボット犬と、コーヒーを回収して届ける別のロボット犬が並行して動作する状況を想定し、LLMを用いて計画を検証・実行する調整フレームワークを提案した。
- X$^2$Localizer: プログレッシブなクロスビュー動画地理的定位のためのクロス粒度アライメント地理的定位2026/8/17
本論文は、地上視点の動画を対応する航空画像に位置づけるクロスビュー動画地理的定位(CVG)を、部分的な観測や動的な時間予算に対応できるプログレッシブな設定(PCVG)に拡張し、新しいフレームワークX$^2$Localizerを提案する。
- 手中心のビデオデモからの人間からロボットへの軌道転写:オープンワールド接触位置特定によるアプローチ模倣学習/軌道転写2026/6/1
人間のビデオデモから、接触情報を考慮した多様なロボット軌道を生成するフレームワークを提案。手と物体の接触区間を特定し、把持意図をロボットの並行ジョー把持に変換して軌道を生成する。
- EgoExoMem: 同期した自己中心・他者中心ビデオにわたるクロスビュー記憶推論ビデオ理解/ベンチマーク2026/5/18
自己中心視点と他者中心視点の同期ビデオを用いたクロスビュー記憶推論のベンチマークを新たに構築し、既存のマルチモーダルLLMでは困難であることを示した。また、学習不要のフレーム選択手法E^2-Selectを提案し、ベースラインを上回る性能を達成した。
- IMPACT-Scribe: 境界スケッチとクエリ計画による対話型時間行動セグメンテーション行動セグメンテーション2026/5/3
手動修正を活用して将来の協調を改善する、手続き動画の高密度ラベリングのための対話型フレームワークを提案。
- 速さか強さか:重み付き集約とトークンプルーニングによる柔軟な視覚場所認識視覚場所認識2026/5/1
視覚場所認識の性能と推論速度を両立するため、クラスタへの重み付き集約で識別性を高め、トークンプルーニングで特徴抽出コストを削減する手法を提案した。
- IMPACT-HOI: 開始点固定型部分HOIイベント構築のための監督制御データアノテーション2026/5/1
人間のデモからロボット操作を学習するための高品質な構造化データを生成するため、一人称視点の手順動画における人-物体インタラクション(HOI)のイベントグラフを、人間とAIの協調で効率的にアノテーションするフレームワークを提案した。
- ノイズラベルを伴う睡眠ステージングのためのマルチソースドメイン汎化手法時系列分類/ドメイン汎化2026/4/1
睡眠ステージングにおけるラベルノイズとドメインシフトが共存する問題に取り組み、時間・周波数特徴と早期学習正則化を組み合わせたFF-TRUSTを提案し、5つの公開データセットで最先端性能を達成した。
- 犬には障害物でなく人間には危険:盲導犬ロボットのための共自我ナビゲーションシステム歩行2026/3/1
盲導犬ロボットのナビゲーションにおいて、ロボットの地面センサーでは検知できないが人間の身長では危険な障害物(例:曲がった枝)を扱うため、ユーザーの視点を統合した二重分岐の回避システムを提案し、実験で有効性を示した。
- RefAtomNet++: 意味検索に基づくマルチトラジェクトリMambaによる参照的原子ビデオ行動認識の高度化VLA2025/10/1
自然言語で指定された人物の細粒度行動を認識するタスク(RAVAR)に対し、部分キーワード・シーン属性・文全体の3階層で意味を揃えたクロスアテンションとマルチトラジェクトリMambaを組み合わせたRefAtomNet++を提案し、大規模データセットRefAVA++で評価した。
- 不完全ラベル下でのLiDARセマンティックセグメンテーションにおける単一ドメイン汎化の探求LiDARセグメンテーション2025/10/1
LiDAR点群のノイズラベル下でのドメイン汎化タスクを新たに定義し、ベンチマークを構築するとともに、強弱2分岐のDuNeフレームワークを提案して最先端性能を達成した。
- ノイズラベル下のオープンセット領域汎化のための証拠信頼性対応残差フローメタ学習メタ学習2025/10/1
ノイズラベルを含むデータで未知カテゴリを新領域で認識するオープンセット領域汎化のため、証拠的信頼性と残差フローマッチングを組み合わせたメタ学習手法を提案し、最先端性能を達成した。
- スナップ・セグメント・デプロイ:ウェアラブル産業アシスタントのための視覚データと検出パイプライン産業支援/オンデバイスVLM2025/7/1
オンデバイスで動作する軽量物体検出・音声認識・RAGを統合した産業アシスタントを提案し、ドメインシフトに強い二段階学習とGear8データセットで有効性を示した。
- RoHOI: 人物-物体インタラクション検出のためのロバスト性ベンチマーク人物-物体インタラクション検出2025/7/1
人物-物体インタラクション検出モデルのロバスト性を評価する初のベンチマークRoHOIを提案し、20種類の汚染条件下での性能低下を分析。ロバスト性向上のためのSAMPL戦略も提案。
- HopaDIFF: 多人数シーンにおける参照人物行動セグメンテーションのための全体・部分認識フーリエ条件拡散モデル行動セグメンテーション2025/6/1
テキスト記述で指定した人物の行動を多人数動画から切り分ける新タスクを提案し、133本の映画からなるデータセットRHAS133と、全体・部分の長距離推論とフーリエ条件を組み合わせた拡散モデルHopaDIFFを構築した。
- ノイズラベル下での動画ベース運転者行動認識の探求行動認識2025/4/1
運転者行動認識においてラベルノイズに対処する初の手法を提案し、クラスタリングとサンプル選択で高精度化を実現した。
- VISO-Grasp: 視覚言語情報に基づく空間物体中心の6自由度能動視点計画と遮蔽・不可視環境での把持マニピュレーション2025/3/1
基盤モデルを活用し、深刻な遮蔽環境でも対象物体を把持するため、空間関係を考慮した能動視点計画と多視点不確実性融合による6自由度把持を実現したシステム。
- 指示付き原子行動認識行動認識2024/7/1
テキスト記述に基づいて特定人物の原子行動を動画から認識する新タスクRAVARを提案し、データセットRefAVAと専用手法RefAtomNetを構築した。
- 遮蔽を考慮したシームレスセグメンテーションセグメンテーション2024/7/1
パノラマ画像の狭い視野・遮蔽・ドメインギャップを同時に解決する新タスクOASSを提案し、データセットBlendPASSと手法UnmaskFormerを構築した。
- ノイズラベルに頑健な骨格ベース人間行動認識フレームワークNoiseEraSAR行動認識2024/3/1
骨格データによる行動認識で問題となるラベルノイズに対処するため、サンプル選択・共教示・クロスモーダルMoEを統合したNoiseEraSARを提案し、ベンチマークで最高性能を達成した。
- EchoTrack: 自動運転のための音声指示によるマルチオブジェクト追跡マルチオブジェクト追跡2024/2/1
音声指示に基づいて動画内の特定物体を追跡するAR-MOTタスクを提案し、音声と映像を双方向に融合するEchoTrackフレームワークと大規模ベンチマークを構築した。
- Fourier Prompt Tuning for Modality-Incomplete Scene Segmentation2024/1/1
- Navigating Open Set Scenarios for Skeleton-based Action Recognition2023/12/1
- Quantized Distillation: Optimizing Driver Activity Recognition Models for Resource-Constrained Environments2023/11/1
- CoBEV: Elevating Roadside 3D Object Detection with Depth and Height Complementarity2023/10/1
- Elevating Skeleton-Based Action Recognition with Efficient Multi-Modality Self-Supervision2023/9/1
- Exploring Self-supervised Skeleton-based Action Recognition in Occluded Environments2023/9/1
- OAFuser: Towards Omni-Aperture Fusion for Light Field Semantic Segmentation2023/7/1
- Open Scene Understanding: Grounded Situation Recognition Meets Segment Anything for Helping People with Visual Impairments2023/7/1
- Tightly-Coupled LiDAR-Visual SLAM Based on Geometric Features for Mobile Agents2023/7/1
- Exploring Few-Shot Adaptation for Activity Recognition on Diverse Domains2023/5/1
- FishDreamer: Towards Fisheye Semantic Completion via Unified Image Outpainting and Segmentation2023/3/1
- Towards Activated Muscle Group Estimation in the Wild2023/3/1
- MateRobot: Material Recognition in Wearable Robotics for People with Visual Impairments2023/2/1
- Anticipative Feature Fusion Transformer for Multi-Modal Action Anticipation2022/10/1
- Trans4Map: Revisiting Holistic Bird's-Eye-View Mapping from Egocentric Images to Allocentric Semantics with Vision Transformers2022/7/1
- Behind Every Domain There is a Shift: Adapting Distortion-aware Vision Transformers for Panoramic Semantic Segmentation2022/7/1
- Multi-modal Depression Estimation based on Sub-attentional Fusion2022/7/1
- Panoramic Panoptic Segmentation: Insights Into Surrounding Parsing for Mobile Agents via Unsupervised Contrastive Learning2022/6/1
- Indoor Navigation Assistance for Visually Impaired People via Dynamic SLAM and Panoptic Segmentation with an RGB-D Sensor2022/4/1
- CMX: Cross-Modal Fusion for RGB-X Semantic Segmentation with Transformers2022/3/1
- MatchFormer: Interleaving Attention in Transformers for Feature Matching2022/3/1
- Continuous Self-Localization on Aerial Images Using Visual and Lidar Sensors2022/3/1
- TransDARC: Transformer-based Driver Activity Recognition with Latent Space Feature Calibration2022/3/1
- Towards Robust Semantic Segmentation of Accident Scenes via Multi-Source Mixed Sampling and Meta-Learning2022/3/1
- Bending Reality: Distortion-aware Transformers for Adapting to Panoramic Semantic Segmentation2022/3/1
- TransKD: Transformer Knowledge Distillation for Efficient Semantic Segmentation2022/2/1
- Delving Deep into One-Shot Skeleton-based Action Recognition with Diverse Occlusions2022/2/1
- Transfer beyond the Field of View: Dense Panoramic Semantic Segmentation via Unsupervised Domain Adaptation2021/10/1
- Flying Guide Dog: Walkable Path Discovery for the Visually Impaired Utilizing Drones and Transformer-based Semantic Segmentation2021/8/1
- DensePASS: Dense Panoramic Semantic Segmentation via Unsupervised Domain Adaptation with Attention-Augmented Context Exchange2021/8/1
- Trans4Trans: Efficient Transformer for Transparent Object and Semantic Scene Segmentation in Real-World Navigation Assistance2021/8/1
- Trans4Trans: Efficient Transformer for Transparent Object Segmentation to Help Visually Impaired People Navigate in the Real World2021/7/1
- Let's Play for Action: Recognizing Activities of Daily Living by Learning from Life Simulation Video Games2021/7/1
- HIDA: Towards Holistic Indoor Understanding for the Visually Impaired via Semantic Instance Segmentation with a Wearable Solid-State LiDAR Sensor2021/7/1
- MASS: Multi-Attentional Semantic Segmentation of LiDAR Data for Dense Top-View Understanding2021/7/1
- Pose2Drone: A Skeleton-Pose-based Framework for Human-Drone Interaction2021/5/1
- Panoramic Panoptic Segmentation: Towards Complete Surrounding Understanding via Unsupervised Contrastive Learning2021/3/1
- Panoptic Lintention Network: Towards Efficient Navigational Perception for the Visually Impaired2021/3/1
- Perception Framework through Real-Time Semantic Segmentation and Scene Recognition on a Wearable System for the Visually Impaired2021/3/1
- Capturing Omni-Range Context for Omnidirectional Segmentation2021/3/1
- DR-TANet: Dynamic Receptive Temporal Attention Network for Street Scene Change Detection2021/3/1
- DS-PASS: Detail-Sensitive Panoramic Annular Semantic Segmentation through SwaftNet for Surrounding Sensing2019/9/1
- What's the point? Frame-wise Pointing Gesture Recognition with Latent-Dynamic Conditional Random Fields2015/10/1