Kunyu Peng
Karlsruhe Institute of Technology
収録論文 72本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 局所的な動画理解は遭遇をまたいで転移するか?EgoGearsベンチマーク一人称視点/動画理解/ベンチマーク2026/9/29
一人称視点の動画を単一・複数本で比較するベンチマークEgoGearsを提案し、複数動画間での対応付けや証拠統合が必要になるとMLLMの性能が平均22.5ポイント低下することを示した。
- HEIR: 機能的役割を伴う人-実体インタラクションの学習HOI認識2026/9/28
人と物体・人・自己のインタラクションを「誰がどの役割で何をするか」という完全な参加者-役割集合として捉える画像ベンチマークHEIRと、共有実体識別子を用いて役割条件付き証拠を統合し集合予測するCoRISPを提案。
- φ-RIE: フォトリアリスティック再構成からインタラクティブ環境へsim2real2026/9/22
3Dガウススプラッティングで再構成したシーンから、選択した物体をシミュレータで動かせるアセットに変換し、背景も補完してインタラクティブ環境を構築するパイプラインを提案。
- LiDAR言語モデルは時空間関係を本当に理解しているのか?VLA2026/9/21
4D LiDAR言語モデルの時空間推論を診断するため、nuScenesを用いた1万問のベンチマークLiDAR-Halluを提案し、集計精度では隠れる失敗を明らかにした。
- 潜在行動モデルにおける代数的整合性だけでは時間構造を保証できないVLA2026/9/20
潜在行動モデルの代数的整合性(加法性・反対称性)が時間構造の獲得を証明しないことを示し、制約なしモデルでも同程度の誤差削減が得られることを明らかにした。
- FOCAL-VLA:サブタスク誘導型幾何蒸留と暗黙的ワールドモデリングによる視覚言語行動モデルVLA2026/9/18
サブタスクに関連する領域に絞って幾何知識を蒸留し、将来の3D変化を暗黙的にモデル化することで、精密かつ長期的なロボット操作を可能にするVLAフレームワークを提案。
- INSPECT: アシスタント利用からロボットの視点選択を学習視点選択2026/9/17
スマートグラスによる組立支援の記録から、ロボットが部品の有無や正しい取付を確認するための視点選択方策を学習する手法を提案。
- CoRef-GS: マルチエージェント協調型参照3DガウシアンスプラッティングVLA2026/9/17
複数ロボットが各自構築した3Dガウシアンマップを統合し、言語クエリで対象物を特定する協調型シーン理解フレームワークを提案。
- RoboFind: 視覚障害者のためのマルチエージェント個人向け物体探索物体探索2026/9/17
スマホで対象物を教示し、四足ロボットが探索・照合するマルチエージェントシステムを構築し、実機実験で高い成功率と誤検出の低減を示した。
- GuideFetch: 支援ロボット犬における並行ナビゲーションと物体回収のためのタスク調整フレームワーク群制御2026/8/18
盲人ユーザーを案内するロボット犬と、コーヒーを回収して届ける別のロボット犬が並行して動作する状況を想定し、LLMを用いて計画を検証・実行する調整フレームワークを提案した。
- X$^2$Localizer: プログレッシブなクロスビュー動画地理的定位のためのクロス粒度アライメント地理的定位2026/8/17
本論文は、地上視点の動画を対応する航空画像に位置づけるクロスビュー動画地理的定位(CVG)を、部分的な観測や動的な時間予算に対応できるプログレッシブな設定(PCVG)に拡張し、新しいフレームワークX$^2$Localizerを提案する。
- HGeo-TopoMap: 階層的幾何事前情報によるトポロジカルマッピングの強化自動運転/トポロジカルマップ2026/7/1
自動運転のためのトポロジカルマップ生成において、逆透視マッピングによる道路構造マップと空間関係を活用し、中心線検出を階層的に強化する手法を提案した。
- 手中心のビデオデモからの人間からロボットへの軌道転写:オープンワールド接触位置特定によるアプローチ模倣学習/軌道転写2026/6/1
人間のビデオデモから、接触情報を考慮した多様なロボット軌道を生成するフレームワークを提案。手と物体の接触区間を特定し、把持意図をロボットの並行ジョー把持に変換して軌道を生成する。
- PS-MOT: 点シードからインスタンス認識を育成するマルチオブジェクト追跡マルチオブジェクト追跡2026/6/1
バウンディングボックスではなく点のアノテーションだけでマルチオブジェクト追跡を実現する手法を提案。データ・モデル・損失の各レベルで点からインスタンスへの階層的パイプラインを構築し、既存の点教師付き追跡手法を上回る性能を達成した。
- 共に見る:マルチモーダル大規模言語モデルによる多ロボット協調的自我中心空間推論群制御2026/5/18
複数の移動ロボットの同期した一人称視点ビデオを統合し、空間・時間・可視性・協調に関する質問に答える多ロボット協調動的空間推論の課題を研究。新ベンチマークCoopSRとデータセットEgoTeamを構築し、提案手法SP-CoRが既存MLLMを上回る性能を示した。
- EgoExoMem: 同期した自己中心・他者中心ビデオにわたるクロスビュー記憶推論ビデオ理解/ベンチマーク2026/5/18
自己中心視点と他者中心視点の同期ビデオを用いたクロスビュー記憶推論のベンチマークを新たに構築し、既存のマルチモーダルLLMでは困難であることを示した。また、学習不要のフレーム選択手法E^2-Selectを提案し、ベースラインを上回る性能を達成した。
- IMPACT-Scribe: 境界スケッチとクエリ計画による対話型時間行動セグメンテーション行動セグメンテーション2026/5/3
手動修正を活用して将来の協調を改善する、手続き動画の高密度ラベリングのための対話型フレームワークを提案。
- IMPACT-HOI: 開始点固定型部分HOIイベント構築のための監督制御データアノテーション2026/5/1
人間のデモからロボット操作を学習するための高品質な構造化データを生成するため、一人称視点の手順動画における人-物体インタラクション(HOI)のイベントグラフを、人間とAIの協調で効率的にアノテーションするフレームワークを提案した。
- ノイズラベルを伴う睡眠ステージングのためのマルチソースドメイン汎化手法時系列分類/ドメイン汎化2026/4/1
睡眠ステージングにおけるラベルノイズとドメインシフトが共存する問題に取り組み、時間・周波数特徴と早期学習正則化を組み合わせたFF-TRUSTを提案し、5つの公開データセットで最先端性能を達成した。
- ProOOD: プロトタイプ誘導による分布外3D占有予測3D占有予測2026/4/1
自動運転向けの3D占有予測において、長尾クラスバイアスと分布外入力への脆弱性を軽減する、プロトタイプ誘導の軽量プラグアンドプレイ手法を提案した。
- M²-Occ: カメラ入力欠損に頑健な自動運転向け3D意味占有予測3D意味占有予測2026/3/1
一部のカメラ視点が欠損しても、特徴空間でのマスク再構成とクラス別意味プロトタイプのメモリバンクにより、3D意味占有予測の幾何構造と意味的一貫性を保つ手法を提案。
- InterEdit: テキスト誘導による3D二人組動作編集動作生成2026/3/1
テキスト指示に従って二人の3D動作を編集する新タスクを提案し、専用データセットと拡散モデルベースの手法を構築した。
- 信頼できないボクセルを信頼できるか?ラベルノイズ下での3Dセマンティック占有予測の探求3D知覚/ラベルノイズ2026/3/1
3D占有予測におけるラベルノイズ問題を体系的に調査する初のベンチマークOccNLを構築し、時間的記憶と構造的親和性を活用したノイズ耐性フレームワークDPR-Occを提案した。
- 視野を超えて:外挿型ドメイン適応パノラマセグメンテーションセグメンテーション/ドメイン適応2026/3/1
局所視点画像で学習し、360度パノラマ画像でテストする外挿型ドメイン適応セグメンテーション手法を提案。視野の幾何学的ずれと未知クラスの意味的不確実性を扱う。
- 犬には障害物でなく人間には危険:盲導犬ロボットのための共自我ナビゲーションシステム歩行2026/3/1
盲導犬ロボットのナビゲーションにおいて、ロボットの地面センサーでは検知できないが人間の身長では危険な障害物(例:曲がった枝)を扱うため、ユーザーの視点を統合した二重分岐の回避システムを提案し、実験で有効性を示した。
- OmniTrack++: 大視野軌道フィードバック学習による全方向マルチオブジェクト追跡マルチオブジェクト追跡2025/11/1
360度視野のパノラマ動画で複数物体を追跡するため、軌道情報をフィードバックして知覚を段階的に改善するフレームワークを提案し、四足・二足ロボットで収集した新ベンチマークEmboTrackを構築した。
- 不完全ラベル下でのLiDARセマンティックセグメンテーションにおける単一ドメイン汎化の探求LiDARセグメンテーション2025/10/1
LiDAR点群のノイズラベル下でのドメイン汎化タスクを新たに定義し、ベンチマークを構築するとともに、強弱2分岐のDuNeフレームワークを提案して最先端性能を達成した。
- ノイズラベル下のオープンセット領域汎化のための証拠信頼性対応残差フローメタ学習メタ学習2025/10/1
ノイズラベルを含むデータで未知カテゴリを新領域で認識するオープンセット領域汎化のため、証拠的信頼性と残差フローマッチングを組み合わせたメタ学習手法を提案し、最先端性能を達成した。
- RefAtomNet++: 意味検索に基づくマルチトラジェクトリMambaによる参照的原子ビデオ行動認識の高度化VLA2025/10/1
自然言語で指定された人物の細粒度行動を認識するタスク(RAVAR)に対し、部分キーワード・シーン属性・文全体の3階層で意味を揃えたクロスアテンションとマルチトラジェクトリMambaを組み合わせたRefAtomNet++を提案し、大規模データセットRefAVA++で評価した。
- Segment-to-Act: 身体性知能に向けたラベルノイズに頑健な行動プロンプト付きビデオセグメンテーションビデオセグメンテーション2025/9/1
行動ベースのビデオ物体セグメンテーションにおけるテキストプロンプトノイズとマスクアノテーションノイズに対処するため、初のベンチマークActiSeg-NLを構築し、6つのラベルノイズ学習戦略を適応・評価するとともに、マスクノイズに対処するParallel Mask Head Mechanismを提案した。
- スナップ・セグメント・デプロイ:ウェアラブル産業アシスタントのための視覚データと検出パイプライン産業支援/オンデバイスVLM2025/7/1
オンデバイスで動作する軽量物体検出・音声認識・RAGを統合した産業アシスタントを提案し、ドメインシフトに強い二段階学習とGear8データセットで有効性を示した。
- 360度を幻視する:局所シーン拡散と確率的プロンプティングによるパノラマ街路ビュー生成生成モデル2025/7/1
自動運転向けに、ステッチされたパノラマ画像を制御信号として一貫性のある360度パノラマ街路ビューを生成する初の手法Percep360を提案。局所シーン拡散法と確率的プロンプティング法で一貫性と制御性を実現。
- RoHOI: 人物-物体インタラクション検出のためのロバスト性ベンチマーク人物-物体インタラクション検出2025/7/1
人物-物体インタラクション検出モデルのロバスト性を評価する初のベンチマークRoHOIを提案し、20種類の汚染条件下での性能低下を分析。ロバスト性向上のためのSAMPL戦略も提案。
- 分布外意味占有予測3D知覚2025/6/1
自動運転向け3D意味占有予測において、分布外物体を検出する新タスクを提案し、合成異常を注入するデータ拡張と、ボクセルとBEV表現を統合するOccOoDフレームワークで検出性能を向上させた。
- 制約からの解放:ソースフリー遮蔽認識シームレスセグメンテーションセグメンテーション2025/6/1
ソースデータやラベルなしで全景画像のセグメンテーションを行う新しいタスクSFOASSを提案し、UNLOCKという手法で360度視点と遮蔽認識を実現した。
- HopaDIFF: 多人数シーンにおける参照人物行動セグメンテーションのための全体・部分認識フーリエ条件拡散モデル行動セグメンテーション2025/6/1
テキスト記述で指定した人物の行動を多人数動画から切り分ける新タスクを提案し、133本の映画からなるデータセットRHAS133と、全体・部分の長距離推論とフーリエ条件を組み合わせた拡散モデルHopaDIFFを構築した。
- ノイズラベル下での動画ベース運転者行動認識の探求行動認識2025/4/1
運転者行動認識においてラベルノイズに対処する初の手法を提案し、クラスタリングとサンプル選択で高精度化を実現した。
- LFX: ライトフィールドの密な意味セグメンテーションと顕著物体検出を統合するフレームワークライトフィールド認識2025/3/1
ライトフィールドの異なる表現形式に依存せず、意味セグメンテーションと顕著物体検出を同時に扱える初の統一学習フレームワークLFXを提案し、複数ベンチマークで最高精度を達成した。
- VISO-Grasp: 視覚言語情報に基づく空間物体中心の6自由度能動視点計画と遮蔽・不可視環境での把持マニピュレーション2025/3/1
基盤モデルを活用し、深刻な遮蔽環境でも対象物体を把持するため、空間関係を考慮した能動視点計画と多視点不確実性融合による6自由度把持を実現したシステム。
- 遮蔽を考慮したシームレスセグメンテーションセグメンテーション2024/7/1
パノラマ画像の狭い視野・遮蔽・ドメインギャップを同時に解決する新タスクOASSを提案し、データセットBlendPASSと手法UnmaskFormerを構築した。
- 指示付き原子行動認識行動認識2024/7/1
テキスト記述に基づいて特定人物の原子行動を動画から認識する新タスクRAVARを提案し、データセットRefAVAと専用手法RefAtomNetを構築した。
- ノイズラベルに頑健な骨格ベース人間行動認識フレームワークNoiseEraSAR行動認識2024/3/1
骨格データによる行動認識で問題となるラベルノイズに対処するため、サンプル選択・共教示・クロスモーダルMoEを統合したNoiseEraSARを提案し、ベンチマークで最高性能を達成した。
- EchoTrack: 自動運転のための音声指示によるマルチオブジェクト追跡マルチオブジェクト追跡2024/2/1
音声指示に基づいて動画内の特定物体を追跡するAR-MOTタスクを提案し、音声と映像を双方向に融合するEchoTrackフレームワークと大規模ベンチマークを構築した。
- Fourier Prompt Tuning for Modality-Incomplete Scene Segmentation2024/1/1
- LF Tracy: A Unified Single-Pipeline Approach for Salient Object Detection in Light Field Cameras2024/1/1
- Navigating Open Set Scenarios for Skeleton-based Action Recognition2023/12/1
- Quantized Distillation: Optimizing Driver Activity Recognition Models for Resource-Constrained Environments2023/11/1
- Elevating Skeleton-Based Action Recognition with Efficient Multi-Modality Self-Supervision2023/9/1
- Exploring Self-supervised Skeleton-based Action Recognition in Occluded Environments2023/9/1
- OAFuser: Towards Omni-Aperture Fusion for Light Field Semantic Segmentation2023/7/1
- Tightly-Coupled LiDAR-Visual SLAM Based on Geometric Features for Mobile Agents2023/7/1
- Open Scene Understanding: Grounded Situation Recognition Meets Segment Anything for Helping People with Visual Impairments2023/7/1
- Exploring Few-Shot Adaptation for Activity Recognition on Diverse Domains2023/5/1
- Towards Activated Muscle Group Estimation in the Wild2023/3/1
- FishDreamer: Towards Fisheye Semantic Completion via Unified Image Outpainting and Segmentation2023/3/1
- MateRobot: Material Recognition in Wearable Robotics for People with Visual Impairments2023/2/1
- Behind Every Domain There is a Shift: Adapting Distortion-aware Vision Transformers for Panoramic Semantic Segmentation2022/7/1
- Trans4Map: Revisiting Holistic Bird's-Eye-View Mapping from Egocentric Images to Allocentric Semantics with Vision Transformers2022/7/1
- Multi-modal Depression Estimation based on Sub-attentional Fusion2022/7/1
- Indoor Navigation Assistance for Visually Impaired People via Dynamic SLAM and Panoptic Segmentation with an RGB-D Sensor2022/4/1
- Bending Reality: Distortion-aware Transformers for Adapting to Panoramic Semantic Segmentation2022/3/1
- MatchFormer: Interleaving Attention in Transformers for Feature Matching2022/3/1
- TransDARC: Transformer-based Driver Activity Recognition with Latent Space Feature Calibration2022/3/1
- Towards Robust Semantic Segmentation of Accident Scenes via Multi-Source Mixed Sampling and Meta-Learning2022/3/1
- Delving Deep into One-Shot Skeleton-based Action Recognition with Diverse Occlusions2022/2/1
- TransKD: Transformer Knowledge Distillation for Efficient Semantic Segmentation2022/2/1
- Transfer beyond the Field of View: Dense Panoramic Semantic Segmentation via Unsupervised Domain Adaptation2021/10/1
- Trans4Trans: Efficient Transformer for Transparent Object and Semantic Scene Segmentation in Real-World Navigation Assistance2021/8/1
- HIDA: Towards Holistic Indoor Understanding for the Visually Impaired via Semantic Instance Segmentation with a Wearable Solid-State LiDAR Sensor2021/7/1
- Trans4Trans: Efficient Transformer for Transparent Object Segmentation to Help Visually Impaired People Navigate in the Real World2021/7/1
- MASS: Multi-Attentional Semantic Segmentation of LiDAR Data for Dense Top-View Understanding2021/7/1
- PillarSegNet: Pillar-based Semantic Grid Map Estimation using Sparse LiDAR Data2021/5/1