Junwei Zheng
Karlsruhe Institute of Technology
収録論文 31本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 局所的な動画理解は遭遇をまたいで転移するか?EgoGearsベンチマーク一人称視点/動画理解/ベンチマーク2026/9/29
一人称視点の動画を単一・複数本で比較するベンチマークEgoGearsを提案し、複数動画間での対応付けや証拠統合が必要になるとMLLMの性能が平均22.5ポイント低下することを示した。
- HEIR: 機能的役割を伴う人-実体インタラクションの学習HOI認識2026/9/28
人と物体・人・自己のインタラクションを「誰がどの役割で何をするか」という完全な参加者-役割集合として捉える画像ベンチマークHEIRと、共有実体識別子を用いて役割条件付き証拠を統合し集合予測するCoRISPを提案。
- LiDAR言語モデルは時空間関係を本当に理解しているのか?VLA2026/9/21
4D LiDAR言語モデルの時空間推論を診断するため、nuScenesを用いた1万問のベンチマークLiDAR-Halluを提案し、集計精度では隠れる失敗を明らかにした。
- INSPECT: アシスタント利用からロボットの視点選択を学習視点選択2026/9/17
スマートグラスによる組立支援の記録から、ロボットが部品の有無や正しい取付を確認するための視点選択方策を学習する手法を提案。
- RoboFind: 視覚障害者のためのマルチエージェント個人向け物体探索物体探索2026/9/17
スマホで対象物を教示し、四足ロボットが探索・照合するマルチエージェントシステムを構築し、実機実験で高い成功率と誤検出の低減を示した。
- GuideFetch: 支援ロボット犬における並行ナビゲーションと物体回収のためのタスク調整フレームワーク群制御2026/8/18
盲人ユーザーを案内するロボット犬と、コーヒーを回収して届ける別のロボット犬が並行して動作する状況を想定し、LLMを用いて計画を検証・実行する調整フレームワークを提案した。
- X$^2$Localizer: プログレッシブなクロスビュー動画地理的定位のためのクロス粒度アライメント地理的定位2026/8/17
本論文は、地上視点の動画を対応する航空画像に位置づけるクロスビュー動画地理的定位(CVG)を、部分的な観測や動的な時間予算に対応できるプログレッシブな設定(PCVG)に拡張し、新しいフレームワークX$^2$Localizerを提案する。
- EgoExoMem: 同期した自己中心・他者中心ビデオにわたるクロスビュー記憶推論ビデオ理解/ベンチマーク2026/5/18
自己中心視点と他者中心視点の同期ビデオを用いたクロスビュー記憶推論のベンチマークを新たに構築し、既存のマルチモーダルLLMでは困難であることを示した。また、学習不要のフレーム選択手法E^2-Selectを提案し、ベースラインを上回る性能を達成した。
- 共に見る:マルチモーダル大規模言語モデルによる多ロボット協調的自我中心空間推論群制御2026/5/18
複数の移動ロボットの同期した一人称視点ビデオを統合し、空間・時間・可視性・協調に関する質問に答える多ロボット協調動的空間推論の課題を研究。新ベンチマークCoopSRとデータセットEgoTeamを構築し、提案手法SP-CoRが既存MLLMを上回る性能を示した。
- IMPACT-Scribe: 境界スケッチとクエリ計画による対話型時間行動セグメンテーション行動セグメンテーション2026/5/3
手動修正を活用して将来の協調を改善する、手続き動画の高密度ラベリングのための対話型フレームワークを提案。
- IMPACT-HOI: 開始点固定型部分HOIイベント構築のための監督制御データアノテーション2026/5/1
人間のデモからロボット操作を学習するための高品質な構造化データを生成するため、一人称視点の手順動画における人-物体インタラクション(HOI)のイベントグラフを、人間とAIの協調で効率的にアノテーションするフレームワークを提案した。
- 速さか強さか:重み付き集約とトークンプルーニングによる柔軟な視覚場所認識視覚場所認識2026/5/1
視覚場所認識の性能と推論速度を両立するため、クラスタへの重み付き集約で識別性を高め、トークンプルーニングで特徴抽出コストを削減する手法を提案した。
- ノイズラベルを伴う睡眠ステージングのためのマルチソースドメイン汎化手法時系列分類/ドメイン汎化2026/4/1
睡眠ステージングにおけるラベルノイズとドメインシフトが共存する問題に取り組み、時間・周波数特徴と早期学習正則化を組み合わせたFF-TRUSTを提案し、5つの公開データセットで最先端性能を達成した。
- InterEdit: テキスト誘導による3D二人組動作編集動作生成2026/3/1
テキスト指示に従って二人の3D動作を編集する新タスクを提案し、専用データセットと拡散モデルベースの手法を構築した。
- 信頼できないボクセルを信頼できるか?ラベルノイズ下での3Dセマンティック占有予測の探求3D知覚/ラベルノイズ2026/3/1
3D占有予測におけるラベルノイズ問題を体系的に調査する初のベンチマークOccNLを構築し、時間的記憶と構造的親和性を活用したノイズ耐性フレームワークDPR-Occを提案した。
- 犬には障害物でなく人間には危険:盲導犬ロボットのための共自我ナビゲーションシステム歩行2026/3/1
盲導犬ロボットのナビゲーションにおいて、ロボットの地面センサーでは検知できないが人間の身長では危険な障害物(例:曲がった枝)を扱うため、ユーザーの視点を統合した二重分岐の回避システムを提案し、実験で有効性を示した。
- RefAtomNet++: 意味検索に基づくマルチトラジェクトリMambaによる参照的原子ビデオ行動認識の高度化VLA2025/10/1
自然言語で指定された人物の細粒度行動を認識するタスク(RAVAR)に対し、部分キーワード・シーン属性・文全体の3階層で意味を揃えたクロスアテンションとマルチトラジェクトリMambaを組み合わせたRefAtomNet++を提案し、大規模データセットRefAVA++で評価した。
- ノイズラベル下のオープンセット領域汎化のための証拠信頼性対応残差フローメタ学習メタ学習2025/10/1
ノイズラベルを含むデータで未知カテゴリを新領域で認識するオープンセット領域汎化のため、証拠的信頼性と残差フローマッチングを組み合わせたメタ学習手法を提案し、最先端性能を達成した。
- RoHOI: 人物-物体インタラクション検出のためのロバスト性ベンチマーク人物-物体インタラクション検出2025/7/1
人物-物体インタラクション検出モデルのロバスト性を評価する初のベンチマークRoHOIを提案し、20種類の汚染条件下での性能低下を分析。ロバスト性向上のためのSAMPL戦略も提案。
- スナップ・セグメント・デプロイ:ウェアラブル産業アシスタントのための視覚データと検出パイプライン産業支援/オンデバイスVLM2025/7/1
オンデバイスで動作する軽量物体検出・音声認識・RAGを統合した産業アシスタントを提案し、ドメインシフトに強い二段階学習とGear8データセットで有効性を示した。
- HopaDIFF: 多人数シーンにおける参照人物行動セグメンテーションのための全体・部分認識フーリエ条件拡散モデル行動セグメンテーション2025/6/1
テキスト記述で指定した人物の行動を多人数動画から切り分ける新タスクを提案し、133本の映画からなるデータセットRHAS133と、全体・部分の長距離推論とフーリエ条件を組み合わせた拡散モデルHopaDIFFを構築した。
- ノイズラベル下での動画ベース運転者行動認識の探求行動認識2025/4/1
運転者行動認識においてラベルノイズに対処する初の手法を提案し、クラスタリングとサンプル選択で高精度化を実現した。
- 指示付き原子行動認識行動認識2024/7/1
テキスト記述に基づいて特定人物の原子行動を動画から認識する新タスクRAVARを提案し、データセットRefAVAと専用手法RefAtomNetを構築した。
- ノイズラベルに頑健な骨格ベース人間行動認識フレームワークNoiseEraSAR行動認識2024/3/1
骨格データによる行動認識で問題となるラベルノイズに対処するため、サンプル選択・共教示・クロスモーダルMoEを統合したNoiseEraSARを提案し、ベンチマークで最高性能を達成した。
- Fourier Prompt Tuning for Modality-Incomplete Scene Segmentation2024/1/1
- Navigating Open Set Scenarios for Skeleton-based Action Recognition2023/12/1
- Elevating Skeleton-Based Action Recognition with Efficient Multi-Modality Self-Supervision2023/9/1
- Exploring Self-supervised Skeleton-based Action Recognition in Occluded Environments2023/9/1
- Open Scene Understanding: Grounded Situation Recognition Meets Segment Anything for Helping People with Visual Impairments2023/7/1
- Tightly-Coupled LiDAR-Visual SLAM Based on Geometric Features for Mobile Agents2023/7/1
- MateRobot: Material Recognition in Wearable Robotics for People with Visual Impairments2023/2/1