Di Wen
Karlsruhe Institute of Technology
収録論文 33本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 局所的な動画理解は遭遇をまたいで転移するか?EgoGearsベンチマーク一人称視点/動画理解/ベンチマーク2026/9/29
一人称視点の動画を単一・複数本で比較するベンチマークEgoGearsを提案し、複数動画間での対応付けや証拠統合が必要になるとMLLMの性能が平均22.5ポイント低下することを示した。
- HEIR: 機能的役割を伴う人-実体インタラクションの学習HOI認識2026/9/28
人と物体・人・自己のインタラクションを「誰がどの役割で何をするか」という完全な参加者-役割集合として捉える画像ベンチマークHEIRと、共有実体識別子を用いて役割条件付き証拠を統合し集合予測するCoRISPを提案。
- LiDAR言語モデルは時空間関係を本当に理解しているのか?VLA2026/9/21
4D LiDAR言語モデルの時空間推論を診断するため、nuScenesを用いた1万問のベンチマークLiDAR-Halluを提案し、集計精度では隠れる失敗を明らかにした。
- 潜在行動モデルにおける代数的整合性だけでは時間構造を保証できないVLA2026/9/20
潜在行動モデルの代数的整合性(加法性・反対称性)が時間構造の獲得を証明しないことを示し、制約なしモデルでも同程度の誤差削減が得られることを明らかにした。
- FOCAL-VLA:サブタスク誘導型幾何蒸留と暗黙的ワールドモデリングによる視覚言語行動モデルVLA2026/9/18
サブタスクに関連する領域に絞って幾何知識を蒸留し、将来の3D変化を暗黙的にモデル化することで、精密かつ長期的なロボット操作を可能にするVLAフレームワークを提案。
- CoRef-GS: マルチエージェント協調型参照3DガウシアンスプラッティングVLA2026/9/17
複数ロボットが各自構築した3Dガウシアンマップを統合し、言語クエリで対象物を特定する協調型シーン理解フレームワークを提案。
- RoboFind: 視覚障害者のためのマルチエージェント個人向け物体探索物体探索2026/9/17
スマホで対象物を教示し、四足ロボットが探索・照合するマルチエージェントシステムを構築し、実機実験で高い成功率と誤検出の低減を示した。
- INSPECT: アシスタント利用からロボットの視点選択を学習視点選択2026/9/17
スマートグラスによる組立支援の記録から、ロボットが部品の有無や正しい取付を確認するための視点選択方策を学習する手法を提案。
- GuideFetch: 支援ロボット犬における並行ナビゲーションと物体回収のためのタスク調整フレームワーク群制御2026/8/18
盲人ユーザーを案内するロボット犬と、コーヒーを回収して届ける別のロボット犬が並行して動作する状況を想定し、LLMを用いて計画を検証・実行する調整フレームワークを提案した。
- HGeo-TopoMap: 階層的幾何事前情報によるトポロジカルマッピングの強化自動運転/トポロジカルマップ2026/7/1
自動運転のためのトポロジカルマップ生成において、逆透視マッピングによる道路構造マップと空間関係を活用し、中心線検出を階層的に強化する手法を提案した。
- 手中心のビデオデモからの人間からロボットへの軌道転写:オープンワールド接触位置特定によるアプローチ模倣学習/軌道転写2026/6/1
人間のビデオデモから、接触情報を考慮した多様なロボット軌道を生成するフレームワークを提案。手と物体の接触区間を特定し、把持意図をロボットの並行ジョー把持に変換して軌道を生成する。
- EgoExoMem: 同期した自己中心・他者中心ビデオにわたるクロスビュー記憶推論ビデオ理解/ベンチマーク2026/5/18
自己中心視点と他者中心視点の同期ビデオを用いたクロスビュー記憶推論のベンチマークを新たに構築し、既存のマルチモーダルLLMでは困難であることを示した。また、学習不要のフレーム選択手法E^2-Selectを提案し、ベースラインを上回る性能を達成した。
- 共に見る:マルチモーダル大規模言語モデルによる多ロボット協調的自我中心空間推論群制御2026/5/18
複数の移動ロボットの同期した一人称視点ビデオを統合し、空間・時間・可視性・協調に関する質問に答える多ロボット協調動的空間推論の課題を研究。新ベンチマークCoopSRとデータセットEgoTeamを構築し、提案手法SP-CoRが既存MLLMを上回る性能を示した。
- IMPACT-Scribe: 境界スケッチとクエリ計画による対話型時間行動セグメンテーション行動セグメンテーション2026/5/3
手動修正を活用して将来の協調を改善する、手続き動画の高密度ラベリングのための対話型フレームワークを提案。
- IMPACT-HOI: 開始点固定型部分HOIイベント構築のための監督制御データアノテーション2026/5/1
人間のデモからロボット操作を学習するための高品質な構造化データを生成するため、一人称視点の手順動画における人-物体インタラクション(HOI)のイベントグラフを、人間とAIの協調で効率的にアノテーションするフレームワークを提案した。
- ProOOD: プロトタイプ誘導による分布外3D占有予測3D占有予測2026/4/1
自動運転向けの3D占有予測において、長尾クラスバイアスと分布外入力への脆弱性を軽減する、プロトタイプ誘導の軽量プラグアンドプレイ手法を提案した。
- ノイズラベルを伴う睡眠ステージングのためのマルチソースドメイン汎化手法時系列分類/ドメイン汎化2026/4/1
睡眠ステージングにおけるラベルノイズとドメインシフトが共存する問題に取り組み、時間・周波数特徴と早期学習正則化を組み合わせたFF-TRUSTを提案し、5つの公開データセットで最先端性能を達成した。
- 信頼できないボクセルを信頼できるか?ラベルノイズ下での3Dセマンティック占有予測の探求3D知覚/ラベルノイズ2026/3/1
3D占有予測におけるラベルノイズ問題を体系的に調査する初のベンチマークOccNLを構築し、時間的記憶と構造的親和性を活用したノイズ耐性フレームワークDPR-Occを提案した。
- 犬には障害物でなく人間には危険:盲導犬ロボットのための共自我ナビゲーションシステム歩行2026/3/1
盲導犬ロボットのナビゲーションにおいて、ロボットの地面センサーでは検知できないが人間の身長では危険な障害物(例:曲がった枝)を扱うため、ユーザーの視点を統合した二重分岐の回避システムを提案し、実験で有効性を示した。
- M²-Occ: カメラ入力欠損に頑健な自動運転向け3D意味占有予測3D意味占有予測2026/3/1
一部のカメラ視点が欠損しても、特徴空間でのマスク再構成とクラス別意味プロトタイプのメモリバンクにより、3D意味占有予測の幾何構造と意味的一貫性を保つ手法を提案。
- InterEdit: テキスト誘導による3D二人組動作編集動作生成2026/3/1
テキスト指示に従って二人の3D動作を編集する新タスクを提案し、専用データセットと拡散モデルベースの手法を構築した。
- ノイズラベル下のオープンセット領域汎化のための証拠信頼性対応残差フローメタ学習メタ学習2025/10/1
ノイズラベルを含むデータで未知カテゴリを新領域で認識するオープンセット領域汎化のため、証拠的信頼性と残差フローマッチングを組み合わせたメタ学習手法を提案し、最先端性能を達成した。
- RefAtomNet++: 意味検索に基づくマルチトラジェクトリMambaによる参照的原子ビデオ行動認識の高度化VLA2025/10/1
自然言語で指定された人物の細粒度行動を認識するタスク(RAVAR)に対し、部分キーワード・シーン属性・文全体の3階層で意味を揃えたクロスアテンションとマルチトラジェクトリMambaを組み合わせたRefAtomNet++を提案し、大規模データセットRefAVA++で評価した。
- 不完全ラベル下でのLiDARセマンティックセグメンテーションにおける単一ドメイン汎化の探求LiDARセグメンテーション2025/10/1
LiDAR点群のノイズラベル下でのドメイン汎化タスクを新たに定義し、ベンチマークを構築するとともに、強弱2分岐のDuNeフレームワークを提案して最先端性能を達成した。
- Segment-to-Act: 身体性知能に向けたラベルノイズに頑健な行動プロンプト付きビデオセグメンテーションビデオセグメンテーション2025/9/1
行動ベースのビデオ物体セグメンテーションにおけるテキストプロンプトノイズとマスクアノテーションノイズに対処するため、初のベンチマークActiSeg-NLを構築し、6つのラベルノイズ学習戦略を適応・評価するとともに、マスクノイズに対処するParallel Mask Head Mechanismを提案した。
- スナップ・セグメント・デプロイ:ウェアラブル産業アシスタントのための視覚データと検出パイプライン産業支援/オンデバイスVLM2025/7/1
オンデバイスで動作する軽量物体検出・音声認識・RAGを統合した産業アシスタントを提案し、ドメインシフトに強い二段階学習とGear8データセットで有効性を示した。
- RoHOI: 人物-物体インタラクション検出のためのロバスト性ベンチマーク人物-物体インタラクション検出2025/7/1
人物-物体インタラクション検出モデルのロバスト性を評価する初のベンチマークRoHOIを提案し、20種類の汚染条件下での性能低下を分析。ロバスト性向上のためのSAMPL戦略も提案。
- HopaDIFF: 多人数シーンにおける参照人物行動セグメンテーションのための全体・部分認識フーリエ条件拡散モデル行動セグメンテーション2025/6/1
テキスト記述で指定した人物の行動を多人数動画から切り分ける新タスクを提案し、133本の映画からなるデータセットRHAS133と、全体・部分の長距離推論とフーリエ条件を組み合わせた拡散モデルHopaDIFFを構築した。
- ノイズラベル下での動画ベース運転者行動認識の探求行動認識2025/4/1
運転者行動認識においてラベルノイズに対処する初の手法を提案し、クラスタリングとサンプル選択で高精度化を実現した。
- VISO-Grasp: 視覚言語情報に基づく空間物体中心の6自由度能動視点計画と遮蔽・不可視環境での把持マニピュレーション2025/3/1
基盤モデルを活用し、深刻な遮蔽環境でも対象物体を把持するため、空間関係を考慮した能動視点計画と多視点不確実性融合による6自由度把持を実現したシステム。
- 指示付き原子行動認識行動認識2024/7/1
テキスト記述に基づいて特定人物の原子行動を動画から認識する新タスクRAVARを提案し、データセットRefAVAと専用手法RefAtomNetを構築した。
- ノイズラベルに頑健な骨格ベース人間行動認識フレームワークNoiseEraSAR行動認識2024/3/1
骨格データによる行動認識で問題となるラベルノイズに対処するため、サンプル選択・共教示・クロスモーダルMoEを統合したNoiseEraSARを提案し、ベンチマークで最高性能を達成した。
- Exploring Few-Shot Adaptation for Activity Recognition on Diverse Domains2023/5/1