Kailun Yang
Hunan University
収録論文 156本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- UniTrackPLA:指示に基づくナビゲーションと動的人物追跡のための統合パノラマ・言語・行動モデルVLA2026/10/1
全方位パノラマ観測を活用し、言語指示ナビゲーションと人物追跡を単一モデルで行う統合VLAを提案。行動予測の一貫性検証により再計画を可能にし、シミュレーションと実環境で性能を向上させた。
- HEIR: 機能的役割を伴う人-実体インタラクションの学習HOI認識2026/9/28
人と物体・人・自己のインタラクションを「誰がどの役割で何をするか」という完全な参加者-役割集合として捉える画像ベンチマークHEIRと、共有実体識別子を用いて役割条件付き証拠を統合し集合予測するCoRISPを提案。
- 孤立エンティティを超えて:教師なしビデオ異常検知のための関係考慮型マルチエンティティモデリングビデオ異常検知2026/9/23
人物と物体の見た目・動き・空間配置を統合的にモデル化し、エンティティ間の関係の異常を検知する教師なしビデオ異常検知フレームワークINTERACTを提案。
- LiDAR言語モデルは時空間関係を本当に理解しているのか?VLA2026/9/21
4D LiDAR言語モデルの時空間推論を診断するため、nuScenesを用いた1万問のベンチマークLiDAR-Halluを提案し、集計精度では隠れる失敗を明らかにした。
- PanOVOcc: 長期空間ボクセルメモリを用いたパノラマ身体性オープン語彙占有マッピング占有マッピング2026/9/21
パノラマRGB-D列から、学習不要でオープン語彙の意味的占有マップをオンライン構築するフレームワークを提案し、新ベンチマークで大幅な精度向上を示した。
- PanoFuse: パノラマ強化型視覚-言語-行動学習と分離型意味-幾何ルーティングVLA2026/9/21
全方向パノラマ知覚をVLAに統合し、意味情報と幾何情報を分離して経路選択するDSGRにより、遮蔽や未知環境下でのマニピュレーション成功率を向上させた。
- 潜在行動モデルにおける代数的整合性だけでは時間構造を保証できないVLA2026/9/20
潜在行動モデルの代数的整合性(加法性・反対称性)が時間構造の獲得を証明しないことを示し、制約なしモデルでも同程度の誤差削減が得られることを明らかにした。
- CoRef-GS: マルチエージェント協調型参照3DガウシアンスプラッティングVLA2026/9/17
複数ロボットが各自構築した3Dガウシアンマップを統合し、言語クエリで対象物を特定する協調型シーン理解フレームワークを提案。
- OmniMimic: 力学補完による動作拡張で多様式な全方向四足歩行を実現歩行2026/9/17
限られた方向の動物動作データを時間反転や力学補完で拡張し、前後左右・旋回を含む多様な歩容を単一の方策で学習する枠組みを提案した。
- RoboFind: 視覚障害者のためのマルチエージェント個人向け物体探索物体探索2026/9/17
スマホで対象物を教示し、四足ロボットが探索・照合するマルチエージェントシステムを構築し、実機実験で高い成功率と誤検出の低減を示した。
- INSPECT: アシスタント利用からロボットの視点選択を学習視点選択2026/9/17
スマートグラスによる組立支援の記録から、ロボットが部品の有無や正しい取付を確認するための視点選択方策を学習する手法を提案。
- Spheriverse: 実世界の球面観測による3Dシーン理解3Dシーン理解2026/9/8
球面画像とLiDARの大規模データセットを構築し、球面幾何を考慮した占有予測フレームワークSphereOccを提案して、セマンティック占有予測や3D物体検出のベンチマークで優れた性能を示した。
- TONAV: 関節物体の四足移動操作のためのタスク指向ナビゲーションと動作速度チャンク学習移動操作2026/8/23
四足ロボットによる関節物体の移動操作を統合するフレームワークを提案。タスク指向ナビゲーションと動作速度チャンク学習を組み合わせ、ナビゲーションと操作のギャップを解消し、安定した連続接触操作を実現した。
- GuideFetch: 支援ロボット犬における並行ナビゲーションと物体回収のためのタスク調整フレームワーク群制御2026/8/18
盲人ユーザーを案内するロボット犬と、コーヒーを回収して届ける別のロボット犬が並行して動作する状況を想定し、LLMを用いて計画を検証・実行する調整フレームワークを提案した。
- HGeo-TopoMap: 階層的幾何事前情報によるトポロジカルマッピングの強化自動運転/トポロジカルマップ2026/7/1
自動運転のためのトポロジカルマップ生成において、逆透視マッピングによる道路構造マップと空間関係を活用し、中心線検出を階層的に強化する手法を提案した。
- ラベル不要なターゲット領域適応によるイベント-画像特徴マッチングの二段階蒸留手法イベントカメラ/特徴マッチング/ドメイン適応2026/7/1
イベントカメラと通常画像間の画素対応を、ラベルやセンサー較正なしで学習する二段階蒸留フレームワークを提案し、実世界の非拘束データで自己進化可能な手法を実証した。
- OmniCoT:グローバルかつ多段階のパノラマ推論のためのベンチマーク空間推論2026/6/29
パノラマ画像におけるマルチモーダル大規模言語モデルの空間推論能力を評価・向上させるため、グローバルな証拠と多段階推論に焦点を当てたベンチマークOmniCoTを提案し、訓練データと評価データを整備した。
- DexPIE: 実世界経験からの安定した器用なポリシー改善器用操作/模倣学習2026/6/8
実世界展開で収集した経験を用いて、器用な操作ポリシーを事後訓練で改善するフレームワークを提案。介入システムとDAgger風データ収集、相対行動空間での非同期推論、連続最適性指標による条件付けで、デモデータのみのポリシーより成功率を37%向上させた。
- CylindTrack:パノラマ多物体追跡のための深度対応円筒運動モデリング多物体追跡2026/6/1
パノラマ映像における多物体追跡(MOT)の課題を解決するため、円筒座標系と深度情報を活用した追跡フレームワークCylindTrackを提案した。
- PS-MOT: 点シードからインスタンス認識を育成するマルチオブジェクト追跡マルチオブジェクト追跡2026/6/1
バウンディングボックスではなく点のアノテーションだけでマルチオブジェクト追跡を実現する手法を提案。データ・モデル・損失の各レベルで点からインスタンスへの階層的パイプラインを構築し、既存の点教師付き追跡手法を上回る性能を達成した。
- EgoExoMem: 同期した自己中心・他者中心ビデオにわたるクロスビュー記憶推論ビデオ理解/ベンチマーク2026/5/18
自己中心視点と他者中心視点の同期ビデオを用いたクロスビュー記憶推論のベンチマークを新たに構築し、既存のマルチモーダルLLMでは困難であることを示した。また、学習不要のフレーム選択手法E^2-Selectを提案し、ベースラインを上回る性能を達成した。
- 共に見る:マルチモーダル大規模言語モデルによる多ロボット協調的自我中心空間推論群制御2026/5/18
複数の移動ロボットの同期した一人称視点ビデオを統合し、空間・時間・可視性・協調に関する質問に答える多ロボット協調動的空間推論の課題を研究。新ベンチマークCoopSRとデータセットEgoTeamを構築し、提案手法SP-CoRが既存MLLMを上回る性能を示した。
- EgoEV-HandPose: ステレオイベントカメラによる自己中心視点の3D手姿勢推定とジェスチャ認識手姿勢推定/イベントカメラ2026/5/1
ステレオイベントカメラを用いて、自己中心視点での両手の3D姿勢推定とジェスチャ認識を同時に行うエンドツーエンドフレームワークを提案し、大規模な実世界データセットも構築した。
- E-VLA: 暗所・ぼやけシーンのためのイベント拡張型視覚言語行動モデルVLA/操作2026/4/1
暗所やモーションブラーなどの劣化環境でロバストな操作を実現するため、イベントカメラの情報をVLAモデルに統合するフレームワークを提案した。実機データセットと軽量な統合手法により、従来の画像のみでは失敗する状況で成功率を大幅に向上させた。
- ノイズラベルを伴う睡眠ステージングのためのマルチソースドメイン汎化手法時系列分類/ドメイン汎化2026/4/1
睡眠ステージングにおけるラベルノイズとドメインシフトが共存する問題に取り組み、時間・周波数特徴と早期学習正則化を組み合わせたFF-TRUSTを提案し、5つの公開データセットで最先端性能を達成した。
- BLaDA: 3DGSフィールド内で言語を機能的巧みな動作に橋渡しするマニピュレーション2026/4/1
言語指示を3Dガウススプラッティング場に基づく機能的把持の制約として解釈し、ゼロショットで器用な操作を実現するフレームワークを提案した。
- AnyUser: スケッチによるユーザ意図を家庭用ロボットへ変換するHRI/指示理解2026/4/1
カメラ画像への自由描画スケッチと任意の言語指示を統合し、事前マップやモデル不要で家庭用ロボットの実行可能な行動を生成する統一指示システムを提案。大規模データセットでの精度検証、実機2種でのタスク実行、多様なユーザ層でのユーザスタディにより有効性を示した。
- ProOOD: プロトタイプ誘導による分布外3D占有予測3D占有予測2026/4/1
自動運転向けの3D占有予測において、長尾クラスバイアスと分布外入力への脆弱性を軽減する、プロトタイプ誘導の軽量プラグアンドプレイ手法を提案した。
- O3N: 都市自律エージェントのための全方位オープンボキャブラリ占有予測3D占有予測2026/3/1
単一の全方位RGB画像から360度の3D占有を予測する初のオープンボキャブラリ手法を提案し、極座標スパイラルMambaと視覚・ボクセル・テキストの整合機構で高精度かつ汎化性能を実現した。
- 球面ガウス不透明度場による幾何認識型全方位3Dシーン再構成3D再構成2026/3/1
全方位カメラ向けにガウシアンスプラッティングを拡張し、球面上で直接レイサンプリングすることで歪みのない高品質な3D再構成を実現した。
- 四足ロボットのためのパノラママルチモーダル意味占有予測占有予測2026/3/1
四足ロボット向けに360度パノラマと複数センサを統合した世界初の実世界占有予測データセットPanoMMOccと、歩行時の揺れを補正して高精度に3D空間を認識するフレームワークVoxelHoundを提案した。
- PanoAffordanceNet:360度屋内環境における全体的アフォーダンス接地に向けてアフォーダンス接地2026/3/1
360度パノラマ画像から物体のアフォーダンス(行動可能性)をシーン全体で推定する新タスクを提案し、歪み補正と球面稠密化を組み込んだエンドツーエンドモデルと初のデータセットを構築した。
- OccTrack360: 全方位魚眼カメラによる4Dパノプティック占有追跡占有予測/追跡2026/3/1
全方位魚眼カメラ向けの長尺4Dパノプティック占有追跡ベンチマークOccTrack360と、球面歪みと位置ずれに対処するベースライン手法FoSOccを提案した。
- InterEdit: テキスト誘導による3D二人組動作編集動作生成2026/3/1
テキスト指示に従って二人の3D動作を編集する新タスクを提案し、専用データセットと拡散モデルベースの手法を構築した。
- 写真カメラにおける普遍的計算収差補正に向けて:包括的ベンチマーク分析計算収差補正2026/3/1
多様なレンズに汎用な計算収差補正のための大規模ベンチマークUniCACを構築し、24手法を比較評価して性能に影響する3要因を特定した。
- 信頼できないボクセルを信頼できるか?ラベルノイズ下での3Dセマンティック占有予測の探求3D知覚/ラベルノイズ2026/3/1
3D占有予測におけるラベルノイズ問題を体系的に調査する初のベンチマークOccNLを構築し、時間的記憶と構造的親和性を活用したノイズ耐性フレームワークDPR-Occを提案した。
- 視野を超えて:外挿型ドメイン適応パノラマセグメンテーションセグメンテーション/ドメイン適応2026/3/1
局所視点画像で学習し、360度パノラマ画像でテストする外挿型ドメイン適応セグメンテーション手法を提案。視野の幾何学的ずれと未知クラスの意味的不確実性を扱う。
- NOVA: 自動運転における3Dマルチオブジェクト追跡のための次段階オープンボキャブラリ自己回帰3D追跡/自動運転2026/3/1
3Dマルチオブジェクト追跡を、大規模言語モデルの自己回帰能力を利用して、軌跡を時空間セマンティックシーケンスとして扱い、次段階のシーケンス補完として定式化する新しい手法を提案。未知の物体カテゴリへの一般化を向上させ、nuScenesなどのデータセットで優れた性能を達成。
- 犬には障害物でなく人間には危険:盲導犬ロボットのための共自我ナビゲーションシステム歩行2026/3/1
盲導犬ロボットのナビゲーションにおいて、ロボットの地面センサーでは検知できないが人間の身長では危険な障害物(例:曲がった枝)を扱うため、ユーザーの視点を統合した二重分岐の回避システムを提案し、実験で有効性を示した。
- M²-Occ: カメラ入力欠損に頑健な自動運転向け3D意味占有予測3D意味占有予測2026/3/1
一部のカメラ視点が欠損しても、特徴空間でのマスク再構成とクラス別意味プロトタイプのメモリバンクにより、3D意味占有予測の幾何構造と意味的一貫性を保つ手法を提案。
- クロス視点知覚による細粒度対応学習で実現するオープンボキャブラリ6D物体姿勢推定6D姿勢推定2026/1/1
オープンボキャブラリ6D姿勢推定において、対象物体を背景から分離し、二視点特徴の融合とパッチ間相関行列による空間制約付きマッチングを行うFiCoPを提案し、REAL275とToyota-Lightで精度を大幅に改善した。
- TRACER: 変形物体操作のためのテクスチャ頑健なアフォーダンス連鎖推論マニピュレーション2026/1/1
外観やテクスチャの変化に頑健なアフォーダンス予測のため、階層的意味推論から機能領域の精緻化までを連鎖的に行うTRACERフレームワークを提案し、変形物体操作の精度を向上させた。
- OneOcc: 単一パノラマカメラによる脚式ロボットの意味的占有予測意味的占有予測2025/11/1
脚式ロボット向けに、単一のパノラマカメラ映像から360度の3D意味的占有を予測するフレームワークOneOccを提案。歩行時の揺れ補償や二重投影融合などの工夫で高精度を実現し、新たなベンチマークも公開。
- OmniTrack++: 大視野軌道フィードバック学習による全方向マルチオブジェクト追跡マルチオブジェクト追跡2025/11/1
360度視野のパノラマ動画で複数物体を追跡するため、軌道情報をフィードバックして知覚を段階的に改善するフレームワークを提案し、四足・二足ロボットで収集した新ベンチマークEmboTrackを構築した。
- RefAtomNet++: 意味検索に基づくマルチトラジェクトリMambaによる参照的原子ビデオ行動認識の高度化VLA2025/10/1
自然言語で指定された人物の細粒度行動を認識するタスク(RAVAR)に対し、部分キーワード・シーン属性・文全体の3階層で意味を揃えたクロスアテンションとマルチトラジェクトリMambaを組み合わせたRefAtomNet++を提案し、大規模データセットRefAVA++で評価した。
- 鮮明かつ奥行きのあるRGBD撮像:生物に着想を得た単心設計計算撮像2025/10/1
生物に倣った全球面単心レンズと深層学習を組み合わせ、単一撮影から全焦点画像と高精度な深度マップを同時に復元するRGBD撮像フレームワークを提案。
- ノイズラベル下のオープンセット領域汎化のための証拠信頼性対応残差フローメタ学習メタ学習2025/10/1
ノイズラベルを含むデータで未知カテゴリを新領域で認識するオープンセット領域汎化のため、証拠的信頼性と残差フローマッチングを組み合わせたメタ学習手法を提案し、最先端性能を達成した。
- CoBEVMoE: 動的Mixture-of-Expertsによる異種性を考慮した協調知覚のための特徴融合協調知覚2025/9/1
BEV空間で動的に生成されるエキスパート群を用いて、エージェント間の特徴の類似性と異質性を明示的にモデル化する協調知覚フレームワークを提案し、BEVセグメンテーションと3D物体検出で最高性能を達成した。
- Segment-to-Act: 身体性知能に向けたラベルノイズに頑健な行動プロンプト付きビデオセグメンテーションビデオセグメンテーション2025/9/1
行動ベースのビデオ物体セグメンテーションにおけるテキストプロンプトノイズとマスクアノテーションノイズに対処するため、初のベンチマークActiSeg-NLを構築し、6つのラベルノイズ学習戦略を適応・評価するとともに、マスクノイズに対処するParallel Mask Head Mechanismを提案した。
- イベントカメラ誘導による動的人体とシーンの3Dガウシアンスプラッティング再構成3D再構成/イベントカメラ2025/9/1
単眼イベントカメラ映像から、動く人体と静的シーンを3Dガウシアンスプラッティングで同時再構成する手法を提案。イベント誘導損失で高速運動時のブレを抑え、人体マスク不要で高精度を実現した。
- DepTR-MOT: 深度情報を活用した軌道精緻化によるマルチオブジェクト追跡マルチオブジェクト追跡2025/9/1
DETRベースの検出器にインスタンス単位の深度情報を組み込み、遮蔽や近接環境でのマルチオブジェクト追跡の精度を向上させた研究。
- UniFucGrasp:人間の手に着想を得た多様なロボットハンド向け機能把持アノテーション戦略とデータセットマニピュレーション2025/8/1
人間の手の動きを多様なロボットハンドに写像し、機能的な把持を自動注釈する手法と、複数ハンドに対応した初の機能把持データセットを構築した研究。
- QuaDreamer: 四足歩行ロボットのための制御可能なパノラマ動画生成データ生成2025/8/1
四足歩行ロボットの動きを模倣し、垂直振動特性を考慮した制御可能なパノラマ動画を生成する初のデータ生成エンジンを提案。
- RoHOI: 人物-物体インタラクション検出のためのロバスト性ベンチマーク人物-物体インタラクション検出2025/7/1
人物-物体インタラクション検出モデルのロバスト性を評価する初のベンチマークRoHOIを提案し、20種類の汚染条件下での性能低下を分析。ロバスト性向上のためのSAMPL戦略も提案。
- 360度を幻視する:局所シーン拡散と確率的プロンプティングによるパノラマ街路ビュー生成生成モデル2025/7/1
自動運転向けに、ステッチされたパノラマ画像を制御信号として一貫性のある360度パノラマ街路ビューを生成する初の手法Percep360を提案。局所シーン拡散法と確率的プロンプティング法で一貫性と制御性を実現。
- NRSeg: 走行世界モデルによるノイズ耐性BEVセマンティックセグメンテーション学習BEVセグメンテーション2025/7/1
走行世界モデルが生成する合成データのノイズに耐性のあるBEVセマンティックセグメンテーション学習フレームワークNRSegを提案。生成データの有用性を評価する指標と不確実性を考慮した予測手法を導入した。
- 分布外意味占有予測3D知覚2025/6/1
自動運転向け3D意味占有予測において、分布外物体を検出する新タスクを提案し、合成異常を注入するデータ拡張と、ボクセルとBEV表現を統合するOccOoDフレームワークで検出性能を向上させた。
- HopaDIFF: 多人数シーンにおける参照人物行動セグメンテーションのための全体・部分認識フーリエ条件拡散モデル行動セグメンテーション2025/6/1
テキスト記述で指定した人物の行動を多人数動画から切り分ける新タスクを提案し、133本の映画からなるデータセットRHAS133と、全体・部分の長距離推論とフーリエ条件を組み合わせた拡散モデルHopaDIFFを構築した。
- 制約からの解放:ソースフリー遮蔽認識シームレスセグメンテーションセグメンテーション2025/6/1
ソースデータやラベルなしで全景画像のセグメンテーションを行う新しいタスクSFOASSを提案し、UNLOCKという手法で360度視点と遮蔽認識を実現した。
- 言語駆動型デュアルスタイル混合による単一ドメイン汎化物体検出物体検出2025/5/1
VLMのスタイル意味情報を活用し、画像・特徴量レベルでスタイル混合を行うことで、単一ドメインから未知ドメインへの物体検出器の汎化性能を向上させる手法を提案。
- パノラマ分布外セグメンテーションセグメンテーション2025/5/1
360度パノラマ画像において、未知の物体(分布外)を検出する新タスクPanOoSを提案し、テキスト誘導プロンプト分布学習により既存手法を上回るPOSを実現した。
- ノイズラベル下での動画ベース運転者行動認識の探求行動認識2025/4/1
運転者行動認識においてラベルノイズに対処する初の手法を提案し、クラスタリングとサンプル選択で高精度化を実現した。
- TS-CGNet: 時空間融合と中心線誘導拡散によるBEVマッピングBEV知覚2025/3/1
時空間融合と中心線誘導拡散モデルを組み合わせ、悪天候や低照度でも高精度なBEVセマンティックマップを生成するフレームワークを提案。
- 言語ガイダンスでSAM2を活用するRGB-熱画像セマンティックセグメンテーションセグメンテーション2025/3/1
大規模学習済みのSAM2を言語ガイダンスで適応させ、RGBと熱画像の融合セグメンテーションを高精度化するSHIFNetを提案。
- HierDAMap: 階層的視点事前分布による汎用的なドメイン適応BEVマッピングBEVマッピング/ドメイン適応2025/3/1
自動運転向けBEVマッピングの教師なしドメイン適応において、グローバル・スパース・インスタンスの3階層の視点事前知識を活用する汎用フレームワークHierDAMapを提案した論文。
- 運動学的手法とLSTMモデルによる踵接地・つま先離地イベントの検出歩行2025/3/1
588名の健常者の4363歩行周期を対象に、7つの運動学的手法とLSTMモデルで踵接地・つま先離地を検出し、Zeni法とLSTMが同等の精度を示したことを明らかにした。
- 深度と意味プロンプトを活用したリソース効率の良いアフォーダンス推定アフォーダンス推定2025/3/1
RGB画像に深度画像をプロンプトとして組み込み、テキスト特徴で注意を誘導する軽量なアフォーダンス推定フレームワークを提案し、公開データセットで精度向上とパラメータ削減を実現した。
- EgoEvGesture: 一人称視点イベントカメラによるジェスチャー認識ジェスチャー認識2025/3/1
一人称視点のイベントカメラデータから手ジェスチャーを認識するため、頭の動きによるノイズを分離する状態空間モデルと時空間特徴を効率的に融合するモジュールを備えた軽量ネットワークを提案し、大規模データセットを構築した。
- 全方位マルチオブジェクト追跡マルチオブジェクト追跡2025/3/1
パノラマ画像の歪みに対応したOmniTrackを提案し、四足ロボットによる新データセットQuadTrackを構築して全方位追跡の性能を向上させた。
- 一人称視点の整理シーンにおける変形物体のワンショットアフォーダンスグラウンディングアフォーダンス2025/3/1
色や形が異なる未知の変形物体を少数サンプルから認識し、一人称視点の整理作業でアフォーダンスを推定する手法を提案。15種の変形物体データセットも構築した。
- LFX: ライトフィールドの密な意味セグメンテーションと顕著物体検出を統合するフレームワークライトフィールド認識2025/3/1
ライトフィールドの異なる表現形式に依存せず、意味セグメンテーションと顕著物体検出を同時に扱える初の統一学習フレームワークLFXを提案し、複数ベンチマークで最高精度を達成した。
- CT-UIO: 少数アンカーで動作する非一様Bスプラインを用いた連続時間UWB-慣性-オドメータ定位自己位置推定2025/2/1
非一様Bスプラインによる連続時間軌道表現と適応的EKF、仮想アンカー生成を組み合わせ、少ないUWBアンカーでも高精度に自己位置推定するシステムを提案した。
- イベントカメラ支援による意味的シーン補完3Dシーン理解2025/2/1
イベントカメラとRGBを融合し、動きぼやけや悪天候下でも頑健な3Dシーン補完を実現するフレームワークEvSSCと、その評価用ベンチマークDSEC-SSCを提案した論文。
- 機能的巧みな把持のためのマルチキーポイントアフォーダンス表現マニピュレーション2025/2/1
人間の把持画像を弱教師として視覚大規模モデルでアフォーダンス特徴を抽出し、接触点をキーポイントで直接符号化することで、視覚知覚と巧みな把持動作を結びつける手法を提案した。
- DeProPose: 欠損に強い適応的マルチビュー融合による3D人体姿勢推定3D姿勢推定2025/2/1
遮蔽やノイズ、視点欠落に頑健な3D人体姿勢推定のため、相対投影誤差に基づくマルチビュー特徴融合を導入したDeProPoseと、欠損シナリオを含むDA-3DPEデータセットを提案した。
- オプティカルフロー推定の腐敗に対するロバスト性ベンチマークオプティカルフロー/ロバスト性2024/11/1
オプティカルフロー推定モデルの一般的な腐敗に対するロバスト性を評価するため、7つの時間的腐敗と17の単一画像腐敗からなるベンチマークを構築し、29モデルを評価した。
- EI-Nexus:イベント画像データのための直接かつ柔軟なモダリティ間局所特徴抽出とマッチングイベントカメラ2024/10/1
イベントカメラと通常画像の間で、モダリティ変換を介さずに局所特徴を抽出・マッチングするフレームワークEI-Nexusを提案し、新たなベンチマークで最先端性能を達成した。
- E-3DGS: 露光イベントと動きイベントを活用したガウシアンスプラッティング3D再構成/イベントカメラ2024/10/1
露光調整デバイスを組み込み、イベントカメラで露光イベントと動きイベントを取得し、3Dガウシアンスプラッティングによる高品質・高速・バランス型の3D再構成を実現した研究。
- 深度対応PSFによる単レンズ制御可能な被写界深度イメージング計算撮像2024/9/1
単一レンズの光学収差と制御不能な被写界深度を計算手法で補正し、深度推定とPSFモデルを用いて任意の高級レンズ相当の被写界深度画像を生成するフレームワークを提案した。
- GenMapping: 逆透視変換を活用したロバストなオンラインHDマップ構築自動運転/HDマップ2024/9/1
逆透視変換でカメラパラメータを学習から切り離し、3分岐の協調アーキテクチャとクロスビュー学習により、未知のカメラ設定でも汎化するオンラインHDマップ生成フレームワークを提案。
- P2U-SLAM: 点と姿勢の不確かさに基づく単眼広視野SLAMシステムSLAM2024/9/1
広視野カメラを用いた単眼SLAMにおいて、最適化過程で変化する地図点とキーフレーム姿勢の不確かさを明示的にモデル化し、追跡と局所マッピングに組み込むことで長期性能劣化を抑える手法を提案した。
- SF-TIM: 地形想像と計測を組み合わせた四足ロボットの跳躍敏捷性を高める簡易フレームワーク歩行2024/8/1
地形の想像と計測を統合した単一ポリシーで、四足ロボットの盲歩行能力を保ちつつ高所やギャップを跳び越える敏捷性を向上させ、実機でゼロショット転移を実現した。
- 遮蔽を考慮したシームレスセグメンテーションセグメンテーション2024/7/1
パノラマ画像の狭い視野・遮蔽・ドメインギャップを同時に解決する新タスクOASSを提案し、データセットBlendPASSと手法UnmaskFormerを構築した。
- 指示付き原子行動認識行動認識2024/7/1
テキスト記述に基づいて特定人物の原子行動を動画から認識する新タスクRAVARを提案し、データセットRefAVAと専用手法RefAtomNetを構築した。
- 人間と物体のインタラクションから粒度認識アフォーダンスを学習し、道具を用いた機能的巧みな把持を実現マニピュレーション2024/7/1
人間の道具使用時の手と物体の接触領域から細粒度・粗粒度のアフォーダンス特徴を抽出し、巧みな手による機能的把持を可能にするフレームワークGAAF-Dexを提案。弱教師あり学習で一人称視点画像の特徴抽出を三人称視点画像から監督する。
- ガラス・プラスチックハイブリッド型ミニマリスト非球面パノラマ環状レンズの設計・解析・製造光学設計2024/5/1
小型・軽量・簡素な4枚構成のガラス・プラスチックハイブリッド非球面パノラマ環状レンズを設計し、公差解析手法を提案して試作20個を製造、8.5gの軽量プロトタイプを実現した。
- DTCLMapper: ベクトル化HDマップ構築のための二重時間一貫性学習自動運転/HDマップ2024/5/1
BEV知覚における時間融合の冗長性を抑えるため、インスタンス埋め込みと幾何マップを組み合わせた二重時間一貫性学習でベクトル化HDマップを構築する手法を提案。
- LiDARとカメラの連携による一貫性のある物体検出センサーフュージョン2024/5/1
点群と画像の両方で物体位置を同時に検出し、それらの対応関係を単一の順伝播で推定するエンドツーエンド手法を提案し、新指標Consistency Precisionで評価した。
- スクリブル注釈によるラベル効率的な意味的シーン補完意味的シーン補完2024/5/1
スパースなスクリブル注釈と密な幾何ラベルを組み合わせた新しいベンチマークScribbleSCを構築し、Scribble2Sceneという手法で完全教師ありに匹敵する性能を少ないラベルで実現した。
- MambaMOS: 動きを考慮した状態空間モデルによるLiDARベース3次元移動物体セグメンテーション移動物体セグメンテーション2024/4/1
LiDAR点群の時系列情報から移動物体を切り出すタスクに対し、時間情報と空間情報の結合を強化する埋め込みと、物体の動きの時間的相関を捉える状態空間モデルを組み合わせた手法を提案し、ベンチマークで最高精度を達成した。
- 複合レンズ計算イメージングの準大域的設計探索計算イメージング2024/4/1
光学系と画像再構成アルゴリズムを自動で同時設計する手法を提案し、複合レンズ系の初期設計探索と並列最適化により従来より高画質な計算イメージング系を実現した。
- CFMW: 悪天候下でのロバスト物体検出のためのクロスモダリティ融合Mambaマルチモーダル物体検出2024/4/1
悪天候下での可視光・赤外線画像を用いた物体検出において、拡散モデルによる天候除去とMambaベースのモダリティ融合を組み合わせ、Transformer融合より3倍高速で最先端性能を達成した。また、雨・霧・雪を含む大規模な可視光・赤外線データセットSWVIを構築した。
- 自動運転向けハイブリッド伝播によるオフボード占有予測の精緻化自動運転/3Dシーン理解2024/3/1
車載の視覚ベース3D意味シーン補完(SSC)予測を、オフボードで局所・大域の二段階伝播により高精度化するフレームワークOccFinerを提案し、SemanticKITTIで最先端性能を達成した。
- ベクトル量子化によるドメイン混合光学劣化表現を用いた実世界計算収差補正計算収差補正/ドメイン適応2024/3/1
実世界の収差補正における合成データと実データのギャップを、教師なしドメイン適応として捉え、VQGANで光学劣化を量子化・表現するQDMRフレームワークを提案した論文。
- ノイズラベルに頑健な骨格ベース人間行動認識フレームワークNoiseEraSAR行動認識2024/3/1
骨格データによる行動認識で問題となるラベルノイズに対処するため、サンプル選択・共教示・クロスモーダルMoEを統合したNoiseEraSARを提案し、ベンチマークで最高性能を達成した。
- EchoTrack: 自動運転のための音声指示によるマルチオブジェクト追跡マルチオブジェクト追跡2024/2/1
音声指示に基づいて動画内の特定物体を追跡するAR-MOTタスクを提案し、音声と映像を双方向に融合するEchoTrackフレームワークと大規模ベンチマークを構築した。
- Fourier Prompt Tuning for Modality-Incomplete Scene Segmentation2024/1/1
- Towards Precise 3D Human Pose Estimation with Multi-Perspective Spatial-Temporal Relational Transformers2024/1/1
- LF Tracy: A Unified Single-Pipeline Approach for Salient Object Detection in Light Field Cameras2024/1/1
- Navigating Open Set Scenarios for Skeleton-based Action Recognition2023/12/1
- Exploring Event-based Human Pose Estimation with 3D Event Representations2023/11/1
- CoBEV: Elevating Roadside 3D Object Detection with Depth and Height Complementarity2023/10/1
- S$^3$-MonoDETR: Supervised Shape&Scale-perceptive Deformable Transformer for Monocular 3D Object Detection2023/9/1
- Exploring Self-supervised Skeleton-based Action Recognition in Occluded Environments2023/9/1
- Elevating Skeleton-Based Action Recognition with Efficient Multi-Modality Self-Supervision2023/9/1
- FocusFlow: Boosting Key-Points Optical Flow Estimation for Autonomous Driving2023/8/1
- Towards Anytime Optical Flow Estimation with Event Cameras2023/7/1
- Tightly-Coupled LiDAR-Visual SLAM Based on Geometric Features for Mobile Agents2023/7/1
- OAFuser: Towards Omni-Aperture Fusion for Light Field Semantic Segmentation2023/7/1
- Open Scene Understanding: Grounded Situation Recognition Meets Segment Anything for Helping People with Visual Impairments2023/7/1
- Towards Source-free Domain Adaptive Semantic Segmentation via Importance-aware and Prototype-contrast Learning2023/6/1
- PVPUFormer: Probabilistic Visual Prompt Unified Transformer for Interactive Image Segmentation2023/6/1
- LF-PGVIO: A Visual-Inertial-Odometry Framework for Large Field-of-View Cameras using Points and Geodesic Segments2023/6/1
- Exploring Few-Shot Adaptation for Activity Recognition on Diverse Domains2023/5/1
- SSD-MonoDETR: Supervised Scale-aware Deformable Transformer for Monocular 3D Object Detection2023/5/1
- Bi-Mapper: Holistic BEV Semantic Mapping for Autonomous Driving2023/5/1
- FishDreamer: Towards Fisheye Semantic Completion via Unified Image Outpainting and Segmentation2023/3/1
- PanoVPR: Towards Unified Perspective-to-Equirectangular Visual Place Recognition via Sliding Windows across the Panoramic View2023/3/1
- Towards Activated Muscle Group Estimation in the Wild2023/3/1
- MateRobot: Material Recognition in Wearable Robotics for People with Visual Impairments2023/2/1
- LF-VISLAM: A SLAM Framework for Large Field-of-View Cameras with Negative Imaging Plane on Mobile Agents2022/9/1
- Multi-modal Depression Estimation based on Sub-attentional Fusion2022/7/1
- Trans4Map: Revisiting Holistic Bird's-Eye-View Mapping from Egocentric Images to Allocentric Semantics with Vision Transformers2022/7/1
- Behind Every Domain There is a Shift: Adapting Distortion-aware Vision Transformers for Panoramic Semantic Segmentation2022/7/1
- Panoramic Panoptic Segmentation: Insights Into Surrounding Parsing for Mobile Agents via Unsupervised Contrastive Learning2022/6/1
- Efficient Human Pose Estimation via 3D Event Point Cloud2022/6/1
- Review on Panoramic Imaging and Its Applications in Scene Understanding2022/5/1
- Indoor Navigation Assistance for Visually Impaired People via Dynamic SLAM and Panoptic Segmentation with an RGB-D Sensor2022/4/1
- TransDARC: Transformer-based Driver Activity Recognition with Latent Space Feature Calibration2022/3/1
- MatchFormer: Interleaving Attention in Transformers for Feature Matching2022/3/1
- Bending Reality: Distortion-aware Transformers for Adapting to Panoramic Semantic Segmentation2022/3/1
- Towards Robust Semantic Segmentation of Accident Scenes via Multi-Source Mixed Sampling and Meta-Learning2022/3/1
- CMX: Cross-Modal Fusion for RGB-X Semantic Segmentation with Transformers2022/3/1
- Delving Deep into One-Shot Skeleton-based Action Recognition with Diverse Occlusions2022/2/1
- LF-VIO: A Visual-Inertial-Odometry Framework for Large Field-of-View Cameras with Negative Plane2022/2/1
- TransKD: Transformer Knowledge Distillation for Efficient Semantic Segmentation2022/2/1
- CSFlow: Learning Optical Flow via Cross Strip Correlation for Autonomous Driving2022/2/1
- PanoFlow: Learning 360{\deg} Optical Flow for Surrounding Temporal Understanding2022/2/1
- Transfer beyond the Field of View: Dense Panoramic Semantic Segmentation via Unsupervised Domain Adaptation2021/10/1
- Panoramic Depth Estimation via Supervised and Unsupervised Learning in Indoor Scenes2021/8/1
- Trans4Trans: Efficient Transformer for Transparent Object and Semantic Scene Segmentation in Real-World Navigation Assistance2021/8/1
- DensePASS: Dense Panoramic Semantic Segmentation via Unsupervised Domain Adaptation with Attention-Augmented Context Exchange2021/8/1
- Flying Guide Dog: Walkable Path Discovery for the Visually Impaired Utilizing Drones and Transformer-based Semantic Segmentation2021/8/1
- HIDA: Towards Holistic Indoor Understanding for the Visually Impaired via Semantic Instance Segmentation with a Wearable Solid-State LiDAR Sensor2021/7/1
- Trans4Trans: Efficient Transformer for Transparent Object Segmentation to Help Visually Impaired People Navigate in the Real World2021/7/1
- MASS: Multi-Attentional Semantic Segmentation of LiDAR Data for Dense Top-View Understanding2021/7/1
- Aerial-PASS: Panoramic Annular Scene Segmentation in Drone Videos2021/5/1
- Perception Framework through Real-Time Semantic Segmentation and Scene Recognition on a Wearable System for the Visually Impaired2021/3/1
- Panoptic Lintention Network: Towards Efficient Navigational Perception for the Visually Impaired2021/3/1
- Capturing Omni-Range Context for Omnidirectional Segmentation2021/3/1
- DR-TANet: Dynamic Receptive Temporal Attention Network for Street Scene Change Detection2021/3/1
- Panoramic Panoptic Segmentation: Towards Complete Surrounding Understanding via Unsupervised Contrastive Learning2021/3/1
- Panoramic annular SLAM with loop closure and global optimization2021/2/1
- Polarization-driven Semantic Segmentation via Efficient Attention-bridged Fusion2020/11/1
- Real-time Fusion Network for RGB-D Semantic Segmentation Incorporating Unexpected Obstacle Detection for Road-driving Images2020/2/1
- DS-PASS: Detail-Sensitive Panoramic Annular Semantic Segmentation through SwaftNet for Surrounding Sensing2019/9/1