Zhiyong Li
School of Artificial Intelligence and Robotics
収録論文 30本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PanoFuse: パノラマ強化型視覚-言語-行動学習と分離型意味-幾何ルーティングVLA2026/9/21
全方向パノラマ知覚をVLAに統合し、意味情報と幾何情報を分離して経路選択するDSGRにより、遮蔽や未知環境下でのマニピュレーション成功率を向上させた。
- Spheriverse: 実世界の球面観測による3Dシーン理解3Dシーン理解2026/9/8
球面画像とLiDARの大規模データセットを構築し、球面幾何を考慮した占有予測フレームワークSphereOccを提案して、セマンティック占有予測や3D物体検出のベンチマークで優れた性能を示した。
- HGeo-TopoMap: 階層的幾何事前情報によるトポロジカルマッピングの強化自動運転/トポロジカルマップ2026/7/1
自動運転のためのトポロジカルマップ生成において、逆透視マッピングによる道路構造マップと空間関係を活用し、中心線検出を階層的に強化する手法を提案した。
- PS-MOT: 点シードからインスタンス認識を育成するマルチオブジェクト追跡マルチオブジェクト追跡2026/6/1
バウンディングボックスではなく点のアノテーションだけでマルチオブジェクト追跡を実現する手法を提案。データ・モデル・損失の各レベルで点からインスタンスへの階層的パイプラインを構築し、既存の点教師付き追跡手法を上回る性能を達成した。
- BLaDA: 3DGSフィールド内で言語を機能的巧みな動作に橋渡しするマニピュレーション2026/4/1
言語指示を3Dガウススプラッティング場に基づく機能的把持の制約として解釈し、ゼロショットで器用な操作を実現するフレームワークを提案した。
- PanoAffordanceNet:360度屋内環境における全体的アフォーダンス接地に向けてアフォーダンス接地2026/3/1
360度パノラマ画像から物体のアフォーダンス(行動可能性)をシーン全体で推定する新タスクを提案し、歪み補正と球面稠密化を組み込んだエンドツーエンドモデルと初のデータセットを構築した。
- O3N: 都市自律エージェントのための全方位オープンボキャブラリ占有予測3D占有予測2026/3/1
単一の全方位RGB画像から360度の3D占有を予測する初のオープンボキャブラリ手法を提案し、極座標スパイラルMambaと視覚・ボクセル・テキストの整合機構で高精度かつ汎化性能を実現した。
- TRACER: 変形物体操作のためのテクスチャ頑健なアフォーダンス連鎖推論マニピュレーション2026/1/1
外観やテクスチャの変化に頑健なアフォーダンス予測のため、階層的意味推論から機能領域の精緻化までを連鎖的に行うTRACERフレームワークを提案し、変形物体操作の精度を向上させた。
- クロス視点知覚による細粒度対応学習で実現するオープンボキャブラリ6D物体姿勢推定6D姿勢推定2026/1/1
オープンボキャブラリ6D姿勢推定において、対象物体を背景から分離し、二視点特徴の融合とパッチ間相関行列による空間制約付きマッチングを行うFiCoPを提案し、REAL275とToyota-Lightで精度を大幅に改善した。
- CoBEVMoE: 動的Mixture-of-Expertsによる異種性を考慮した協調知覚のための特徴融合協調知覚2025/9/1
BEV空間で動的に生成されるエキスパート群を用いて、エージェント間の特徴の類似性と異質性を明示的にモデル化する協調知覚フレームワークを提案し、BEVセグメンテーションと3D物体検出で最高性能を達成した。
- NRSeg: 走行世界モデルによるノイズ耐性BEVセマンティックセグメンテーション学習BEVセグメンテーション2025/7/1
走行世界モデルが生成する合成データのノイズに耐性のあるBEVセマンティックセグメンテーション学習フレームワークNRSegを提案。生成データの有用性を評価する指標と不確実性を考慮した予測手法を導入した。
- 分布外意味占有予測3D知覚2025/6/1
自動運転向け3D意味占有予測において、分布外物体を検出する新タスクを提案し、合成異常を注入するデータ拡張と、ボクセルとBEV表現を統合するOccOoDフレームワークで検出性能を向上させた。
- パノラマ分布外セグメンテーションセグメンテーション2025/5/1
360度パノラマ画像において、未知の物体(分布外)を検出する新タスクPanOoSを提案し、テキスト誘導プロンプト分布学習により既存手法を上回るPOSを実現した。
- HierDAMap: 階層的視点事前分布による汎用的なドメイン適応BEVマッピングBEVマッピング/ドメイン適応2025/3/1
自動運転向けBEVマッピングの教師なしドメイン適応において、グローバル・スパース・インスタンスの3階層の視点事前知識を活用する汎用フレームワークHierDAMapを提案した論文。
- 一人称視点の整理シーンにおける変形物体のワンショットアフォーダンスグラウンディングアフォーダンス2025/3/1
色や形が異なる未知の変形物体を少数サンプルから認識し、一人称視点の整理作業でアフォーダンスを推定する手法を提案。15種の変形物体データセットも構築した。
- 深度と意味プロンプトを活用したリソース効率の良いアフォーダンス推定アフォーダンス推定2025/3/1
RGB画像に深度画像をプロンプトとして組み込み、テキスト特徴で注意を誘導する軽量なアフォーダンス推定フレームワークを提案し、公開データセットで精度向上とパラメータ削減を実現した。
- 言語ガイダンスでSAM2を活用するRGB-熱画像セマンティックセグメンテーションセグメンテーション2025/3/1
大規模学習済みのSAM2を言語ガイダンスで適応させ、RGBと熱画像の融合セグメンテーションを高精度化するSHIFNetを提案。
- TS-CGNet: 時空間融合と中心線誘導拡散によるBEVマッピングBEV知覚2025/3/1
時空間融合と中心線誘導拡散モデルを組み合わせ、悪天候や低照度でも高精度なBEVセマンティックマップを生成するフレームワークを提案。
- 機能的巧みな把持のためのマルチキーポイントアフォーダンス表現マニピュレーション2025/2/1
人間の把持画像を弱教師として視覚大規模モデルでアフォーダンス特徴を抽出し、接触点をキーポイントで直接符号化することで、視覚知覚と巧みな把持動作を結びつける手法を提案した。
- GenMapping: 逆透視変換を活用したロバストなオンラインHDマップ構築自動運転/HDマップ2024/9/1
逆透視変換でカメラパラメータを学習から切り離し、3分岐の協調アーキテクチャとクロスビュー学習により、未知のカメラ設定でも汎化するオンラインHDマップ生成フレームワークを提案。
- 人間と物体のインタラクションから粒度認識アフォーダンスを学習し、道具を用いた機能的巧みな把持を実現マニピュレーション2024/7/1
人間の道具使用時の手と物体の接触領域から細粒度・粗粒度のアフォーダンス特徴を抽出し、巧みな手による機能的把持を可能にするフレームワークGAAF-Dexを提案。弱教師あり学習で一人称視点画像の特徴抽出を三人称視点画像から監督する。
- DTCLMapper: ベクトル化HDマップ構築のための二重時間一貫性学習自動運転/HDマップ2024/5/1
BEV知覚における時間融合の冗長性を抑えるため、インスタンス埋め込みと幾何マップを組み合わせた二重時間一貫性学習でベクトル化HDマップを構築する手法を提案。
- MambaMOS: 動きを考慮した状態空間モデルによるLiDARベース3次元移動物体セグメンテーション移動物体セグメンテーション2024/4/1
LiDAR点群の時系列情報から移動物体を切り出すタスクに対し、時間情報と空間情報の結合を強化する埋め込みと、物体の動きの時間的相関を捉える状態空間モデルを組み合わせた手法を提案し、ベンチマークで最高精度を達成した。
- EchoTrack: 自動運転のための音声指示によるマルチオブジェクト追跡マルチオブジェクト追跡2024/2/1
音声指示に基づいて動画内の特定物体を追跡するAR-MOTタスクを提案し、音声と映像を双方向に融合するEchoTrackフレームワークと大規模ベンチマークを構築した。
- LF Tracy: A Unified Single-Pipeline Approach for Salient Object Detection in Light Field Cameras2024/1/1
- OriWheelBot: An origami-wheeled robot2023/10/1
- S$^3$-MonoDETR: Supervised Shape&Scale-perceptive Deformable Transformer for Monocular 3D Object Detection2023/9/1
- PVPUFormer: Probabilistic Visual Prompt Unified Transformer for Interactive Image Segmentation2023/6/1
- SSD-MonoDETR: Supervised Scale-aware Deformable Transformer for Monocular 3D Object Detection2023/5/1
- Bi-Mapper: Holistic BEV Semantic Mapping for Autonomous Driving2023/5/1