Kai Luo
Hunan University
収録論文 21本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- UniTrackPLA:指示に基づくナビゲーションと動的人物追跡のための統合パノラマ・言語・行動モデルVLA2026/10/1
全方位パノラマ観測を活用し、言語指示ナビゲーションと人物追跡を単一モデルで行う統合VLAを提案。行動予測の一貫性検証により再計画を可能にし、シミュレーションと実環境で性能を向上させた。
- PanoFuse: パノラマ強化型視覚-言語-行動学習と分離型意味-幾何ルーティングVLA2026/9/21
全方向パノラマ知覚をVLAに統合し、意味情報と幾何情報を分離して経路選択するDSGRにより、遮蔽や未知環境下でのマニピュレーション成功率を向上させた。
- Spheriverse: 実世界の球面観測による3Dシーン理解3Dシーン理解2026/9/8
球面画像とLiDARの大規模データセットを構築し、球面幾何を考慮した占有予測フレームワークSphereOccを提案して、セマンティック占有予測や3D物体検出のベンチマークで優れた性能を示した。
- PS-MOT: 点シードからインスタンス認識を育成するマルチオブジェクト追跡マルチオブジェクト追跡2026/6/1
バウンディングボックスではなく点のアノテーションだけでマルチオブジェクト追跡を実現する手法を提案。データ・モデル・損失の各レベルで点からインスタンスへの階層的パイプラインを構築し、既存の点教師付き追跡手法を上回る性能を達成した。
- CylindTrack:パノラマ多物体追跡のための深度対応円筒運動モデリング多物体追跡2026/6/1
パノラマ映像における多物体追跡(MOT)の課題を解決するため、円筒座標系と深度情報を活用した追跡フレームワークCylindTrackを提案した。
- OccTrack360: 全方位魚眼カメラによる4Dパノプティック占有追跡占有予測/追跡2026/3/1
全方位魚眼カメラ向けの長尺4Dパノプティック占有追跡ベンチマークOccTrack360と、球面歪みと位置ずれに対処するベースライン手法FoSOccを提案した。
- NOVA: 自動運転における3Dマルチオブジェクト追跡のための次段階オープンボキャブラリ自己回帰3D追跡/自動運転2026/3/1
3Dマルチオブジェクト追跡を、大規模言語モデルの自己回帰能力を利用して、軌跡を時空間セマンティックシーケンスとして扱い、次段階のシーケンス補完として定式化する新しい手法を提案。未知の物体カテゴリへの一般化を向上させ、nuScenesなどのデータセットで優れた性能を達成。
- 球面ガウス不透明度場による幾何認識型全方位3Dシーン再構成3D再構成2026/3/1
全方位カメラ向けにガウシアンスプラッティングを拡張し、球面上で直接レイサンプリングすることで歪みのない高品質な3D再構成を実現した。
- 四足ロボットのためのパノラママルチモーダル意味占有予測占有予測2026/3/1
四足ロボット向けに360度パノラマと複数センサを統合した世界初の実世界占有予測データセットPanoMMOccと、歩行時の揺れを補正して高精度に3D空間を認識するフレームワークVoxelHoundを提案した。
- OmniTrack++: 大視野軌道フィードバック学習による全方向マルチオブジェクト追跡マルチオブジェクト追跡2025/11/1
360度視野のパノラマ動画で複数物体を追跡するため、軌道情報をフィードバックして知覚を段階的に改善するフレームワークを提案し、四足・二足ロボットで収集した新ベンチマークEmboTrackを構築した。
- DepTR-MOT: 深度情報を活用した軌道精緻化によるマルチオブジェクト追跡マルチオブジェクト追跡2025/9/1
DETRベースの検出器にインスタンス単位の深度情報を組み込み、遮蔽や近接環境でのマルチオブジェクト追跡の精度を向上させた研究。
- Segment-to-Act: 身体性知能に向けたラベルノイズに頑健な行動プロンプト付きビデオセグメンテーションビデオセグメンテーション2025/9/1
行動ベースのビデオ物体セグメンテーションにおけるテキストプロンプトノイズとマスクアノテーションノイズに対処するため、初のベンチマークActiSeg-NLを構築し、6つのラベルノイズ学習戦略を適応・評価するとともに、マスクノイズに対処するParallel Mask Head Mechanismを提案した。
- CoBEVMoE: 動的Mixture-of-Expertsによる異種性を考慮した協調知覚のための特徴融合協調知覚2025/9/1
BEV空間で動的に生成されるエキスパート群を用いて、エージェント間の特徴の類似性と異質性を明示的にモデル化する協調知覚フレームワークを提案し、BEVセグメンテーションと3D物体検出で最高性能を達成した。
- QuaDreamer: 四足歩行ロボットのための制御可能なパノラマ動画生成データ生成2025/8/1
四足歩行ロボットの動きを模倣し、垂直振動特性を考慮した制御可能なパノラマ動画を生成する初のデータ生成エンジンを提案。
- 360度を幻視する:局所シーン拡散と確率的プロンプティングによるパノラマ街路ビュー生成生成モデル2025/7/1
自動運転向けに、ステッチされたパノラマ画像を制御信号として一貫性のある360度パノラマ街路ビューを生成する初の手法Percep360を提案。局所シーン拡散法と確率的プロンプティング法で一貫性と制御性を実現。
- 分布外意味占有予測3D知覚2025/6/1
自動運転向け3D意味占有予測において、分布外物体を検出する新タスクを提案し、合成異常を注入するデータ拡張と、ボクセルとBEV表現を統合するOccOoDフレームワークで検出性能を向上させた。
- パノラマ分布外セグメンテーションセグメンテーション2025/5/1
360度パノラマ画像において、未知の物体(分布外)を検出する新タスクPanOoSを提案し、テキスト誘導プロンプト分布学習により既存手法を上回るPOSを実現した。
- LFX: ライトフィールドの密な意味セグメンテーションと顕著物体検出を統合するフレームワークライトフィールド認識2025/3/1
ライトフィールドの異なる表現形式に依存せず、意味セグメンテーションと顕著物体検出を同時に扱える初の統一学習フレームワークLFXを提案し、複数ベンチマークで最高精度を達成した。
- 全方位マルチオブジェクト追跡マルチオブジェクト追跡2025/3/1
パノラマ画像の歪みに対応したOmniTrackを提案し、四足ロボットによる新データセットQuadTrackを構築して全方位追跡の性能を向上させた。
- 言語ガイダンスでSAM2を活用するRGB-熱画像セマンティックセグメンテーションセグメンテーション2025/3/1
大規模学習済みのSAM2を言語ガイダンスで適応させ、RGBと熱画像の融合セグメンテーションを高精度化するSHIFNetを提案。
- LiDARとカメラの連携による一貫性のある物体検出センサーフュージョン2024/5/1
点群と画像の両方で物体位置を同時に検出し、それらの対応関係を単一の順伝播で推定するエンドツーエンド手法を提案し、新指標Consistency Precisionで評価した。