Hao Shi
Army Engineering University of PLA
収録論文 59本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 世界行動モデルの汎化性能を決める要因とは?推論時の未来モデリングに関する実証研究VLA2026/9/28
世界行動モデル(WAM)の汎化性能を環境変化・データ効率・タスク汎化の3軸で評価し、未来表現の条件付けが重要であることを示すとともに、未来生成を1回の順伝播に簡略化したSimple-WAMを提案した。
- PanoGS-SLAM: パノラマ3DガウシアンスプラッティングSLAMSLAM2026/9/15
全方位カメラ向けに3Dガウシアンスプラッティングを用いた初のパノラマ高密度SLAMを提案し、球面領域での微分可能レンダリングと姿勢最適化により追跡精度と描画品質を向上させた。
- トポロジー的必然性:異なる身体を持つエージェント間で転移可能な目標条件付き制御のためのメカニズム不変な戦略的サブゴール目標条件付き強化学習/トポロジー/クロスエンボディメント2026/9/10
成功軌跡からホモロジーを用いて「必ず通らなければならない関門」を抽出し、実行エージェントが変わっても転移可能なサブゴールとして目標条件付き強化学習に組み込む手法を提案。
- Spheriverse: 実世界の球面観測による3Dシーン理解3Dシーン理解2026/9/8
球面画像とLiDARの大規模データセットを構築し、球面幾何を考慮した占有予測フレームワークSphereOccを提案して、セマンティック占有予測や3D物体検出のベンチマークで優れた性能を示した。
- ラベル不要なターゲット領域適応によるイベント-画像特徴マッチングの二段階蒸留手法イベントカメラ/特徴マッチング/ドメイン適応2026/7/1
イベントカメラと通常画像間の画素対応を、ラベルやセンサー較正なしで学習する二段階蒸留フレームワークを提案し、実世界の非拘束データで自己進化可能な手法を実証した。
- MemoryVLA++:視覚言語行動モデルにおける記憶と想像による時間的モデリングVLA2026/6/8
ロボット操作のためのVLAモデルに、作業記憶・エピソード記憶・未来想像の仕組みを組み込み、長期的な時間依存タスクを可能にするフレームワークを提案した。
- PS-MOT: 点シードからインスタンス認識を育成するマルチオブジェクト追跡マルチオブジェクト追跡2026/6/1
バウンディングボックスではなく点のアノテーションだけでマルチオブジェクト追跡を実現する手法を提案。データ・モデル・損失の各レベルで点からインスタンスへの階層的パイプラインを構築し、既存の点教師付き追跡手法を上回る性能を達成した。
- VL2Spike: スパイク駆動蒸留によるVLMから低消費電力ロボット視覚認識への橋渡しスパイクニューラルネットワーク2026/6/1
スパイクニューラルネットワーク(SNN)の性能向上のため、視覚言語モデル(VLM)の知識をスパイク変換器モデルに蒸留するフレームワークVL2Spikeを提案した。
- 共に見る:マルチモーダル大規模言語モデルによる多ロボット協調的自我中心空間推論群制御2026/5/18
複数の移動ロボットの同期した一人称視点ビデオを統合し、空間・時間・可視性・協調に関する質問に答える多ロボット協調動的空間推論の課題を研究。新ベンチマークCoopSRとデータセットEgoTeamを構築し、提案手法SP-CoRが既存MLLMを上回る性能を示した。
- EgoEV-HandPose: ステレオイベントカメラによる自己中心視点の3D手姿勢推定とジェスチャ認識手姿勢推定/イベントカメラ2026/5/1
ステレオイベントカメラを用いて、自己中心視点での両手の3D姿勢推定とジェスチャ認識を同時に行うエンドツーエンドフレームワークを提案し、大規模な実世界データセットも構築した。
- 人間のように映画を観る:身体化されたコンパニオンのための自己中心視点の感情理解感情理解2026/4/17
映画を自己中心的なスクリーン視点で観るロボットの感情理解を扱い、新しいデータセットとマルチモーダル推論フレームワークを提案した論文。
- E-VLA: 暗所・ぼやけシーンのためのイベント拡張型視覚言語行動モデルVLA/操作2026/4/1
暗所やモーションブラーなどの劣化環境でロバストな操作を実現するため、イベントカメラの情報をVLAモデルに統合するフレームワークを提案した。実機データセットと軽量な統合手法により、従来の画像のみでは失敗する状況で成功率を大幅に向上させた。
- O3N: 都市自律エージェントのための全方位オープンボキャブラリ占有予測3D占有予測2026/3/1
単一の全方位RGB画像から360度の3D占有を予測する初のオープンボキャブラリ手法を提案し、極座標スパイラルMambaと視覚・ボクセル・テキストの整合機構で高精度かつ汎化性能を実現した。
- OccTrack360: 全方位魚眼カメラによる4Dパノプティック占有追跡占有予測/追跡2026/3/1
全方位魚眼カメラ向けの長尺4Dパノプティック占有追跡ベンチマークOccTrack360と、球面歪みと位置ずれに対処するベースライン手法FoSOccを提案した。
- RMBench:記憶依存型ロボットマニピュレーションのベンチマークと政策設計への洞察マニピュレーション2026/3/1
記憶を必要とするロボット操作タスクを体系的に評価する9タスクのシミュレーションベンチマークRMBenchと、明示的記憶モジュールを持つ操作政策Mem-0を提案し、既存政策の記憶限界と設計指針を明らかにした。
- ExoGS: スケーラブルなマニピュレーションデータ収集のための4D Real-to-Sim-to-Realフレームワークsim2real2026/1/1
人間の直接教示をロボット同型の受動外骨格で計測し、環境と物体を3Dガウシアンスプラッティングで再構成してシミュレーション上で大規模データ拡張と方策学習を行うReal-to-Sim-to-Real手法を提案。
- 空間知能の構築:自律システムのためのマルチモーダル事前学習ロードマップマルチモーダル事前学習2025/12/1
自動運転車やドローンなどの自律システムに向けて、カメラやLiDARなどのマルチモーダルセンサーデータを活用した事前学習技術を整理し、統一的な分類と今後の課題・ロードマップを提示したサーベイ論文。
- OmniTrack++: 大視野軌道フィードバック学習による全方向マルチオブジェクト追跡マルチオブジェクト追跡2025/11/1
360度視野のパノラマ動画で複数物体を追跡するため、軌道情報をフィードバックして知覚を段階的に改善するフレームワークを提案し、四足・二足ロボットで収集した新ベンチマークEmboTrackを構築した。
- OneOcc: 単一パノラマカメラによる脚式ロボットの意味的占有予測意味的占有予測2025/11/1
脚式ロボット向けに、単一のパノラマカメラ映像から360度の3D意味的占有を予測するフレームワークOneOccを提案。歩行時の揺れ補償や二重投影融合などの工夫で高精度を実現し、新たなベンチマークも公開。
- SpatialActor: ロバストなロボットマニピュレーションのための分離された空間表現の探求マニピュレーション2025/11/1
意味と幾何を明示的に分離し、ノイズの多い深度と専門家事前知識を融合するフレームワークを提案。RLBenchで87.4%を達成し、ノイズ条件下で13.9%〜19.4%の改善を示す。
- Dexbotic: オープンソース視覚-言語-行動ツールボックスVLA2025/10/1
複数のVLAモデルを単一環境で再現・開発できるPyTorchベースのオープンソースツールボックスを提供し、高性能な事前学習済みモデルも公開した。
- イベントカメラ誘導による動的人体とシーンの3Dガウシアンスプラッティング再構成3D再構成/イベントカメラ2025/9/1
単眼イベントカメラ映像から、動く人体と静的シーンを3Dガウシアンスプラッティングで同時再構成する手法を提案。イベント誘導損失で高速運動時のブレを抑え、人体マスク不要で高精度を実現した。
- MemoryVLA: ロボット操作のための視覚-言語-行動モデルにおける知覚・認知記憶VLA2025/8/1
人間の作業記憶と海馬の記憶機構に着想を得て、知覚・認知トークンを記憶バンクに蓄え再利用するVLAモデルを提案し、長期的な依存を含む操作タスクで従来手法を上回る成功率を達成した。
- QuaDreamer: 四足歩行ロボットのための制御可能なパノラマ動画生成データ生成2025/8/1
四足歩行ロボットの動きを模倣し、垂直振動特性を考慮した制御可能なパノラマ動画を生成する初のデータ生成エンジンを提案。
- GeoVLA: 視覚言語行動モデルに3D表現を導入VLA2025/8/1
深度マップから点群を生成し、視覚言語モデルの埋め込みと統合することで、3D空間認識を強化したロボットマニピュレーション用VLAフレームワークを提案。
- 制約からの解放:ソースフリー遮蔽認識シームレスセグメンテーションセグメンテーション2025/6/1
ソースデータやラベルなしで全景画像のセグメンテーションを行う新しいタスクSFOASSを提案し、UNLOCKという手法で360度視点と遮蔽認識を実現した。
- HierDAMap: 階層的視点事前分布による汎用的なドメイン適応BEVマッピングBEVマッピング/ドメイン適応2025/3/1
自動運転向けBEVマッピングの教師なしドメイン適応において、グローバル・スパース・インスタンスの3階層の視点事前知識を活用する汎用フレームワークHierDAMapを提案した論文。
- EgoEvGesture: 一人称視点イベントカメラによるジェスチャー認識ジェスチャー認識2025/3/1
一人称視点のイベントカメラデータから手ジェスチャーを認識するため、頭の動きによるノイズを分離する状態空間モデルと時空間特徴を効率的に融合するモジュールを備えた軽量ネットワークを提案し、大規模データセットを構築した。
- 深度と意味プロンプトを活用したリソース効率の良いアフォーダンス推定アフォーダンス推定2025/3/1
RGB画像に深度画像をプロンプトとして組み込み、テキスト特徴で注意を誘導する軽量なアフォーダンス推定フレームワークを提案し、公開データセットで精度向上とパラメータ削減を実現した。
- 全方位マルチオブジェクト追跡マルチオブジェクト追跡2025/3/1
パノラマ画像の歪みに対応したOmniTrackを提案し、四足ロボットによる新データセットQuadTrackを構築して全方位追跡の性能を向上させた。
- TS-CGNet: 時空間融合と中心線誘導拡散によるBEVマッピングBEV知覚2025/3/1
時空間融合と中心線誘導拡散モデルを組み合わせ、悪天候や低照度でも高精度なBEVセマンティックマップを生成するフレームワークを提案。
- イベントカメラ支援による意味的シーン補完3Dシーン理解2025/2/1
イベントカメラとRGBを融合し、動きぼやけや悪天候下でも頑健な3Dシーン補完を実現するフレームワークEvSSCと、その評価用ベンチマークDSEC-SSCを提案した論文。
- オプティカルフロー推定の腐敗に対するロバスト性ベンチマークオプティカルフロー/ロバスト性2024/11/1
オプティカルフロー推定モデルの一般的な腐敗に対するロバスト性を評価するため、7つの時間的腐敗と17の単一画像腐敗からなるベンチマークを構築し、29モデルを評価した。
- E-3DGS: 露光イベントと動きイベントを活用したガウシアンスプラッティング3D再構成/イベントカメラ2024/10/1
露光調整デバイスを組み込み、イベントカメラで露光イベントと動きイベントを取得し、3Dガウシアンスプラッティングによる高品質・高速・バランス型の3D再構成を実現した研究。
- EI-Nexus:イベント画像データのための直接かつ柔軟なモダリティ間局所特徴抽出とマッチングイベントカメラ2024/10/1
イベントカメラと通常画像の間で、モダリティ変換を介さずに局所特徴を抽出・マッチングするフレームワークEI-Nexusを提案し、新たなベンチマークで最先端性能を達成した。
- GenMapping: 逆透視変換を活用したロバストなオンラインHDマップ構築自動運転/HDマップ2024/9/1
逆透視変換でカメラパラメータを学習から切り離し、3分岐の協調アーキテクチャとクロスビュー学習により、未知のカメラ設定でも汎化するオンラインHDマップ生成フレームワークを提案。
- SF-TIM: 地形想像と計測を組み合わせた四足ロボットの跳躍敏捷性を高める簡易フレームワーク歩行2024/8/1
地形の想像と計測を統合した単一ポリシーで、四足ロボットの盲歩行能力を保ちつつ高所やギャップを跳び越える敏捷性を向上させ、実機でゼロショット転移を実現した。
- 遮蔽を考慮したシームレスセグメンテーションセグメンテーション2024/7/1
パノラマ画像の狭い視野・遮蔽・ドメインギャップを同時に解決する新タスクOASSを提案し、データセットBlendPASSと手法UnmaskFormerを構築した。
- スクリブル注釈によるラベル効率的な意味的シーン補完意味的シーン補完2024/5/1
スパースなスクリブル注釈と密な幾何ラベルを組み合わせた新しいベンチマークScribbleSCを構築し、Scribble2Sceneという手法で完全教師ありに匹敵する性能を少ないラベルで実現した。
- DTCLMapper: ベクトル化HDマップ構築のための二重時間一貫性学習自動運転/HDマップ2024/5/1
BEV知覚における時間融合の冗長性を抑えるため、インスタンス埋め込みと幾何マップを組み合わせた二重時間一貫性学習でベクトル化HDマップを構築する手法を提案。
- MambaMOS: 動きを考慮した状態空間モデルによるLiDARベース3次元移動物体セグメンテーション移動物体セグメンテーション2024/4/1
LiDAR点群の時系列情報から移動物体を切り出すタスクに対し、時間情報と空間情報の結合を強化する埋め込みと、物体の動きの時間的相関を捉える状態空間モデルを組み合わせた手法を提案し、ベンチマークで最高精度を達成した。
- ベクトル量子化によるドメイン混合光学劣化表現を用いた実世界計算収差補正計算収差補正/ドメイン適応2024/3/1
実世界の収差補正における合成データと実データのギャップを、教師なしドメイン適応として捉え、VQGANで光学劣化を量子化・表現するQDMRフレームワークを提案した論文。
- 自動運転向けハイブリッド伝播によるオフボード占有予測の精緻化自動運転/3Dシーン理解2024/3/1
車載の視覚ベース3D意味シーン補完(SSC)予測を、オフボードで局所・大域の二段階伝播により高精度化するフレームワークOccFinerを提案し、SemanticKITTIで最先端性能を達成した。
- Towards Precise 3D Human Pose Estimation with Multi-Perspective Spatial-Temporal Relational Transformers2024/1/1
- Exploring Event-based Human Pose Estimation with 3D Event Representations2023/11/1
- CoBEV: Elevating Roadside 3D Object Detection with Depth and Height Complementarity2023/10/1
- FocusFlow: Boosting Key-Points Optical Flow Estimation for Autonomous Driving2023/8/1
- Towards Anytime Optical Flow Estimation with Event Cameras2023/7/1
- LF-PGVIO: A Visual-Inertial-Odometry Framework for Large Field-of-View Cameras using Points and Geodesic Segments2023/6/1
- Bi-Mapper: Holistic BEV Semantic Mapping for Autonomous Driving2023/5/1
- FishDreamer: Towards Fisheye Semantic Completion via Unified Image Outpainting and Segmentation2023/3/1
- PanoVPR: Towards Unified Perspective-to-Equirectangular Visual Place Recognition via Sliding Windows across the Panoramic View2023/3/1
- LF-VISLAM: A SLAM Framework for Large Field-of-View Cameras with Negative Imaging Plane on Mobile Agents2022/9/1
- Behind Every Domain There is a Shift: Adapting Distortion-aware Vision Transformers for Panoramic Semantic Segmentation2022/7/1
- Efficient Human Pose Estimation via 3D Event Point Cloud2022/6/1
- Review on Panoramic Imaging and Its Applications in Scene Understanding2022/5/1
- CSFlow: Learning Optical Flow via Cross Strip Correlation for Autonomous Driving2022/2/1
- PanoFlow: Learning 360{\deg} Optical Flow for Surrounding Temporal Understanding2022/2/1
- LF-VIO: A Visual-Inertial-Odometry Framework for Large Field-of-View Cameras with Negative Plane2022/2/1