Hesheng Wang
収録論文 85本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PhyVisGen: 物理的・視覚的に高忠実なロボットマニピュレーションデータ生成sim2real2026/9/22
ソフトグリッパを含む操作軌跡の物理シミュレーションと実シーン再構成によるリアルな描画を組み合わせ、実機データなしで学習した方策が実ロボット5タスクで65〜95%の成功率を達成したデータ生成フレームワーク。
- DynaForge: 動的マニピュレーションのデモ生成のための計画誘導型残差学習マニピュレーション2026/9/22
低周波の大域計画と高周波の物体中心逆運動学を組み合わせ、残差方策で接触時の動的相互作用を補正することで、動的物体操作の高品質なデモンストレーションを生成するフレームワーク。
- 適応的世界記憶3D基盤モデル:スケーラブルな3Dマッピング・自己位置推定・レンダリング3D基盤モデル/SLAM2026/9/18
Transformerベースのゲート付き更新と時空間調整を組み合わせた適応的世界記憶機構により、長期記憶・大規模マッピング・ガウシアンレンダリングを単一モデルで統合した3D基盤モデルを提案。
- WM-VS: 進捗整合型ワールドモデルによる閉ループビジュアルサーボビジュアルサーボ2026/9/17
目標領域との対応からサーボ座標を定義し、行動結果が誤差を減らすかを予測するワールドモデルと反応型方策を学習。実機7自由度系で高精度な閉ループ視覚サーボと未学習目標への転移を実現した。
- GraphPoint: 意味的実体グラフと点軌道による組合せ的ロボットマニピュレーションマニピュレーション2026/9/16
言語指示に応じて物体と動作を組み合わせて汎化するため、意味的実体グラフと把持点の未来軌道予測を組み合わせた操作方策GraphPointを提案し、新ベンチマークCoManiで検証した。
- HAP: 手駆動型能動的知覚による自己中心視点の頭部運動予測フレームワーク自己中心視点予測2026/9/16
手の動きと対象物の遮蔽関係から将来の頭部6自由度運動を予測する枠組みHAPを提案し、新データセットBottleで既存手法より高精度を示した。
- VT-MUSE: 操作のためのマルチモーダル統合シーケンシャル視触覚表現学習視触覚表現学習2026/8/21
視覚と触覚の時系列情報を統合する表現学習フレームワークを提案し、シミュレーションと実世界で操作タスクの成功率を大幅に向上させた。
- GaussianDWM++: 言語基盤の3Dガウス駆動世界モデルによる統一的なシーン理解・編集・マルチモーダル生成世界モデル/3Dシーン理解2026/8/17
3Dガウス表現に視覚言語特徴を蒸留し、シーン理解・言語推論・4D編集・マルチモーダル生成を単一フレームワークで統合した駆動世界モデルを提案した。
- 教えて育てる:汎用ロボット学習のためのエージェント中心アーキテクチャVLA2026/8/17
この論文は、少数のデモから再利用可能なスキルブロックを学習し、新しいシーンでそれらを組み合わせてタスクを実行するエージェント中心のアーキテクチャ(TGL)を提案し、再学習の負担を軽減する。
- 大規模シーン再構成のためのローカルからグローバルへのループクロージャを備えたマルチサブマップ暗黙的ニューラルSLAMSLAM2026/8/10
NeRFベースのSLAMを大規模環境に拡張するため、マルチサブマップ構造と二段階のループクロージャ機構を導入し、記憶爆発を防ぎつつ高精度な再構成とロバストな位置推定を実現した。
- ExtraGS: 拡散ガイドによる3Dガウススプラッティングを用いた内視鏡視野外挿の強化内視鏡/3D再構成2026/7/14
内視鏡映像から3Dシーンを再構成し、視野外の解剖学的構造を拡散モデルで補完することで、内視鏡の視野外挿を高精度化するフレームワークを提案した。
- コートを着せる:微分可能な衣服シミュレーションを用いた双腕ロボットによる着衣支援マニピュレーション2026/7/1
微分可能な衣服シミュレーションを統合した双腕ロボットの着衣制御アルゴリズムを提案し、接触拘束下での衣服状態を高精度に推定して多段階制御でコート着衣を実現した。
- 衝突ベースの遅延探索による高速マルチマニピュレータ計画マニピュレーション2026/7/1
複数マニピュレータの動作計画を高速化するため、遅延評価と事前計算を組み合わせた新しいアルゴリズムCBLSを提案した。
- 小型ロボットの移動性能向上のための高自由度・軽量な生体模倣脚脚機構/生体模倣2026/6/1
昆虫の脚を模した4自由度のマイクロ並進脚機構を提案し、設計・運動学解析と実験により高い運動柔軟性と軽量性を実証した。
- MAGS-SLAM: 単眼マルチエージェント・ガウススプラッティングSLAMによる幾何・光度整合的な再構成SLAM2026/5/1
RGBカメラのみを用いた複数エージェントによる3DガウススプラッティングSLAMを提案し、各エージェントが局所サブマップを構築して圧縮情報を交換することで、深度センサなしで協調的な高品質3D再構成を実現した。
- CoMo3R-SLAM: 学習型3D再構成事前知識を用いた屋外マルチエージェント向け協調単眼高密度SLAMSLAM2026/5/1
単眼RGBカメラのみで、学習型の3D再構成事前知識を活用し、複数エージェントが協調して高密度で一貫した3D地図を構築するSLAMシステムを提案した。
- HCSG: 視覚言語ナビゲーションのための人間中心の意味・幾何推論ナビゲーション2026/5/1
動的な人間環境での視覚言語ナビゲーションにおいて、人間の行動意図を理解するための人間中心フレームワークを提案し、幾何予測と意味解釈を統合して社会的に適切なナビゲーションを実現する。
- 人間のビデオからのロボット学習:サーベイ模倣学習2026/4/1
ロボットが人間の行動ビデオからスキルを獲得する手法を包括的にレビューし、タスク・観察・行動指向の転移経路とデータ基盤を整理したサーベイ論文。
- CALMを保て:視覚幾何基盤モデルとアシスタントアイによるキャリブレーションフリーのキロメートル級SLAMSLAM2026/4/1
視覚幾何基盤モデル(VGFM)をキロメートル級SLAMに展開する際、単一の線形変換では非線形な幾何歪みを補正できない問題を解決するため、物理的間隔の事前知識を活用する「アシスタントアイ」とエピポーラ拘束に基づく補正モデルを導入したプラグアンドプレイフレームワークCAL2Mを提案した。
- 成長する状態空間とハイブリッド行動領域に基づくPOMDP物体探索物体探索2026/4/1
移動ロボットが複雑な屋内環境で目標物体を効率的に見つけるため、物体探索を成長する状態空間とハイブリッド行動空間を持つPOMDPとして定式化し、新しいオンラインソルバーGNPF-kCTを提案した。
- 視覚・音・言語・行動パラダイムに向けて:音中心操作のためのHEARフレームワーク操作2026/3/1
音をリアルタイムに活用した操作を実現するため、視覚・音声・言語・行動を統合した連続制御パラダイムVSLAを提案し、その実装としてHEARフレームワークを導入した。
- PhysiFlow: 物理認識型ヒューマノイド全身VLA - マルチブレイン潜在フローマッチングとロバスト追従による実現ヒューマノイド制御/VLA2026/3/1
ヒューマノイドの全身制御に視覚言語行動(VLA)を統合し、物理認識型のマルチブレインVLAフレームワークを提案。動的で四肢協調を要するタスクでの安定性を向上させた。
- SSP: 行動制約と空間制約の同時最適化による安全性保証付き手術ポリシー手術ロボティクス2026/3/1
強化学習や模倣学習で得た手術ポリシーに、不確実性を考慮した制御バリア関数を組み合わせ、行動制約と空間制約を満たしつつ安全性を保証するフレームワークを提案した。
- CSSDF-Net: 構成空間距離場のニューラル陰関数表現に基づく安全な動作計画動作計画2026/3/1
構成空間で連続的な符号付き距離場を学習し、関節空間での距離と勾配を提供することで、安全制約付き軌道最適化やMPCに統合し、未学習環境でもゼロショットで衝突回避を可能にする手法を提案した。
- OGScene3D: シーン理解のための漸進的オープンボキャブラリ3Dガウシアンシーングラフマッピングシーン理解2026/3/1
ロボットが環境を漸進的に探索しながら、オープンボキャブラリの3Dセマンティックマップとシーングラフを構築するシステムを提案した。
- Dream-SLAM: 動的環境における能動SLAMのための未観測領域の夢生成能動SLAM2026/2/1
部分的に観測された動的環境の時空間画像と意味構造を生成(夢見)し、実観測と融合することで、カメラ姿勢推定・3D地図生成・長期的な探索計画を改善する単眼能動SLAM手法を提案。
- NRGS-SLAM: 変形対応3Dガウシアンスプラッティングによる内視鏡向け単眼非剛体SLAMSLAM2026/2/1
内視鏡映像の軟組織変形に対応するため、各ガウシアンに学習可能な変形確率を持たせた3Dガウシアンマップと変形対応トラッキングを組み合わせた単眼非剛体SLAMを提案。
- PILOT: 非構造環境での移動操作のための知覚統合型低レベルコントローラ移動操作2026/1/1
人間型ロボットが複雑な非構造環境で安定して移動しながら操作を行うため、知覚情報と固有感覚を融合し、複数の運動スキルを専門家混合で調整する単一の強化学習ポリシーを提案。シミュレーションと実機で有効性を検証。
- 動的センサフットプリントを考慮したエルゴディック軌道計画軌道計画2025/12/1
センサの視野が移動に伴い変化する状況に対応するため、動的フットプリントを考慮した新しいエルゴディック指標と軌道最適化アルゴリズムを提案し、従来法より最大10倍優れたエルゴディック性を実現した。
- MUT3R: 動きを考慮した更新トランスフォーマーによる動的3D再構成3D再構成2025/12/1
事前学習済みトランスフォーマーの自己注意マップから動きの手がかりを抽出し、再学習なしで動的領域の影響を抑制してストリーミング3D再構成を安定化させる手法を提案。
- 腱駆動伝達と分散アクチュエーションを備えた15自由度バイオニックハンドの開発マニピュレーション2025/12/1
人間の手の構造を模倣し、前腕に5個・手のひらに10個のモータを分散配置した腱駆動式の15自由度ロボットハンドを開発した。軽量1.4kgで高い把持力と繊細な操作を両立した。
- D$^2$GSLAM: 4次元動的ガウシアンスプラッティングSLAMSLAM2025/12/1
ガウシアン表現を用いて、動的環境下で動的物体の再構成とロボットの自己位置推定を同時に行うSLAMシステムを提案した論文。
- ロボティクスに最適な3Dシーン表現は何か?幾何表現から基盤モデルまで3Dシーン表現2025/12/1
ロボティクスにおける点群・ボクセル・SDF・NeRF・3DGS・基盤モデルなどの3Dシーン表現を、知覚・地図構築・自己位置推定・ナビゲーション・マニピュレーションの5モジュール別に整理・比較したサーベイ。
- Uni-Hand: 一人称視点における汎用手動作予測動作予測2025/11/1
一人称視点の動画から、頭部と手の動きを拡散モデルで同時に予測し、手首・指先の2D/3D軌道や物体との接触状態まで推定する汎用手動作予測フレームワークを提案。
- 計画レベルの意図予測を備えた移動ロボットの共有制御フレームワーク共有制御2025/11/1
人間の将来の動きを「意図領域」として予測し、経路再計画と組み合わせて移動ロボットを支援する共有制御手法を提案。シミュレーションのみで学習し、実機実験で作業負担の軽減と安全性向上を確認した。
- 進化し続けるスキル知識を持つ視覚言語行動モデルVLA2025/11/1
VLAモデルにパラメータを増やさずに継続的模倣学習を導入し、知識誘導型エキスパートルーティングでタスク特化を実現するフレームワークStellar VLAを提案。
- 不確実性を見通す:視覚ナビゲーションにおけるロバストなタスク指向最適化視覚ナビゲーション2025/10/1
視覚ナビゲーションでデータ不足時に生じる知覚の不確実性を凸集合としてモデル化し、ロバスト最適化と統合することで未知環境への汎化性能を高める学習フレームワークNeuROを提案した。
- 好奇心は道を開く:マルチエージェント文脈校正による好奇心駆動型探索マルチエージェント強化学習2025/9/1
マルチエージェント強化学習において、仲間の行動から文脈を推論して好奇心を動的に校正し、ノイズを除去して効率的な探索を実現する手法CERMICを提案。
- FlowVLA: 視覚的思考連鎖による動作推論を用いた視覚-言語-行動モデルVLA2025/8/1
未来フレーム予測の前にオプティカルフローで動作を推論するVisual CoTを導入し、物理的に妥当な予測と高効率なロボット操作を実現した。
- SGLoc: 3Dガウシアンスプラッティング表現を用いたセマンティック位置推定システム位置推定2025/7/1
3Dガウシアンスプラッティングのセマンティック情報を活用し、初期姿勢なしでカメラの6DoF姿勢を直接回帰する位置推定システムを提案。
- RationalVLA:デュアルシステムを備えた合理的視覚言語行動モデルVLA2025/6/1
曖昧・不可能な指示を拒否しつつ、実行可能な指示に基づくロボットアーム操作を行う二重システムの視覚言語行動モデルを提案し、新ベンチマークRAMAで評価した。
- 一人称視点動画におけるゼロショット時間的インタラクション定位VLA2025/6/1
一人称視点動画で人間と物体の把持動作のタイミングを、大規模視覚言語モデルと3D手の速度を活用してゼロショットで高精度に定位する手法EgoLocを提案した。
- MCN-SLAM: ハイブリッド暗黙的ニューラルシーン表現を用いたマルチエージェント協調ニューラルSLAMSLAM2025/6/1
複数エージェントが協調して動作する分散型ニューラルSLAMフレームワークを提案し、通信帯域制約下での大規模環境の再構成と、単一・複数エージェント両対応の実世界データセットを構築した。
- BEV-GS: 鳥瞰図におけるフィードフォワードガウススプラッティングによる路面再構成路面再構成/ガウススプラッティング2025/4/1
単一フレームから鳥瞰図パラダイムで路面の形状とテクスチャを推定し、グリッドガウス表現でリアルタイムに高精度な路面再構成と新規視点合成を実現した。
- トポロジカルダイナミクスによる汎用モデル:衣類の折り畳みマニピュレーション2025/4/1
衣類の折り畳み構造をトポロジカルグラフで表現し、GNNで変形を予測・制御することで、自己遮蔽のある複雑な衣類を折り畳む手法を提案した。
- UTTG: オンライン軌道生成による汎用テレオペレーション手法テレオペレーション2025/4/1
URDFから運動学パラメータを自動抽出し、低頻度な人間入力と高頻度なロボット制御の周波数ギャップをオンライン軌道生成で埋める、機種非依存のテレオペレーションシステムを提案した。
- 意味グラフを活用した高効率・高ロバストLiDAR SLAMSLAM2025/3/1
LiDAR SLAMにおいて、環境の幾何・意味・トポロジー情報を統合した意味グラフを構築し、オドメトリ失敗時の再位置推定やループ閉じ込みを高精度化する二重スレッド型フレームワークを提案。
- 手術ロボット自動操作のための拡散安定化ポリシー手術ロボット/模倣学習2025/3/1
不完全な軌道データでも学習できる拡散モデルベースのポリシー学習フレームワークを提案し、手術ロボットの自動操作における性能とロバスト性を向上させた。
- KN-LIO: 幾何学的運動学とニューラルフィールドを融合したLiDAR慣性オドメトリSLAM2025/1/1
LiDARと慣性データをオンラインSDFデコードと誤差状態カルマンフィルタで融合し、高ダイナミック環境での自己位置推定と高密度マッピングを同時に実現する手法を提案。
- 想像による計画:視覚と言語によるナビゲーションのためのエピソード的シミュレーションとエピソード的記憶VLA2024/12/1
人間のエピソード的シミュレーションと記憶に着想を得て、エージェントが未来のシーンを想像しながら記憶を拡張するVLNアーキテクチャを提案し、SPLで最先端を達成した。
- 暗黙的シーン表現の不確かさを活用した視覚ナビゲーションの探索能力向上視覚ナビゲーション2024/11/1
NeRFの不確かさを利用して探索行動を促し、画像ゴールナビゲーションの性能を高めるエンドツーエンド手法を提案。
- PG-SLAM: 動的環境におけるフォトリアルで幾何学的に正確なRGB-D SLAMSLAM2024/11/1
ガウススプラッティングを拡張し、動的な人や物体の変形・動きをモデル化しつつ、フォトリアルな前景と静的背景を同時に再構成してカメラ位置推定を行うRGB-D SLAM手法を提案。
- 自律屋内駐車に向けて:大域的に整合する意味SLAMと意味ローカライゼーションサブシステムSLAM2024/10/1
駐車場での正確な意味地図構築とロバストな自己位置推定を実現するため、意味制約付き因子グラフを用いたGCSLAMと、構築した意味地図を利用するSF-Locを提案した。
- 階層的タスク下での効率的な物理的人間-ロボットインタラクションのための方向制約付き制御物理的人間-ロボットインタラクション2024/10/1
階層的タスクにおける物理的人間-ロボットインタラクションのため、方向制約を導入した最適化アルゴリズムと可変アドミタンス制御を提案し、7自由度ロボットアームで有効性を検証した。
- ロボティクスにおける3Dガウシアンスプラッティング:サーベイ3D表現2024/10/1
ロボティクス分野での3Dガウシアンスプラッティング(3DGS)の応用と技術進歩を包括的に調査し、課題と将来展望をまとめたサーベイ論文。
- RL-GSBridge: 3Dガウシアンスプラッティングによるロボットマニピュレーション学習のためのReal2Sim2Real手法sim2real2024/9/1
3Dガウシアンスプラッティングを強化学習シミュレーションに組み込み、メッシュベースの編集と物理シミュレータ同期により、視覚ベースの深層強化学習でゼロショットのsim-to-real転移を実現した。
- 単眼画像に基づくケーブル駆動ソフトロボットの三次元力推定手法触覚2024/9/1
単眼画像と駆動情報を融合したエンドツーエンドネットワークにより、ソフトロボットの3次元接触力を高精度に推定する手法を提案した。
- DSLO: 不整合な時空間伝播に基づく深層シーケンスLiDARオドメトリLiDARオドメトリ2024/9/1
LiDAR点群の時系列から自己位置推定を行う深層学習手法を提案し、空間特徴の再利用やゲート付き階層的姿勢精緻化、時間的特徴伝播により、KITTIとArgoverseで精度と速度を両立した。
- FLAME: 都市環境におけるマルチモーダルLLMによるナビゲーション学習VLA2024/8/1
都市の視覚言語ナビゲーション向けに、3段階のチューニングでマルチモーダルLLMを適応させるエージェントFLAMEを提案し、Touchdownデータセットでタスク完了率を7.3%向上させた。
- マルチモーダルUAV検出・分類・追跡アルゴリズム:CVPR 2024 UG2チャレンジ技術報告UAV追跡2024/5/1
複数のセンサ情報を統合し、悪天候下でもドローンの検出・分類・3D追跡を高精度に行う手法を提案し、CVPR 2024のUAV追跡・姿勢推定チャレンジで優勝した。
- ロボティクスにおけるNeRF:サーベイNeRF2024/5/1
NeRFのロボティクスへの応用と、ロボティクス展開に向けたNeRF自体の改良に関する研究を体系的にまとめたサーベイ論文。
- 大規模シーンにおける単眼カメラの深度・姿勢・暗黙的シーン表現のインクリメンタル統合学習3D再構成2024/4/1
単眼カメラ映像から大規模シーンの高精度な深度推定・カメラ姿勢推定・フォトリアルな3D再構成を同時に実現するインクリメンタル統合学習フレームワークを提案。
- NeSLAM: 深度補完とノイズ除去を備えたニューラル暗黙的マッピングと自己教師あり特徴追跡SLAM2024/3/1
RGB-Dセンサの疎でノイズの多い深度を補完・除去するネットワークとSDFベースの階層的シーン表現、NeRFベースの自己教師あり特徴追跡を組み合わせ、高精度な3D再構成とロバストなカメラ追跡を実現したSLAMフレームワーク。
- 高密度ビジュアルSLAMのためのコンパクト3DガウシアンスプラッティングSLAM2024/3/1
3Dガウシアンを用いたSLAMのメモリと計算コストを削減するため、スライディングウィンドウによるマスキングと幾何コードブックでガウシアン楕円体を圧縮し、高精度な姿勢推定とリアルタイム描画を両立させた。
- LHMap-loc: LiDAR点群ヒートマップを用いたクロスモーダル単眼自己位置推定自己位置推定2024/3/1
LiDAR点群マップをヒートマップ化して圧縮し、単眼カメラ映像からオプティカルフローと空間アテンションでリアルタイムに自己位置を回帰する手法を提案。
- SemGauss-SLAM:密なセマンティックガウシアンスプラッティングSLAMセマンティックSLAM2024/3/1
3Dガウシアン表現にセマンティック特徴を埋め込み、セマンティック情報を活用したバンドル調整でカメラ姿勢と3D表現を同時最適化する密なセマンティックSLAMを提案。
- Multi-Agent Combinatorial Path Finding with Heterogeneous Task Duration2023/11/1
- SNI-SLAM: Semantic Neural Implicit SLAM2023/11/1
- The RoboDepth Challenge: Methods and Advancements Towards Robust Depth Estimation2023/7/1
- End-to-end 2D-3D Registration between Image and LiDAR Point Cloud for Vehicle Localization2023/6/1
- Efficient Robot Skill Learning with Imitation from a Single Video for Contact-Rich Fabric Manipulation2023/4/1
- A Dual-Arm Collaborative Framework for Dexterous Manipulation in Unstructured Environments with Contrastive Planning2022/9/1
- Pseudo-LiDAR for Visual Odometry2022/9/1
- Unsupervised Learning of 3D Scene Flow from Monocular Camera2022/6/1
- DetFlowTrack: 3D Multi-object Tracking based on Simultaneous Optimization of Object Detection and Scene Flow Estimation2022/3/1
- Interactive Multi-scale Fusion of 2D and 3D Features for Multi-object Tracking2022/3/1
- Action Planning for Packing Long Linear Elastic Objects into Compact Boxes with Bimanual Robotic Manipulation2021/10/1
- Unsupervised Learning of Monocular Depth and Ego-Motion Using Multiple Masks2021/4/1
- A Registration-aided Domain Adaptation Network for 3D Point Cloud Based Place Recognition2020/12/1
- Learning of Long-Horizon Sparse-Reward Robotic Manipulator Tasks with Base Controllers2020/11/1
- End-to-End 3D Point Cloud Learning for Registration Task Using Virtual Correspondences2020/11/1
- Learning Actions from Human Demonstration Video for Robotic Manipulation2019/9/1
- Coordinating Large-Scale Robot Networks with Motion and Communication Uncertainties for Logistics Applications2019/4/1
- Real-time Trajectory Generation for Quadrotors using B-spline based Non-uniform Kinodynamic Search2019/4/1
- SeqLPD: Sequence Matching Enhanced Loop-Closure Detection Based on Large-Scale Point Cloud Description for Self-Driving Vehicles2019/4/1