Hao Wang
Texas A&M University
収録論文 74本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GIFTBench:画像偽造位置推定における汎化性能の診断とモデル設計への指針画像偽造検出2026/10/1
多様な偽造条件を軸別に評価できる大規模ベンチマークGIFTBenchを構築し、汎化性能の診断と学習リソースとしての有効性を示すとともに、知見を活かした検出・位置推定フレームワークForenScopeを提案した。
- EWAM:統合身体モデルにおける創発的な深さ方向の専門化——意味理解から視覚的先読み、行動までVLA2026/9/30
行動中心の統合身体モデルEWAMを提案し、層ごとの監督なしに浅い層で意味、中間層で予測未来、深い層で行動に注意が向く創発的な深さ方向の専門化が生じることを示した。
- AerialDojo-200K:オープンワールド航空物体目標探索のための大規模ベンチマークスイート航空探索2026/9/28
航空エージェントが大規模3D環境を自律探索し、意味記述や参照画像で指定された物体に到達するタスクのための、既存比3倍のシーンと18.7倍のタスクを含む大規模ベンチマークを構築した。
- 巧みな触覚ワールドモデル触覚2026/9/28
手袋型触覚センサと映像を組み合わせ、一人称視点の操作を予測する映像拡散トランスフォーマーベースのワールドモデルを提案。触覚情報により手の動きの過小評価を23%から9%に低減し、手領域の知覚誤差を7.4%改善した。
- OPIS: ビデオ世界モデルにおけるマルチオブジェクト記憶のための入力接地ベンチマークビデオ世界モデル2026/9/28
ビデオ世界モデルが初期観測の物体をどれだけ記憶できるかを評価するベンチマークOPISを提案し、8モデルで物体の存在・同一性・構造を測定した。
- TimelyDAgger: VLAポリシー改善のためのタイミング考慮型エキスパートクエリVLA2026/9/27
VLAポリシーの内部特徴を監視し、エキスパートの介入タイミングを適応的に調整することで、限られた介入予算でポリシー改善を効率化する手法を提案。
- 状態行動を超えて:ロボット模倣学習における指令と状態の不一致の活用模倣学習2026/9/27
ロボットの模倣学習において、指令と実際の状態の不一致を重み付けに利用する手法CSDWを提案し、制約のある実機タスクで性能を向上させた。
- X2Real:実世界汎用ポリシー評価のための拡張可能なシミュレーションベンチマークsim2real2026/9/23
実機との相関0.84を達成したIsaac Labベースの進化型シミュレーションベンチマークで、10能力次元・44タスクにより汎用マニピュレーションポリシーを忠実・多様・公平に評価する。
- X-Planner: 身体性知能のためのイベント構造化タスクプランニングVLA2026/9/21
VLAシステムのためのプランニングフロントエンドX-Plannerを提案し、イベント構造化された計画形式と段階的デコーディングで長期的操作タスクの計画品質と実行性能を向上させた。
- 身体性知能のための世界モデル:もっともらしさから制御可能性、そして行動可能性へ世界モデル2026/9/15
身体性知能における世界モデルを、もっともらしさ・制御可能性・行動可能性の3段階の能力レベルで整理し、操作・ナビゲーション・歩行・自動運転などの研究を横断的に調査したサーベイ。
- NavPatch: 視覚言語モデルによる証拠に基づく物体レベルコストマップ補正ナビゲーション2026/9/13
視覚言語モデルで物体を認識し、障害物マップに「追加・削除・拡張」の補正を施すことで、ケーブルやカーテンなど形状が実態と合わない物体への対処を改善した移動ロボットナビゲーション手法。
- WALL-SS: 次スケール自己回帰による長期的世界モデルのスケーリング世界モデル2026/8/26
ロボットの視覚的未来予測をスケール単位の自己回帰で生成する世界モデルを提案し、行動制御可能で長期的なシミュレーションを実現した。
- 単一の人間ビデオから数秒でロボットが操作スキルを獲得操作スキル獲得2026/7/1
ロボットが1本の人間のデモ動画から、数秒で新しい操作スキルを獲得しつつ、既存スキルを保持できるフレームワークHOSTを提案した。
- DRBA: 動的ロボットバランスアシスト -- 多様な訓練のためのアシスト・アズ・ニーデッド歩行・バランスリハビリテーションロボットリハビリテーション2026/7/1
加齢や病態によるバランス低下に対し、骨盤支持用3自由度ロボットアームと起立補助モジュールを統合した歩行訓練ロボットDRBAを開発し、透明性の高い支援と患者9名での有効性を示した。
- 任意形状の中継面を用いた3Dガウシアン過渡レンダリングによる非視線計測非視線計測2026/6/19
平面壁や密なサンプリングを仮定せず、任意形状の中継面からの測定データを用いて隠れたシーンを3Dガウシアンで表現し、微分可能な過渡レンダリングで直接再構成する手法を提案。実データで最先端の精度を達成した。
- EvolveNav: ゼロショット物体目標ナビゲーションのための先行的内省と自己進化メモリナビゲーション2026/6/16
ゼロショット物体目標ナビゲーションにおいて、過去の軌跡からルールを抽出し、探索前に結果を予測する自己進化フレームワークを提案し、成功率を向上させた。
- GraspFoM: 3D基盤モデルを用いた再構成駆動型ロボット把持マニピュレーション2026/6/7
3D基盤モデル(SAM3D)を活用し、物体の再構成と把持姿勢予測を共有の3D潜在表現で統合するフレームワークを提案。再構成による幾何情報と把持学習の相互作用で、部分観測下でも高精度な把持と高忠実度な3D再構成を実現した。
- 見ることが信じることではない ― 検索基盤型動画誤情報検出のベンチマーク誤情報検出2026/6/2
動画の誤情報を検出するため、ウェブ検索で関連動画を探し比較するベンチマークEVID-Benchを構築し、最先端モデルの性能が低いことを示した。
- X-Tokenizer: 視覚・言語・行動事前学習のためのマルチモーダル行動トークナイザーVLA2026/6/1
ロボットの行動を離散コードに変換する際、単なる再構成ではなく意味的なインターフェースとして学習する新しいトークナイザーを提案。マスク行動モデリングと対照学習により、行動コードが視覚言語の意味と整合するようにした。
- 歪みに頑健な自律ケーブル配線のためのロボット模倣学習模倣学習2026/6/1
画像の歪みが発生するケーブル配線作業において、画像品質評価と信頼度に基づく学習機構を導入し、歪んだ観測下でも高性能を維持するロボット模倣学習フレームワークを提案した。
- 行動アンクローニング:推論時ステアリングなしでモードリダイレクションをポリシー重みに蒸留する手法模倣学習/ポリシー編集2026/6/1
デモデータに含まれる望ましくない行動モードを抑制するため、一時的なモード分類器からのリダイレクション信号をポリシー重みに蒸留し、推論時オーバーヘッドなしで安全な行動を実現する手法MoREを提案した。
- WAM4D: 空間レジスタトークンによる高速4DワールドアクションモデルVLA2026/6/1
ロボットの行動予測と未来観測を同時に行うワールドアクションモデルにおいて、軽量な空間レジスタトークンを用いて事前学習済みの幾何学的特徴を因果的なビデオ・アクショントランスフォーマーに転送し、高コストな幾何学的デコードを避けつつ4D空間整合性を向上させる手法を提案した。
- WALL-WM: イベント接合部での世界行動モデリングの彫刻VLA2026/6/1
WALL-WMは、ビデオ行動学習をチャンク中心の最適化からイベント基盤の視覚言語行動事前学習へと移行させ、意味的に一貫した行動イベントを学習の原子単位として使用する世界行動モデルです。
- MV-WAM: 多様体を考慮した価値拡張付き世界行動モデル操作2026/6/1
視覚と行動のモダリティ間の構造的不整合を解消するため、多様体認識最適化と価値誘導ロールバックを備えた世界行動モデルMV-WAMを提案し、ロボット操作の汎化性能を向上させた。
- IOI: インタラクティブ世界モデルのための運動学と物理の分離世界モデル2026/6/1
解析的な運動学の事前知識と学習された物理ダイナミクスを組み合わせたハイブリッドなインタラクティブ世界モデルを提案し、正確な制御と物理的に妥当な視覚フィードバックを実現する。
- MaMi-HOI:大域的な運動学と局所的な幾何学の調和による人間と物体のインタラクション生成人間と物体のインタラクション生成2026/5/1
人間と物体のインタラクション生成において、拡散モデルの深層化で物体の幾何学情報が失われる「幾何学的忘却」問題を発見し、それを補正するアダプタと運動学的調和アダプタを備えた階層的フレームワークを提案した。
- 割引リビネス定式化による操作ポリシーのオフラインポリシー評価ポリシー評価2026/5/1
スパース報酬と有限長ロールアウトによる打ち切りバイアスに頑健な、リビネスに基づくベルマン作用素を用いたオフラインポリシー評価手法を提案した。
- LoopVLA: 反復的改良における十分性学習による視覚言語行動モデルVLA2026/5/1
視覚言語行動モデルにおいて、表現の十分性を推定しながら反復的に改良を行う新しいアーキテクチャを提案し、計算効率と精度のバランスを改善した。
- Wall-OSS-0.5 技術報告書VLA2026/5/1
大規模VLA事前学習がロボットの実行可能な行動を直接生み出すかを検証し、ゼロショットで実ロボット動作を達成するオープンソース4Bモデルを提案した。
- VEGA: 空間認識型視覚言語行動モデルのための視覚エンコーダ接地整列VLA2026/5/1
VLAモデルの視覚エンコーダ出力を、3D空間認識を持つDINOv2-FiT3Dの特徴に直接整列させることで、空間認識能力を向上させる軽量なフレームワークを提案。推論時には追加コストなしで性能が向上する。
- XRZero-G0:インターフェース、品質、比率で器用なロボット操作の最前線を押し広げるデータ収集/模倣学習2026/4/1
ロボットを使わない人間のデモデータ収集システムXRZero-G0を提案し、閉ループの品質管理とデータ混合比率の最適化により、少量の実機データで大規模なロボットフリーデータと組み合わせて同等性能を達成し、コストを20分の1に削減した。
- 幾何学的有用性スコアリングによるTransformerベース単眼SLAMの高速化SLAM2026/4/1
単眼SLAMの計算冗長性を減らすため、フレームのマッピング価値を事前に予測する軽量なゲーティングネットワークLeanGateを提案し、90%以上の冗長フレームをスキップして85%以上の計算削減と5倍のスループット向上を実現した。
- 安全性価値関数制約付きモデル予測制御による安全性と性能の同時最適化制御2026/4/1
モデル予測制御に安全性価値関数に基づく終端制約を追加し、計画期間を超えた安全性を保証しつつ高性能な軌道生成を実現。実機マニピュレータで検証し、従来手法より安全性と性能の両立を改善した。
- 反実仮想失敗合成による実行可能な操作リカバリの学習マニピュレーション2026/3/1
実世界の成功デモから生成モデルで反実仮想的な失敗ロールアウトを合成し、失敗診断と回復軌道を予測するフレームワークを提案。実機実験で補正精度を大幅に向上させた。
- 月面科学探査と有人宇宙飛行の安全性を支える宇宙ロボティクスの新潮流宇宙ロボティクス2026/3/1
月を拠点とした科学探査と有人飛行支援におけるAI・宇宙ロボティクスの役割を概観し、自律性やセンサ融合が持続可能な探査と将来の火星有人飛行にどう貢献するかを論じた論文。
- ManipArena:推論指向の汎用ロボットマニピュレーションの実世界包括評価マニピュレーション2026/3/1
実機ロボットでのマニピュレーション汎化を公平に評価するため、20タスク・1万超の専門家軌道・約188時間分のデータを備えた標準化ベンチマークを構築し、VLAやワールドアクションモデルなど7構成を比較した。
- オンライン専門家補正を用いたサンプル効率の良い血管分岐ナビゲーションのための自律カテーテル操作医療ロボティクス/強化学習2026/2/1
血管内分岐ナビゲーションにおいて、オンライン専門家補正とファジィ制御・構造化報酬を組み合わせた強化学習フレームワークを提案し、少ない訓練エピソードで高精度な自律カテーテル操作を実現した。
- 言語モデルをロボティクス向け閉ループ高レベルプランナとして活用する:概要とベンチマークVLA2025/11/1
LLM/VLMをロボットの高レベルプランナとして閉ループで使う際の制御ホライズンやウォームスタートの影響を実験的に調べ、性能と堅牢性を高める実践的指針を示した。
- RoboArmGS: ベジェ曲線補正による高品質なロボットアームのスプラッティングロボットアーム/3D再構成2025/11/1
URDFに基づく理想的な関節運動を学習可能なベジェ曲線で補正し、実世界の動きに即した高品質な3Dガウシアン表現を実現した研究。
- 物理AIのための動画基盤モデルによる世界シミュレーション世界モデル2025/11/1
テキスト・画像・動画から世界を生成する動画基盤モデルCosmos-Predict2.5と、Sim2Real/Real2Real変換を行うCosmos-Transfer2.5を発表し、ロボティクス向けの合成データ生成やシミュレーションを可能にした。
- ガウススプラッティングによる実世界ゼロショットロボットマニピュレーション学習のための高忠実度シミュレーションデータ生成sim2real2025/10/1
実世界の多視点画像から3DGSとメッシュを組み合わせて物理的に操作可能な高忠実度シミュレーション環境を構築し、MLLMで物体の物理特性や関節構造を自動推定することで、シミュレーションのみで訓練した方策が実世界の多様なマニピュレーションタスクへゼロショット転移できることを示した。
- EmbodiedBrain: 具現化知能のためのタスクプランニング性能の限界を拡張するVLA2025/10/1
7Bと32Bの視覚言語基盤モデルEmbodiedBrainを提案し、SFTとStep-GRPOを組み合わせた学習法と新しい評価環境で具現化タスクの計画性能を向上させた。
- VLMを身体性空間へと点火する:WALL-OSSによる具現化基盤モデルVLA2025/9/1
大規模マルチモーダル事前学習を活用し、身体性を理解した視覚言語理解・言語と行動の連携・ロバストなマニピュレーションを統合したエンドツーエンドの具現化基盤モデルWALL-OSSを提案。
- 接触トリガ型ブラインドクライミング:教示学習と強化学習による車輪型二脚ロボットの汎化可能な段差乗り越え歩行2025/9/1
車輪と障害物の接触を検知すると脚上げ動作を起動し、教示学習と強化学習を組み合わせて、車輪半径を超える段差を自己受容感覚のみで連続的に乗り越える汎用フレームワークを提案した。
- ManipDreamer3D:占有マップを考慮した3D軌道によるロボットマニピュレーション動画の生成マニピュレーション2025/9/1
入力画像から3D占有マップを再構成し、衝突を避けた3Dエンドエフェクタ軌道を計画して、その軌道を条件に拡散モデルでロボットのピックアンドプレース動画を生成する手法を提案した。
- D²-LIO: 方向性縮退を考慮したLiDAR-IMUオドメトリの強化最適化LiDAR-IMUオドメトリ/縮退2025/8/1
LiDAR特徴の縮退に頑健なLiDAR-IMUオドメトリ手法を提案し、距離と運動量に応じた適応的外れ値除去とIMUを活用したスキャン・トゥ・サブマップ位置合わせで精度とロバスト性を向上させた。
- 汎化可能な両腕マニピュレーションのベンチマーク:CVPR 2025 MEISワークショップにおけるRoboTwin両腕協調チャレンジマニピュレーション2025/6/1
RoboTwinシミュレーションと実機ロボットを用いた両腕マニピュレーションの国際コンペを開催し、17タスクで64チームが競い、汎化可能な協調方策の知見をまとめた。
- モデル予測制御とハミルトン・ヤコビ到達可能性解析による自律システムの安全かつ高性能な展開制御/安全性2025/6/1
MPCとHJ到達可能性解析を組み合わせ、安全性を保証しつつタスク性能を最適化する枠組みを提案し、シミュレーションで有効性を示した。
- SpikePingpong:スパイク視覚を用いた高速・低速卓球ロボットシステムマニピュレーション2025/6/1
スパイク視覚と模倣学習を組み合わせ、高速な球検出と軌道予測を行うファスト・スローシステムで高精度なロボット卓球を実現した。
- OmniIndoor3D:包括的な屋内3D再構成3D再構成2025/5/1
RGB-Dカメラで撮影した屋内シーンを、ガウス表現を用いて見た目・形状・パノプティックに高精度で再構成するフレームワークを提案。
- ManipDreamer: 行動木と視覚ガイダンスによるロボットマニピュレーション世界モデルの強化マニピュレーション2025/4/1
指示を行動木として表現し、深度と意味の視覚ガイダンスを組み合わせることで、ロボット操作の動画生成における指示追従性と視覚品質を向上させた世界モデルを提案。
- タスク指向飛行への道:フレームワーク・基盤・原則飛行制御/sim2real2025/4/1
クアッドロータのエンドツーエンド深層強化学習のためのタスク指向フレームワークを提案し、シミュレーションから実機への転移を可能にするソフト・ハード・ファームウェアの統合基盤と設計原則を示した。
- GAA-TSO: 透明・鏡面物体のための幾何情報を活用した深度補完深度補完2025/3/1
透明・鏡面物体の深度を、RGB-D入力から点群を生成して3D構造特徴を抽出し、ゲート付きクロスモーダル融合で画像特徴と統合して高精度に補完する手法を提案。
- 移動ロボット運用における意味論的状況認識のフレームワーク状況認識2025/2/1
災害対応ロボットの遠隔運用において、リスクや人間活動の兆候といった意味論的状況情報を複数モダリティで取得・統合する枠組みを提案し、状況の複雑さを表す「Situational Semantic Richness」指標を導入した。
- 物理AIのためのCosmos世界基盤モデルプラットフォーム世界モデル2025/1/1
物理AI開発者向けに、カスタマイズ可能な世界モデルを構築するための基盤モデル・動画キュレーション・トークナイザを提供するオープンソースプラットフォーム。
- 線形時相論理で解釈可能な操作のためのハイブリッド強化学習方針マニピュレーション2024/12/1
線形時相論理(LTL)でタスク仕様を符号化し、ウェイポイント計画・行動プリミティブ選択・パラメータ決定の3階層方針を組み合わせることで、長期的なロボット操作タスクの探索効率と解釈性を高める強化学習フレームワークHyTLを提案した。
- 多層階ゼロショット物体ナビゲーション方策ナビゲーション2024/9/1
MLLMを活用し、複数階にまたがる未知環境で対象物体を探索するゼロショット物体ナビゲーション方策を提案し、四足歩行ロボットで実環境検証も行った。
- 制御制約定式化による安全性と性能の協調最適化制御最適化2024/9/1
安全性を状態制約から等価な制御制約に変換し、動的計画法で解ける制御制約付き最適制御問題として定式化することで、非線形システムの安全性と性能を両立させる手法を提案した。
- TriHelper: 動的支援によるゼロショット物体ナビゲーションナビゲーション2024/3/1
未知環境で特定物体へ向かうゼロショット物体ナビゲーションにおいて、衝突・探索・検出の課題を動的に支援する3つのヘルパーからなるフレームワークを提案し、HM3DとGibsonで既存手法を上回る性能を示した。
- 未知のダイナミクスを持つシステムに対する安全性保証安全制御2024/3/1
深層学習で学習したダイナミクスモデルのアンサンブル不確かさを利用し、最大ロバスト制御不変集合を計算することで、未知のダイナミクスを持つシステムの安全性を保証する手法を提案した。
- DOZE: 動的環境におけるオープン語彙ゼロショット物体ナビゲーションのためのデータセットナビゲーション2024/2/1
動く障害物や多様な物体、テキスト手がかりを含む高忠実度3Dシーンと18k以上のタスクからなるゼロショット物体ナビゲーション用データセットを提案し、既存手法の課題を明らかにした。
- On Safety and Liveness Filtering Using Hamilton-Jacobi Reachability Analysis2023/12/1
- ProAgent: From Robotic Process Automation to Agentic Process Automation2023/11/1
- Overview of Computer Vision Techniques in Robotized Wire Harness Assembly: Current State and Future Opportunities2023/9/1
- Deep Learning-Based Connector Detection for Robotized Assembly of Automotive Wire Harnesses2023/9/1
- A Systematic Literature Review of Computer Vision Applications in Robotized Wire Harness Assembly2023/9/1
- Energy Efficient Foot-Shape Design for Bipedal Walkers on Granular Terrain2023/9/1
- A Taxonomy of Semantic Information in Robot-Assisted Disaster Response2022/10/1
- 3D Path Planning and Obstacle Avoidance Algorithms for Obstacle-Overcoming Robots2022/9/1
- Exploiting Transformer in Sparse Reward Reinforcement Learning for Interpretable Temporal Logic Motion Planning2022/9/1
- Temporal Logic Guided Motion Primitives for Complex Manipulation Tasks with User Preferences2022/2/1
- Gaussian Process Constraint Learning for Scalable Chance-Constrained Motion Planning from Demonstrations2021/12/1
- A self-supervised learning-based 6-DOF grasp planning method for manipulator2021/2/1
- Robust and Precise Vehicle Localization based on Multi-sensor Fusion in Diverse City Scenes2017/11/1