Hao Wu
HKUST (GZ)
収録論文 28本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FutureWorlds: 代替未来からロボット世界モデルを学習する世界モデル2026/10/1
マルチモーダル離散自己回帰モデルと多様性ビーム探索、候補ごとの記憶保持、MemSPO最適化を組み合わせ、ロボットの行動条件付き未来予測を高精度化する枠組みを提案。
- Zeva-Ego: 一人称視点動画の中間学習と文脈内因果学習によるロボットマニピュレーションVLA2026/9/21
一人称視点の人間動画から行動中心の監督信号を作りVLAモデルを中間学習させ、さらに展開時に行動と結果のフィードバックからパラメータ更新なしで適応する枠組みを提案。
- PhysBrain 1.5:視覚言語モデルから物理基盤モデルへVLA2026/9/14
人間のインタラクション動画から身体動作を学習し、行動生成と未来状態予測を統合した8Bの物理基盤モデルを構築、28の身体理解ベンチマークでオープンソース最高性能を達成した。
- Zeva: 文脈内因果学習による汎用身体操作の実現マニピュレーション2026/8/31
ロボットが実環境での物理的相互作用からその場で学習し、その知識を次の行動に活かすフレームワークZevaを提案。ポリシーモデルを凍結したまま、因果相互作用抽出器と二重タイムスケールの因果メモリを用いて、実行した行動と状態変化を符号化し、後の行動の文脈として注入する。シミュレーションと実機操作で最先端のVLAやWAMを上回る性能を示し、勾配更新なしで自己進化を実現。
- SpectraTac: 分散色センシングによるコンパクトなカメラ不要の光学触覚センサ触覚2026/8/31
カメラを使わず、RGB照明と分散配置した色センサで触覚情報を取得する小型・低コストの光学触覚センサを提案し、3次元力推定と接触領域分類を実現した。
- LARC: ロボットマニピュレータ軌道の遅延適応到達可能性認証軌道検証2026/8/30
軌道の連続時間安全性を効率的に検証するため、区間を適応的に分割して認証する手法を提案。固定細分割と同等の判定精度を維持しつつ、計算量を大幅に削減した。
- 緩和を考慮したソフトグリッパのマルチモーダルセンシング:構造・知覚・学習の統合ソフトロボティクス/把持制御2026/8/27
ソフトグリッパの粘弾性による把持力低下を、温度と変形のリアルタイム計測と物理情報学習モデルで補償し、長時間の安定把持を実現した。
- 能動表面駆動型再構成グリッパー:薄物の堅牢な把持と逐次操作グリッパー/把持2026/8/27
薄い物体(本など)を安定して把持・操作するために、能動表面と劣駆動コンプライアンスを統合した新しいグリッパーを提案し、複雑な制御なしで堅牢な把持を実現した。
- Zetta ζ: 自己進化する物理知能のための効率的な閉ループ具現化ハーネス具現化エージェント/自己進化2026/8/17
ロボットの実行中にコードベースの批評家と回復スキルをオンラインで進化させる閉ループハーネスを提案し、LIBERO-ProとRoboCasaで高い成功率と高速化を達成した。
- Embodied.cpp: 異種ロボット向け具現化AIモデルのポータブル推論ランタイムVLA/推論ランタイム2026/7/1
VLAモデルや世界行動モデルなどの具現化AIモデルを、異なるロボットやエッジデバイス上で効率的に実行するためのC++推論ランタイムを提案。モジュール化された5層構造により、多レート実行や低遅延推論を実現し、Pythonベースラインと比較して1.05〜2.70倍の高速化とVRAM削減を達成した。
- DexLink Hand: 人間らしい器用さを備えたコンパクトで低コストな16自由度リンク駆動ハンドハンド/機構設計2026/6/1
高自由度でありながら人間の手のサイズに収まる、低コストで器用なリンク駆動のロボットハンドを開発した。
- SyLink Hand:人間の巧緻性を目指したシナジー着想リンク駆動の擬人化ハンドハンド/機構設計2026/6/1
人間の手のシナジー(協調運動)に着想を得て、リンク機構で駆動する擬人化ハンドを設計・試作し、外観・運動学・機能の擬人性と機械的簡素さを両立した。
- ActProbe: 生成ロボットポリシーの早期故障検出のためのアクション空間プローブ故障検出2026/6/1
生成ロボットポリシーの出力するアクション列自体に故障予兆が含まれることを利用し、軽量なアクション空間のみの検出器ActProbeを提案。故障を視覚的に認識される前に検出し、F1-即時性のトレードオフを改善する。
- RoboAlign-R1: ロボットビデオ世界モデルのための蒸留型マルチモーダル報酬アライメントビデオ世界モデル2026/5/1
ロボットビデオ世界モデルの訓練を、再構成損失などの低レベル目的ではなく、指示追従や操作成功などの意思決定に重要な能力に合わせるため、報酬アライメントと長期推論安定化を組み合わせたフレームワークを提案した。
- MemCompiler: コンパイルする、注入しない -- 身体化エージェントのための状態条件付きメモリ身体化エージェント/メモリ管理2026/5/1
エージェントの現在の状態に応じて関連メモリのみを動的に選択・コンパイルするメモリシステムを提案し、静的メモリ注入を上回る性能と低遅延を実現した。
- STARRY: ロボット操作のための時空間アクション中心世界モデルVLA/操作2026/4/1
将来の時空間予測とアクション生成を統一拡散プロセスで統合し、幾何学的注意変調により3次元制御を強化する世界モデル拡張型VLAポリシーを提案。
- 迷走を止める:メタ認知推論による効率的な視覚言語ナビゲーションナビゲーション2026/4/1
基礎モデルを用いた訓練不要の視覚言語ナビゲーションエージェントに、空間記憶・履歴認識計画・反射的修正を統合したメタ認知機構を導入し、探索の停滞や冗長な再訪問を減らして効率と性能を向上させた。
- HortiMulti: 園芸用ポリトンネルにおける位置特定とマッピングのためのマルチセンサーデータセットデータセット/SLAM2026/3/1
商業用イチゴ・ラズベリーポリトンネルで収集した、季節をまたぐマルチモーダルデータセットを提供し、既存のSLAM手法の性能評価と課題を明らかにした。
- 計画としての時空間予測:生成的世界モデルを用いたモデルベース強化学習アプローチモデルベース強化学習2025/10/5
時空間予測をモデルベース強化学習の問題として捉え、生成的世界モデルとビーム探索による計画で非微分な評価指標を報酬として活用し、極端事象の捕捉精度を高める手法を提案した。
- AdaNav: 不確実性に基づく適応的推論による視覚言語ナビゲーションVLA2025/9/1
視覚言語ナビゲーションにおいて、不確実性に応じて推論を動的に発動する軽量プラグインを提案し、少ない学習データで大幅な性能向上を実現した。
- LLMを活用した人間らしい交通シミュレーションによる自動運転テスト自動運転シミュレーション2025/8/1
認知理論とLLMを組み合わせ、多様な運転スタイルを持つ人間ドライバーを再現する交通生成フレームワークHDSimを提案し、自動運転システムの安全性評価を改善した。
- HandCept: 巧みな手のための正確な固有受容感覚を実現する視覚・慣性融合フレームワーク固有受容感覚2025/5/1
手首搭載のRGB-Dカメラと9軸IMUを拡張カルマンフィルタでリアルタイム融合し、巧みな手の関節角度を2〜4度の誤差でドリフトなく推定する視覚・慣性固有受容感覚フレームワークを提案。
- InSpire: 内在的空間推論を備えた視覚-言語-行動モデルVLA2025/5/1
VLAモデルに「物体はロボットから見てどの方向か」という空間推論を組み込むことで、タスク無関係な視覚特徴への誤相関を抑え、汎化性能を高める手法を提案。
- 生物に着想を得た砂上転がりロボット:機体形状が転がり性能に与える影響歩行・移動ロボット2025/3/1
サンショウウオの砂丘転がりに着想を得て、砂上を転がるロボットを開発し、六角形・四角形・三角形の機体形状が移動性能に与える影響を実験とモデルで解析した。
- GelSight FlexiRay: 大変形を活用した柔軟・全面マルチモーダル触覚センシング触覚2024/11/1
Fin Ray効果グリッパに統合し、多鏡構成で大変形時でも光学経路を確保することで、柔軟構造でも接触力・位置・固有感覚・温度・テクスチャ・滑りを検知できる視覚触覚センサを実現した。
- LiDARとカメラの連携による一貫性のある物体検出センサーフュージョン2024/5/1
点群と画像の両方で物体位置を同時に検出し、それらの対応関係を単一の順伝播で推定するエンドツーエンド手法を提案し、新指標Consistency Precisionで評価した。
- A novel robot calibration method with plane constraint based on dial indicator2022/8/1
- Spatial-temporal Transformers for EEG Emotion Recognition2021/10/1