Hao Tang
収録論文 26本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DexPolicy: 軌道誘導型巧みな操作のためのスケジュール探索マニピュレーション2026/9/30
強化学習による巧みな操作において、探索ノイズを訓練ステップに応じて徐々に減衰させるスケジュールを導入し、PPO・GRPO・FPOの3手法で成功率を大幅に向上させた。
- DeltaWAM: 双腕マニピュレーションのためのデルタ世界行動モデルマニピュレーション2026/9/23
映像の変化分(デルタ)と行動を同時に予測する世界行動モデルを提案し、双腕ロボット操作の成功率と推論速度を向上させた。
- ReMoMask-2: 潜在検索拡張マスク動作生成動作生成2026/9/8
テキストから人間の動作を生成するタスクにおいて、検索拡張と階層的空間時間トポロジーを考慮した新しいフレームワークを提案し、生成品質と速度を向上させた。
- MobileVLA-R1 2.0: モバイルロボット制御のための強化学習強化推論VLA2026/9/5
モバイルロボットのVLAシステムにおいて、言語指示を実行可能な行動に変換する課題に対し、構造化された推論と強化学習を組み合わせたフレームワークを提案し、ナビゲーションや操作タスクで評価した。
- DailyBench:現代の生成モデルによるAI生成・改変画像のための統合ベンチマーク画像検出2026/7/27
最新の生成モデルに対応した、AI生成画像と物体レベルの改変画像を評価する統合ベンチマークDailyBenchを提案し、既存の検出器の汎化性能が大幅に低下することを示した。
- GeneralVLA-2: 幾何認識再構成と管理されたメモリによるロボット計画VLA2026/6/16
ロボットの軌道計画のための視覚言語行動モデルを改善し、3D再構成の精度向上と長期メモリの品質管理を実現した。
- DragMesh-2: 関節物体との物理的に妥当な器用な手と物体のインタラクションマニピュレーション2026/6/13
関節物体を器用な手で操作するための接触駆動フレームワークを提案し、物理信号を注入する学習機構により接触負荷の変化に対するロバスト性を向上させた。
- LaST-HD: スケーラブルな人間データからロボット操作の物理的推論を学習する操作学習2026/6/1
人間の手のデモンストレーションとロボットのデモンストレーションを共有の潜在推論空間で整列させ、物理ダイナミクスを内部化することで、ロボット操作の学習を改善する新しい手法を提案した論文。
- MotionVLA: ヒューマノイド動作のための視覚・言語・行動モデル動作生成2026/6/1
シーン画像とテキストから現実的なヒューマノイド動作を生成するため、動作を基本ストリームと物理ストリームに分離し、DCTとBPEで独立に圧縮する二重ストリーム周波数トークナイザを提案し、軽量な2Bバックボーンで多様性と一貫性を向上させた。
- ロボットはいつ考えるべきか?強化学習による資源認識型推論で身体性ロボットの意思決定を実現VLA2026/3/1
身体性ロボットがLLM推論をいつ・どの役割で・どれだけ使うかを強化学習で適応的に決める階層的枠組みRARRLを提案し、タスク成功率向上と遅延削減を実現した。
- MWM: 行動条件付き一貫予測のためのモバイルワールドモデルナビゲーション2026/3/1
ナビゲーションのためのワールドモデルにおいて、行動条件付きの一貫性を向上させる2段階学習と蒸留手法を提案し、画像目標ナビゲーションの性能を改善した。
- GeneralVLA:知識誘導型軌道計画による汎化可能な視覚-言語-行動モデルVLA2026/2/1
基盤モデルの汎化能力を活かし、アフォーダンス認識・3D軌道計画・制御を階層化したVLAモデルを提案。実機データや人間の実演なしでゼロショットのマニピュレーションを実現する。
- 一般化球面ニューラル演算子:グリーン関数定式化球面ニューラル演算子2025/12/11
球面グリーン関数に基づくニューラル演算子の設計枠組みを提案し、等変性と不変性を柔軟に調整できるGSNOと階層的アーキテクチャSHNetを開発した。
- TwinAligner: 視覚・動的アライメントによる物理認識Real2Sim2Realでロボットマニピュレーションを実現sim2real2025/12/1
シミュレーションと実世界の視覚・動的ギャップをSDF再構成と3DGSレンダリング、剛体物理同定で埋め、シミュレーションで訓練した方策を実世界へゼロショット転移させるReal2Sim2Realシステムを提案。
- Percept-WAM: 知覚強化型世界認識行動モデルによる堅牢なエンドツーエンド自動運転自動運転VLA2025/11/1
2D/3D知覚を単一の視覚言語モデルに統合し、World-PV/World-BEVトークンとグリッド条件付き予測で長尾・遠距離・小物体に強い自動運転モデルを提案。
- MobileVLA-R1: 四足歩行ロボットのための視覚-言語-行動モデルを強化学習で強化VLA2025/11/1
自然言語指示を四足歩行ロボットの連続制御に接地させるため、多粒度Chain-of-Thoughtデータセットと教師あり学習+GRPO強化学習の二段階学習を組み合わせた統合VLAフレームワークを提案し、実機で有効性を示した。
- StereoAdapter: ステレオ深度推定の水中シーンへの適応ステレオ深度推定/水中ロボティクス2025/9/1
LoRAで適応した単眼基盤エンコーダと再帰的ステレオ精緻化を組み合わせ、水中でも高精度なステレオ深度推定を自己教師ありで実現した。
- ロバストなロボット汎化のための忠実度を考慮したデータ構成sim2real2025/9/1
生成データ拡張におけるデータ構成を最適化問題として扱うCIFTを提案し、実データと合成データの混合比を情報忠実度に基づいて調整することで、ロボット政策の分布外汎化性能を大幅に向上させた。
- Nav-R1: 具現化シーンにおける推論とナビゲーションナビゲーション2025/9/1
段階的CoTデータセットと強化学習、Fast-in-Slow推論で、複雑な3D環境でのロバストな具現化ナビゲーションを実現した基盤モデル。
- 身体性AIのためのマルチモーダルデータ保存と検索:サーベイ身体性AIデータ管理2025/8/1
身体性AIが生成する異種マルチモーダルデータに対し、5つの保存アーキテクチャと5つの検索パラダイムを比較評価し、物理的接地や低遅延性などの要件への適合性と課題を整理したサーベイ。
- 目標指向ナビゲーションのためのマルチモーダル知覚:サーベイナビゲーション2025/4/1
視覚・言語・音響情報を用いた目標指向ナビゲーションの研究を、推論領域という統一的な視点から整理し、約200件の文献をレビューしたサーベイ。
- Fast3R: 1000枚以上の画像を1回の順伝播で3次元再構成3次元再構成2025/1/1
多数の視点画像をTransformerで並列処理し、反復的な位置合わせなしに高精度な多視点3次元再構成を実現する手法を提案。
- VisualPredicator:ロボット計画のための神経記号的述語を用いた抽象世界モデルの学習ロボット計画2024/10/1
記号と神経の知識表現を組み合わせた一階述語言語を提案し、述語をオンラインで発明しながら抽象世界モデルを学習する手法を開発。五つのロボットシミュレーション領域で階層強化学習や視覚言語モデル計画より優れたサンプル効率と分布外汎化、解釈性を示した。
- OmniPose6D: 単眼RGB動的環境における短期物体姿勢追跡物体姿勢追跡2024/10/1
動的環境での単眼RGBによる短期物体姿勢追跡のため、大規模合成データセットOmniPose6Dとベンチマークを構築し、不確実性を考慮したキーポイント改良ネットワークを提案した。
- 部分観測下での汎用ナビゲーションを実現する価値誘導拡散ポリシーナビゲーション2024/4/1
部分観測環境での経路計画において、価値関数で誘導される拡散ポリシーを提案し、専門家データに頼らず探索と目標追求を両立させ、2Dから3Dへのゼロショット転移も実現した。
- Accurate indoor mapping using an autonomous unmanned aerial vehicle (UAV)2018/8/1