Hanqing Wang
HKUST(GZ)
収録論文 31本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- UniAfford: トークンルーティング型マルチタスク学習による汎用可能な2D-3Dアフォーダンス知覚アフォーダンス知覚2026/9/29
MLLMを共通の意味ハブとし、タスク別トークンルーターで画像・点群のアフォーダンスクエリを生成することで、2D・3D・統合アフォーダンス知覚を単一枠組みで扱う手法を提案。
- A4A: 人間のデモからの行動指向4Dアフォーダンスのクロスエンボディ転移操作学習/クロスエンボディ転移2026/9/5
人間のデモから行動指向の4Dアフォーダンス(相互作用点の将来軌跡)を学習し、ロボットポリシーの事前学習に利用することで、多様なVLAポリシーの操作性能を向上させる手法を提案した。
- GAUGE: 物理的忠実性を測定するための実世界基盤ベンチマーク物理シミュレーション/ベンチマーク2026/8/1
シミュレーションエンジンと生成ビデオワールドモデルの物理的忠実性を、実世界の軌跡に基づいて診断するベンチマークを提案した。22のタスクファミリーで剛体・柔軟物・布・変形物体の物理過程を評価し、既存の物理エンジンやビデオモデルの不一致を明らかにした。
- 探索・対話・展開可能:オープンワールド移動操作のための視覚駆動型具現化エージェント移動操作2026/7/1
実世界展開可能な移動操作エージェントのためのフレームワークREALを提案し、シミュレーションと実機のギャップを埋める環境とベンチマークを構築、物理ロボットで高い成功率を達成した。
- RoboSnap: ワンショット実世界からシミュレーションへのシーン生成による汎用ロボット学習と評価sim2real2026/7/1
単一のRGB画像から物理的に安定し視覚的にも忠実なシミュレーション環境を自動生成するフレームワークを提案し、ロボットの軌道再現やポリシー学習・評価に活用できることを示した。
- InternVLA-A1.5: 理解・潜在予測・行動の統合による構成的汎化VLA2026/7/1
ロボット操作のための統一モデルで、事前学習済みVLMの意味理解とビデオ生成モデルの動的予測を活用し、将来予測を潜在コードのクエリ問題として再構成することで、実時間制御を維持しつつ構成的汎化を実現した。
- EBench: 汎用モバイル操作ポリシーの要素診断ベンチマーク/モバイル操作2026/6/1
単一の成功率スコアを超えて、汎用モバイル操作ポリシーの能力と汎化を多次元で診断するシミュレーションベンチマークを提案し、最新モデルの特性を明らかにした。
- アフォーダンスから行動へ:タスク条件付きシーン全体のアフォーダンス接地によるリアルタイム操作操作2026/6/1
タスク条件付き操作のための、シーン全体でタスク関連の機能部位を接地するベンチマーク中心の学習フレームワークを提案。単一領域と複数領域の指示対応をカバーするベンチマークと、エージェント支援のアノテーションパイプラインを構築し、リアルタイムのアフォーダンス接地と操作ポリシーへの応用を示した。
- Event-VLA: アクション条件付きイベント融合によるロバストな視覚言語行動モデルVLA2026/6/1
照明変化に弱い既存のVLAモデルに対し、イベントカメラのストリームをアクションクエリ経由で融合するEvent-VLAを提案し、低照度下での操作成功率を向上させた。
- 完璧なデモは悪い教師:重要な動作セグメントからのロバストな位置合わせ学習模倣学習2026/6/1
熟練者の滑らかなデモは、精密な位置合わせ動作の重要な瞬間が短時間に圧縮されるため、模倣学習の教師として不十分であることを示し、動作認識を強化する時空間特徴STAIRを提案して性能を向上させた。
- SIM1: 物理整合シミュレータによる変形物体世界でのゼロショットデータ拡張シミュレーション/変形物体操作2026/4/1
変形物体操作のための物理整合型シミュレータを提案し、少数の実デモから合成データを生成してポリシー学習を効率化する。実機で90%のゼロショット成功率を達成した。
- Tac2Real: オンライン強化学習とゼロショット実機展開のための信頼性の高いGPU視触覚シミュレーション触覚シミュレーション2026/3/1
接触を伴う操作タスク向けに、物理精度と計算効率を両立した軽量な視触覚シミュレーションフレームワークTac2Realを提案し、実機へのゼロショット転移を高成功率で実現した。
- FSAG: 拡散モデルによる人間から多指ハンドへの指先ごとのアフォーダンス接地の強化マニピュレーション2026/1/1
人間の動画から拡散モデルを用いて物体のアフォーダンスを抽出し、多指ハンドの把持生成に活用することで、ハードウェア固有のデータ収集なしに汎用性の高い把持を実現した。
- InternVLA-A1:ロボットマニピュレーションのための理解・生成・行動の統合VLA2026/1/1
シーン理解・視覚的予測・行動実行の3つの専門家をMixture-of-Transformersで統合したVLAモデルを提案し、実世界12タスクで既存手法を上回る性能を達成した。
- VLNVerse:多様・身体性・リアルなシミュレーションと評価を備えた視覚言語ナビゲーションのベンチマークVLN2025/12/1
視覚言語ナビゲーション(VLN)の既存ベンチマークの限界を克服するため、多様なタスクを統合し、物理エンジンによる身体性とリアルなシミュレーションを実現した大規模ベンチマークVLNVerseを提案し、既存手法の評価と統合マルチタスクモデルを提示した。
- A4-Agent: ゼロショットアフォーダンス推論のためのエージェントフレームワークアフォーダンス推論2025/12/1
訓練不要のエージェント型フレームワークで、生成モデル・視覚言語モデル・視覚基盤モデルを組み合わせ、言語指示に基づく物体のアフォーダンス領域をゼロショットで推論する。
- VL-LN Bench:能動的対話による長期的目標指向ナビゲーションに向けてナビゲーション2025/12/1
対話を通じて曖昧な指示を解決しながら特定物体を探索する新しいナビゲーションタスクIIGNと、そのための大規模ベンチマークVL-LN Benchを提案した。
- InternVLA-M1: 空間誘導型視覚-言語-行動フレームワークによる汎用ロボットポリシーVLA2025/10/1
空間グラウンディングを手がかりに「どこで行動するか」と「どう行動するか」を二段階で学習し、汎用ロボット制御を実現するVLAフレームワークを提案。
- InternScenes: 現実的なレイアウトを持つ大規模シミュレーション可能屋内シーンデータセットsim2real2025/9/1
実世界スキャン・手続き生成・デザイナー作成の3ソースを統合し、約4万シーン・196万物体を含む大規模でシミュレーション可能な屋内3Dシーンデータセットを構築した。
- Affordance-R1: マルチモーダル大規模言語モデルにおける汎化可能なアフォーダンス推論のための強化学習VLA2025/8/1
強化学習(GRPO)と認知Chain-of-Thoughtを統合し、ロボットが物体の操作可能領域を推論するアフォーダンス・グラウンディングをゼロショットで汎化可能にした初の統一フレームワーク。
- StreamVLN:スローファスト文脈モデリングによるストリーミング視覚言語ナビゲーションVLA2025/7/1
視覚と言語の入力からリアルタイムに行動を生成するVLN向けに、高速な対話文脈と低速更新の記憶文脈を組み合わせたストリーミングフレームワークを提案し、低遅延で最先端性能を達成した。
- InstructVLA: 理解から操作へと導く視覚-言語-行動インストラクションチューニングVLA2025/7/1
大規模視覚言語モデルの推論能力を保ちつつ、身体性推論を活用して操作性能を高める新しいVLAモデルと学習法を提案し、汎化ベンチマークで大幅な改善を示した。
- 視覚言語ナビゲーションにおける身体性ギャップの再考:物理的・視覚的格差の包括的研究VLA2025/7/1
人型・四足・車輪ロボットに対応した物理的に現実的なVLN評価プラットフォームVLN-PEを提案し、既存のVLN手法が実機環境で性能劣化する要因を体系的に分析した。
- CronusVLA: マルチフレーム視覚-言語-行動モデリングによる効率的で堅牢なマニピュレーションVLA2025/6/1
単一フレームのVLAモデルをマルチフレームに拡張し、特徴チャンキングで履歴情報を集約することで、計算負荷を抑えつつ操作性能と観測の堅牢性を向上させた。
- GenManip: LLM駆動シミュレーションによる汎化可能な指示追従マニピュレーションマニピュレーション2025/6/1
LLM駆動のシーングラフで多様なタスクを自動生成する卓上シミュレーション環境GenManipと、200シナリオのベンチマークGenManip-Benchを提案し、モジュール型とエンドツーエンド方策の汎化性能を比較評価した。
- LabUtopia:科学実験エージェントのための高忠実度シミュレーションと階層的ベンチマークsim2real2025/5/1
実験室での科学作業を自動化する身体性エージェントの研究を進めるため、物理・化学反応を扱える高忠実度シミュレータ、多様な実験シーンの自動生成器、5段階の難易度を持つ階層的ベンチマークを統合したスイートを提案。
- NavDP:特権情報ガイダンスを用いたSim-to-Realナビゲーション拡散ポリシーの学習ナビゲーション2025/5/1
シミュレーションのみで学習し、RGB-D観測から軌道生成と評価を統合的に行う拡散ポリシーにより、多様な環境とロボット形態へのゼロショットsim-to-real転移を実現した。
- TeleOpBench:双腕巧みなテレオペレーションのためのシミュレータ中心ベンチマークテレオペレーション2025/5/1
双腕巧みなテレオペレーションの4つの方式(モーションキャプチャ、VR、外骨格、単眼視覚追跡)を30の高忠実度タスクで公平に比較評価するシミュレータベンチマークを提案し、実機実験との相関を確認した。
- GRUtopia:大規模都市で汎用ロボットを夢見るsim2real2024/7/1
10万の対話可能なシーンからなる都市規模のシミュレーション環境と、LLM駆動のNPCによる社会シミュレーション、脚式ロボット向けベンチマークを提供し、Embodied AIのSim2Real研究を加速するプロジェクト。
- Dense CLIPによるセマンティックマップの汎化で実現するオープンボキャブラリ物体ゴールナビゲーション物体ゴールナビゲーション2024/7/1
テキストのみの学習でセマンティックマップ予測ネットワークを訓練し、Dense CLIP特徴を活用して未知環境・未知物体へのオープンボキャブラリ物体ナビゲーションを効率よく実現するフレームワークOVExpを提案。
- ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments2023/4/1