Hao Zhao
RoboParty Lab
収録論文 37本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MSK-Bench:全身筋骨格運動制御のタスク・制御パラダイム・生理指標を横断するベンチマーク筋骨格制御2026/9/22
筋骨格ヒューマノイドの全身運動制御を22タスクで評価するベンチマークを提案し、5つの制御手法を統一プロトコルで比較した。
- PredActor: 予測的行動拡散による操縦可能なオンボードヒューマノイド制御ヒューマノイド制御2026/9/21
固有感覚のみを用いて行動と将来状態軌道を同時生成し、テスト時にも目標へ操縦できるヒューマノイド制御ポリシーを提案。
- GaussianWAM: 3Dガウス場から世界行動モデルへの幾何学と意味の蒸留VLA2026/8/25
多視点観測から3Dガウス場を介して幾何・意味情報を世界行動モデルに蒸留し、ロボット操作の視覚予測と行動生成を強化する手法を提案。
- ゲートはキャッシュではない:ゲートの由来が訓練不要のVLAトークンスキップの閉ループ信頼性を決めるVLA2026/8/1
VLAモデルのトークンスキップ高速化において、前ステップの加速された順伝播からゲートを取るとスキップが累積して性能が崩壊することを示し、ロボット実行中に密な順伝播を1回行う「アクチュエーションスラックリフレッシュ」を提案して性能を回復させた。
- DynaVieW: スキーマ誘導型ワールドモデリングによる階層的視覚ダイナミクスの理解VLA2026/7/5
マルチモーダルLLMが動画や複数画像の時間的変化を体系的にモデル化できない問題に対し、動的スキーマに基づくワールドモデルDynaVieWを提案。状態遷移系列を学習し、視覚ダイナミクスの予測とシミュレーションを実現する。
- INTACT: 検索不要の世界モデルのための同型意図-行動学習世界モデル2026/7/1
行動ラベル付き軌跡から、検索なしで意図を行動に変換するエンドツーエンドのJEPAモデルを提案し、LeWMタスクで高い成功率を達成した。
- 対話型アニマトロニクスロボットの顔機構の自動合成アニマトロニクス/顔機構設計2026/7/1
2Dポートレートから3D顔を再構築し、衝突のない製造可能な内部機構を自動設計するアルゴリズムを提案。さらに、会話中の発話・傾聴行動を統合する双方向対話型顔運動合成フレームワークも開発した。
- 1本の動画から1つの世界へ:単眼動画を物理的な4Dシーンに変換する4D再構成2026/6/30
単眼動画から、インスタンス単位で分離され、物理シミュレーションに利用可能な4Dメッシュシーンを、学習なしで再構成するシステムOVOWを提案する。
- 人間のビデオからロボット操作へ:人間中心データを用いたスケーラブルな視覚言語行動学習に関するサーベイVLA/サーベイ2026/6/1
ロボットのデモデータに頼らず、豊富な人間のビデオをVLAモデルの学習に活用する手法を4つのカテゴリに分類して整理し、未解決の課題と今後の研究方向を提示したサーベイ論文。
- LIBERO-Safety: 視覚言語行動モデルにおける物理的・意味的安全性の包括的ベンチマークVLA/安全性評価2026/6/1
VLAモデルの安全性を評価するため、パラメトリックな安全ベンチマークと大規模データセットを構築し、8つのVLAモデルと2つの基盤モデルの系統的評価を行った。
- Dexora: 高自由度両腕巧緻操作のためのオープンソースVLAVLA/操作2026/5/1
両腕・両手の高自由度操作を対象とした初のオープンソースVLAシステムDexoraを提案し、ハイブリッド遠隔操作とデータ品質を考慮した学習手法により、巧緻操作の成功率を大幅に向上させた。
- ASAP: 平面マイクロホンアレイの3次元音源方向推定のための方位角優先ストリップ探索法音源定位2026/4/1
平面マイクロホンアレイでの3次元音源方向推定を高速化するため、方位角を優先的に絞り込む2段階探索手法を提案した。
- UniUncer: エンドツーエンド運転のための統合動的・静的不確かさ自動運転2026/3/1
エンドツーエンド運転プランナーにおいて、静的マップ要素と動的エージェントの両方の不確かさを統合的に推定・活用する軽量フレームワークを提案。
- UniDex: 人間の一人称視点ビデオからの汎用器用ハンド制御のためのロボット基盤スイート器用操作2026/3/1
人間の一人称視点ビデオからロボット実行可能な軌道を生成し、統一された行動空間と3D VLAポリシーを用いて、複数の器用ハンドへの汎用制御を実現する基盤スイートを提案した。
- RISE: 構成可能な世界モデルによる自己改善ロボット方策VLA2026/2/1
ロボット操作のための構成可能な世界モデルを提案し、想像空間での強化学習により実世界での安全性・コスト問題を回避しつつ、動的タスクで大幅な性能向上を実現した。
- 俊敏性と安定性の融合:異種データによる汎用人型ロボット制御人型ロボット制御2025/11/1
人間のモーションキャプチャと物理的に生成したバランス動作という異種データを組み合わせ、単一のポリシーで俊敏な動きと極限のバランス維持を両立させる人型ロボット制御フレームワークAMSを提案。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- DiffVLA++:メトリック誘導アラインメントによる認知推論とエンドツーエンド運転の橋渡し自動運転VLA2025/10/1
VLAモデルの認知推論とE2Eモデルの物理的実現可能性を、メトリック誘導の軌道スコアラで統合した自動運転フレームワークを提案。
- HyPerNav: 未知環境における物体指向ナビゲーションのためのハイブリッド知覚ナビゲーション2025/10/1
VLMを活用し、自己中心的なRGB-D観測とトップダウンマップを統合して未知環境で目標物体へナビゲートする手法を提案し、シミュレーションと実機で最先端性能を達成した。
- トルク対応VLAモデルの設計空間の解明VLA2025/9/1
トルク信号をVLAモデルに統合する設計空間を体系的に検討し、デコーダへのトルクアダプタ導入と補助出力としてのトルク予測が有効であることを示した。
- RoboChemist: 長期的・安全基準準拠のロボット化学実験システムVLA2025/9/1
VLMとVLAを組み合わせた二重ループ構成で、危険物や変形物を扱う多段階の化学実験を、安全規範を守りながら実行するロボットシステムを提案した。
- FlowDrive: エンドツーエンド自動運転のためのエネルギーフローフィールド自動運転/プランニング2025/9/1
リスクポテンシャルと車線引力場という物理的に解釈可能なエネルギーフローフィールドをBEV空間に導入し、拡散プランナで軌道生成する自動運転フレームワーク。NAVSIM v2でEPDMS 86.3のSOTAを達成。
- Morpheus: ハイブリッド駆動と多様な感情制御を実現するニューラル駆動型アニマトロニクス顔アニマトロニクス/感情表現2025/7/1
剛体駆動と腱駆動を組み合わせたハイブリッド機構と、自己モデリングネットワークにより、音声から多様な感情表現を生成できるアニマトロニクス顔を開発した。
- DiffVLA: 視覚言語モデルが導く拡散プランニングによる自動運転自動運転/VLA2025/5/1
視覚言語モデルを活用したハイブリッドなスパース・デンス拡散ポリシーを提案し、効率的で多様な運転行動と軌道生成の改善を実現した自動運転手法。
- Afford-X: タスク指向操作のための汎化可能で軽量なアフォーダンス推論アフォーダンス推論2025/3/1
大規模データセットLVIS-Affを構築し、動詞注意と双方向融合モジュールを備えた軽量モデルAfford-Xを開発。非LLM手法を上回る性能を達成し、GPT-4Vより約50倍高速にアフォーダンス推論を行う。
- 大規模環境における能動的ニューラルマッピング能動的マッピング2024/9/1
NeRFベースの地図から一般化ボロノイグラフを抽出し、不確実性を考慮しながら大規模屋内環境を効率的に探索する能動的マッピングシステムを提案した。
- 影のないNeRFによるカメラ位置推定位置推定2024/5/1
照明や影の変化に影響されないよう画像を正規化する2段階パイプラインを提案し、ハッシュ符号化NeRF上でカメラ位置推定を高精度化した研究。
- 三段階ロバスト姿勢最適化による分散NeRFのブレンディングNeRF/3D再構成2024/5/1
分散NeRFの位置合わせ精度を三段階の姿勢最適化で高め、都市規模の環境を高品質に合成する手法を提案した。
- 大規模環境におけるブロックマップベースの自己位置推定自己位置推定2024/4/1
大規模環境での計算負荷を抑えるため、ブロックマップと動的スライディングウィンドウ最適化を組み合わせた自己位置推定システムを提案し、6km超のマップでも高精度・高効率を実現した。
- PreAfford: 多様な物体と環境に対応するユニバーサルなアフォーダンスベースの事前把持マニピュレーション2024/4/1
把持しにくい物体に対して、点レベルのアフォーダンス表現とリレー学習を用いた事前把持計画フレームワークを提案し、把持成功率を69%向上させた。
- 大規模言語モデルを活用した自動運転の文脈認識型運動予測運動予測2024/3/1
交通環境と履歴を画像・テキストプロンプトでLLMに与えて交通文脈を抽出し、運動予測モデルに統合して精度を向上。さらに0.7%のLLM拡張データで効率的に展開する手法を提案。
- FastMAC: 対応グラフの確率的スペクトルサンプリング点群位置合わせ2024/3/1
3D対応グラフにグラフ信号処理を導入し、高周波成分を保つ確率的スペクトルサンプリングでMACを高速化した3D点群位置合わせ手法を提案。
- ASSIST: Interactive Scene Nodes for Scalable and Realistic Indoor Simulation2023/11/1
- Self-Aligning Depth-regularized Radiance Fields for Asynchronous RGB-D Sequences2022/11/1
- LATITUDE: Robotic Global Localization with Truncated Dynamic Low-pass Filter in City-scale NeRF2022/9/1
- City-scale Incremental Neural Mapping with Three-layer Sampling and Panoptic Representation2022/9/1
- Lifelong Vehicle Trajectory Prediction Framework Based on Generative Replay2021/11/1