He Zhang
The Hong Kong University of Science and Technology (Guangzhou)
収録論文 23本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 視覚言語行動モデルは自己受容状態をどう使うべきかVLA2026/8/1
VLAモデルにおけるロボットの自己受容状態の入力方法(テキスト、プレフィックス、直接入力など)と履歴長が性能に与える影響を、制御実験で体系的に比較し、設計原則を導出した論文。
- Hy-Embodied-VLM-1.0:効率的な物理世界エージェントVLA2026/7/14
物理世界で動作する組み込みエージェント向けの基盤モデルを提案し、行動中心の能力分類に基づくデータパイプラインと効率的なMoEアーキテクチャにより、38ベンチマークで優れた性能を達成した。
- 介入可能なマルチモーダル模倣のためのソースリフトフローマッチング模倣学習2026/7/1
フローマッチングポリシーに介入可能なハンドルを導入し、ユーザーが同じ状態から複数の有効な行動を選択できるようにする手法を提案した。
- PHASER: 位相認識と意味的経験再生による視覚言語行動モデルの継続学習継続学習/VLA2026/6/2
視覚言語行動モデルの継続学習における破滅的忘却を防ぐため、操作軌道の位相(サブスキル)に注目した経験再生手法PHASERを提案。位相ごとのメモリ割り当てと忘却リスクに基づく動的優先付けで、LIBEROベンチマークで最大31%の成功率向上を達成した。
- Hy-Embodied-0.5-VLA:視覚言語行動モデルから実世界ロボット学習スタックへVLA2026/6/1
データ収集からモデル設計、事前学習、微調整、強化学習、実機展開までを含むロボット学習の全スタックを備えたエンドツーエンドシステムを提案した論文。
- PressMimic: 圧力誘導によるモーションキャプチャとヒューマノイドロボット模倣制御ヒューマノイド制御2026/6/1
ヒューマノイドの動作模倣において、圧力情報を認識と制御の両方に統合するフレームワークを提案し、RGBと圧力を融合したモーション推定と圧力監視型強化学習により、接触ダイナミクスを考慮した安定した模倣を実現した。
- ImageWAM: 世界行動モデルは本当にビデオ生成が必要か、それとも画像編集だけで十分か?VLA2026/6/1
ビデオ生成に依存する世界行動モデル(WAM)の課題を指摘し、代わりに画像編集モデルを利用したImageWAMを提案。推論時に画像編集のKVキャッシュを行動予測に活用し、計算コストを大幅削減しつつ性能を向上させた。
- FlowPRO: フローマッチングVLAの報酬なし強化学習による微調整 - 近接化選好最適化を用いてVLA/強化学習2026/6/1
フローマッチング型VLAモデルを実ロボットに展開可能なポリシーへと微調整する、報酬なしのオフライン強化学習フレームワークFlowPROを提案。選好最適化に近接正則化を導入し、介入・ロールバックデータから高品質なポリシーを学習する。
- 視覚言語行動モデルにおける視野外操作のための空間記憶VLA2026/5/1
視覚言語行動モデルに、可動カメラの多視点観測から構築した空間記憶を組み込み、視野外の物体操作を可能にするフレームワークSOMAを提案した。
- HY-Embodied-0.5: 実世界エージェントのための具現化基盤モデルVLA2026/4/8
実世界の具現化エージェント向けに設計された基盤モデル群を提案し、空間・時間的視覚知覚と推論能力を強化した。
- EgoLive: 実世界の人間タスクから得た大規模エゴセントリックデータセットデータセット2026/4/1
ロボット操作学習のための大規模で高品質なエゴセントリックデータセットEgoLiveを構築し、実世界の非制約環境での人間の作業データを収集・公開した。
- JoyAI-RA 0.1: ロボット自律性のための基盤モデルVLA2026/4/1
オープンワールドでのロボット操作の汎化を目指し、ウェブデータ、人間の操作動画、シミュレーション、実ロボットデータを統合したVLA基盤モデルJoyAI-RAを提案。実世界とシミュレーションで最先端性能を達成した。
- 運転者の知覚リスクと物理リスクの融合による自動運転向け安全臨界シナリオ選別自動運転/リスク評価2026/3/1
大規模な自然運転データから安全臨界シナリオを効率的に選別するため、運転者リスク場と動的コストモデルを融合したリスク予測手法を提案し、シナリオレベルのリスクスコアを直接予測することでフレーム単位の計算を回避した。
- PoseVLA: 汎用ポーズ事前学習による汎化可能な視覚-言語-行動ポリシーVLA2026/2/1
VLAモデルの特徴崩壊と学習効率の低さを解決するため、カメラ中心の統一空間で3D空間事前知識を抽出する事前学習と、ロボット固有の行動空間への適応を行う事後学習に分離したPose-VLAを提案。離散ポーズトークンにより多様な3Dデータと軌道データを統合し、RoboTwin 2.0で79.5%、LIBEROで96.0%の成功率を達成。
- 脳に着想を得た身体性知能による流動的で高速な反射的ロボティクス制御VLA2026/1/1
皮質・小脳・脊髄の構造を模したニューロモーフィックVLAを実機ロボットに初めて実装し、腕の振動抑制や20ms未満の安全反射、時間記憶を実現した。
- DexterCap:巧みな手と物体の操作を捉える低コスト自動キャプチャシステムマニピュレーション2026/1/1
手指の自己遮蔽に強いコード化マーカーと自動再構成パイプラインにより、低コストで巧みな手内操作を光学キャプチャするシステムを提案し、多様な操作行動を含むデータセットDexterHandを公開した。
- ロボットマニピュレーションのための人間参加型オンライン棄却サンプリングマニピュレーション2025/10/1
オンライン棄却サンプリングと人間による修正を組み合わせ、VLAモデルを安定かつ高精度に微調整する手法Hi-ORSを提案し、実機で接触の多い操作を短時間で習得させた。
- CHOICE: 雑然とした環境における人間と物体の協調的なピックアンドプレース動作マニピュレーション2024/12/1
雑然とした環境で物体を掴んで運ぶ動作を生成するため、両手のスケジューラ、神経暗黙プランナー、カルマンフィルタ付きDeepPhaseコントローラを組み合わせた階層型システムを開発した。
- Flow to Rare Events: 自動運転車検証のための時間的重要度サンプリングにおける正規化フローの応用自動運転検証2024/7/1
正規化フローを用いて危険な稀な事象の分布を生成・再重み付けし、時間的重要度サンプリングと組み合わせることで、自動運転車の衝突率評価を効率化する手法を提案した。
- Learning Highly Dynamic Behaviors for Quadrupedal Robots2024/2/1
- Neural Categorical Priors for Physics-Based Character Control2023/8/14
- Lifelike Agility and Play in Quadrupedal Robots using Reinforcement Learning and Generative Pre-trained Models2023/8/1
- A Driving Behavior Recognition Model with Bi-LSTM and Multi-Scale CNN2021/3/1