Hang Zhao
Tsinghua University
収録論文 78本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- フローマッチングにおける条件付きアニーリングによる因果的行動トークン化の再考VLA2026/9/28
フローマッチングを段階的にアニーリングして因果構造を持つ行動トークンを抽出するCATokを提案し、VLAモデルの再構成精度・推論効率・タスク成功率を向上させた。
- WB-WAM:ヒューマノイド移動操作のための異種全身・手事前学習VLA2026/9/28
身体・ルート・巧みな手の動作を統合した行動空間で動画と行動を事前学習し、人間の動作データを活用してヒューマノイドの移動操作をデータ効率的に学習する手法を提案。
- World SLAM Model:SLAMとナビゲーションのための統合世界モデリングVLA2026/9/26
SLAMの逐次状態更新とバックエンド補正の仕組みをナビゲーションに直接組み込み、将来の視覚状態予測とカメラ運動・密な幾何推定を統合した世界モデルを提案。
- TactileStep: 足裏触覚学習によるヒューマノイド歩行の接地制御歩行2026/9/24
足裏の圧力センサを歩行制御に統合し、接地フェーズに応じた報酬で着地衝撃と騒音を抑えつつ支持安定性を高める学習フレームワークを提案。
- 表現世界モデル:表現空間における状態・遷移・実行可能計画の学習モデルベース強化学習2026/9/24
潜在表現空間内で直接的に状態・遷移・計画を学習し、再帰的ロールアウトや行動空間探索なしに計画を実行する手法を提案。連続制御とロボットマニピュレーションで有効性を示す。
- 足音のこだま:ゲート付き記憶を用いた知覚型ヒューマノイドパルクール歩行2026/9/24
オンボード深度のみを使い、ゲート付き記憶と顕著性誘導の時間知覚で足場の少ない不連続地形を安定して走破するヒューマノイドパルクール手法を提案。
- MSK-Bench:全身筋骨格運動制御のタスク・制御パラダイム・生理指標を横断するベンチマーク筋骨格制御2026/9/22
筋骨格ヒューマノイドの全身運動制御を22タスクで評価するベンチマークを提案し、5つの制御手法を統一プロトコルで比較した。
- ロボット応用のためのタスク指向型ギヤ付きアクチュエータの協調設計と最適化アクチュエータ設計2026/9/19
脚ロボットのタスクに合わせて、モータ・ギヤ・センサを含むアクチュエータのハードウェアと制御を同時最適化する枠組みを提案し、2自由度跳躍脚で有効性を実証した。
- SkelWAM: 骨格ガイド型ワールドアクションモデルによるゼロショット異形態間マニピュレーション異形態間転移2026/9/18
腕中心線・TCP姿勢・把持コマンドを共有25次元状態として用い、映像と行動のTransformerで骨格行動を予測し、形態別デコーダで異なるロボットの制御に変換するゼロショット転移手法を提案。
- OpenWAM: 体系的な世界行動モデル事前学習に向けたオープンでモジュール型の探求VLA2026/9/7
世界行動モデルの設計空間をモジュール化し、制御実験を通じて設計原則を抽出・検証するオープンな研究基盤を構築した。
- 無限SLAMトランスフォーマー:無制限のフロントエンド・バックエンド処理のためのSLAMFormer-∞SLAM2026/8/1
距離制限なしで長距離のフロントエンドとバックエンド処理をサポートする初の幾何学トランスフォーマーを提案し、17kmを超える軌跡でも動作可能なことを示した。
- G0.5: ロボットの推論と行動のための単一自己回帰ストリームVLA2026/8/1
単一のトランスフォーマーデコーダが推論トークンと行動トークンを同一の目的で生成する、事前学習済み自己回帰VLAモデルG0.5を提案。異なるロボットの行動を共有語彙に変換するトークナイザーや、チェーン・オブ・ソート、視覚メモリを導入し、複数のベンチマークでSOTAを達成。
- エージェント駆動による自動運転のロングテールシミュレーション自動運転/シミュレーション2026/7/1
自動運転の閉ループ評価のため、大規模言語モデルで制御される周辺エージェントを導入し、多様な指示に従うインタラクティブなロングテールシナリオを生成するフレームワークを提案した。
- 対話型アニマトロニクスロボットの顔機構の自動合成アニマトロニクス/顔機構設計2026/7/1
2Dポートレートから3D顔を再構築し、衝突のない製造可能な内部機構を自動設計するアルゴリズムを提案。さらに、会話中の発話・傾聴行動を統合する双方向対話型顔運動合成フレームワークも開発した。
- Orca:世界は心の中にある世界モデル2026/6/29
Orcaは、マルチモーダルな世界信号から統一された世界潜在空間を学習し、テキスト生成・画像予測・身体動作生成などの下流タスクを軽量デコーダで実現する世界基盤モデルである。
- TopoRetarget: 巧みな操作のための相互作用を保持するリターゲティングマニピュレーション2026/6/1
人間の手と物体のデモンストレーションをロボットハンドに適応させる際、接触構造を保つリターゲティング手法を提案。接触精度とポリシー学習成功率を向上させ、実機へのゼロショット転送も実現。
- PAIWorld: ロボット操作のための3D整合性を持つ世界基盤モデル世界モデル2026/6/1
複数視点の3D整合性を保つ世界基盤モデルを提案し、ロボット操作のための予測と計画を改善した。
- 粗から精密へ:視覚言語行動モデルのためのアクショントークン計画VLA2026/6/1
VLAモデルに、将来の軌道を要約する粗いアクショントークンの計画を導入し、その計画に基づいて実行用のアクショントークンを生成する方式を提案。長期的なタスクでの性能が向上した。
- OMG: 汎用人型ロボット制御のための全モーダル動作生成全身制御/動作生成2026/6/1
多様な入力モダリティ(言語、音声、人間の参照動作)に基づいて全身動作を生成する拡散モデルを提案し、データキュレーションと階層的制御構造により汎用的な人型ロボット制御を実現した。
- ロングテール状況での軌道変位は安全か?自動運転評価2026/6/1
自動運転のプランナー評価を、専門家軌道と比較した際の追加脅威検出として定式化し、人間のアノテーションと検証システムを組み合わせたFluidTestパイプラインを提案した。
- Dexora: 高自由度両腕巧緻操作のためのオープンソースVLAVLA/操作2026/5/1
両腕・両手の高自由度操作を対象とした初のオープンソースVLAシステムDexoraを提案し、ハイブリッド遠隔操作とデータ品質を考慮した学習手法により、巧緻操作の成功率を大幅に向上させた。
- VolumeDP: 操作ポリシー学習のためのボリューム表現モデリング模倣学習/操作2026/3/1
2D画像から直接3D動作を予測する既存手法の2D-3Dミスマッチを解消するため、画像特徴を3Dボリューム表現に変換し、タスク関連ボクセルを選択して動作予測を行う新しいポリシーアーキテクチャを提案した。
- UniDex: 人間の一人称視点ビデオからの汎用器用ハンド制御のためのロボット基盤スイート器用操作2026/3/1
人間の一人称視点ビデオからロボット実行可能な軌道を生成し、統一された行動空間と3D VLAポリシーを用いて、複数の器用ハンドへの汎用制御を実現する基盤スイートを提案した。
- 最適化としての生成的制御:適応的で堅牢なロボット制御のための時間無条件フローマッチングVLA2026/3/1
行動生成を軌道積分ではなく反復最適化として扱う時間無条件フレームワークGeCOを提案し、状態の難易度に応じて計算量を適応させ、OOD検出も可能にした。
- TTT-Parkour: 知覚型ロボットパルクールのための高速テスト時訓練歩行2026/2/1
RGB-Dで実地形を高精度に再構成し、その上で方策を高速微調整するreal-to-sim-to-real手法により、人型ロボットが未知の複雑地形を10分以内で走破できるようにした。
- ActionCodec:優れたアクショントークナイザの設計原則VLA2026/2/1
VLA最適化の観点から情報理論に基づく設計原則を導き、それに従う高性能アクショントークナイザActionCodecを提案。LIBEROでロボティクス事前学習なしにSOTAを達成。
- フレキシブル製造のための身体性知能:サーベイ身体性知能/製造2026/2/1
フレキシブル製造における身体性知能の研究を、知覚(Industrial Eye)、制御(Industrial Hand)、意思決定(Industrial Brain)の3視点から整理し、認知強化・技能移行・システム進化からなる3段階の発展モデルを提案したサーベイ。
- 知覚を統合した全身パルクール制御全身制御2026/1/1
外界センシングを全身運動追跡に統合し、不整地でも跳び越えやダイブロールなどの動的な多接触動作を人型ロボットで実現する枠組みを提案した。
- 荒野をハイキング:ヒューマノイドのためのスケーラブルな知覚型パルクールフレームワーク歩行2026/1/1
生の深度画像と固有感覚から直接関節動作を生成する単段階強化学習により、ヒューマノイドが複雑な地形を最大2.5m/sで走破できる知覚型パルクールフレームワークを提案。
- RoboBPP: 物理シミュレーションによるロボットオンライン箱詰めのベンチマークマニピュレーション2025/12/1
物理シミュレータ上で実スケールのロボットアームと箱を扱うオンライン箱詰めベンチマークを構築し、実産業データセットと安定性・安全性の新指標を導入した。
- FASTer: ニューラル行動トークン化による効率的な自己回帰型視覚言語行動モデリングVLA2025/12/1
行動チャンクを単一チャネル画像として符号化する学習可能なトークナイザと、ブロック単位の自己回帰復号化を組み合わせ、推論速度とタスク性能を両立させたVLAフレームワークを提案。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- SAMP: 空間アンカーに基づく衝突を考慮したロボットマニピュレータの動作方策マニピュレーション2025/9/1
ロボットと環境の形状を共有空間グリッド上の符号付き距離場で同時に表現し、衝突を考慮した滑らかな軌道を生成するニューラル動作方策を提案した。
- 自律走行のための離散拡散による反射型視覚言語行動モデルVLA2025/9/1
離散拡散と言語モデルを活用し、安全な軌道生成のための反射機構を備えた自律走行向けVLAフレームワークを提案。
- SLAM-Former:SLAMを単一のTransformerに統合SLAM2025/9/1
単眼画像からのSLAMを単一のTransformerで実現し、フロントエンドとバックエンドを交互に動かして高精度な密なSLAMを達成した研究。
- OccVLA: 暗黙的3D占有監督を備えた視覚-言語-行動モデルVLA2025/9/1
2D画像から3D占有を予測・監督信号として学習し、推論時には計算負荷を増やさずに自動運転の軌道計画と3D視覚質問応答で最高性能を達成したVLAモデル。
- GalaxeaオープンワールドデータセットとG0デュアルシステムVLAモデルVLA2025/9/1
実環境で収集した大規模ロボット行動データセットを構築し、VLMによる計画とVLAによる実行を組み合わせた二重システムモデルG0を3段階学習で訓練した。
- Morpheus: ハイブリッド駆動と多様な感情制御を実現するニューラル駆動型アニマトロニクス顔アニマトロニクス/感情表現2025/7/1
剛体駆動と腱駆動を組み合わせたハイブリッド機構と、自己モデリングネットワークにより、音声から多様な感情表現を生成できるアニマトロニクス顔を開発した。
- 条件付けが鍵:拡散ポリシーの学習は思ったより速いVLA2025/5/1
条件拡散ポリシー学習で生じる「損失崩壊」を特定し、条件に依存したソース分布を用いるCocosを提案。少ない学習ステップとパラメータで大規模事前学習VLAに匹敵する性能を実現した。
- ピンプレッショングリッパの設計とオンライン把持調整を伴う巧みな把持の学習マニピュレーション2025/5/1
ピンプレッション玩具に着想を得た、各指に独立伸縮可能なピンアレイを持つ平行グリッパを開発し、強化学習とカリキュラム学習で把持中の再配向を含む巧みな把持スキルを学習させ、実機転移も実証した。
- PIN-WM: 非把持マニピュレーションのための物理情報に基づく世界モデル学習sim2real2025/4/1
微分可能物理シミュレーションとGaussian Splattingを組み合わせ、視覚観測から3D剛体ダイナミクスの世界モデルを少数の軌道で学習し、物理を考慮したランダム化でSim2Real転移を実現した。
- 梱包構成木に基づく3Dビンパッキングの計画手法マニピュレーション2025/4/1
オンライン3Dビンパッキング問題に対し、梱包構成木(PCT)という階層表現を導入し、深層強化学習と木探索を組み合わせて大規模・多様な制約下での計画を可能にした。
- MoE-Loco:複数タスク歩行のための専門家混合歩行2025/3/1
脚型ロボットの多様な地形・歩容に対応する単一ポリシーを、専門家混合(MoE)で勾配衝突を抑えつつ学習させる手法を提案し、実機でも検証した。
- 未知のペイロードに適応する四足歩行の物理情報ニューラルネットワーク予測制御歩行2025/3/1
オンラインでペイロードを同定し、その質量パラメータを物理情報ニューラルネットワークの損失に組み込むことで、未知の積載物があっても四足歩行の追従精度を35%向上させる制御フレームワークを提案した。
- RoboEngine: セマンティックロボットセグメンテーションと背景生成によるプラグアンドプレイなロボットデータ拡張データ拡張2025/3/1
ロボットのセグメンテーションと背景生成を組み合わせ、数行のコードで物理・タスクを考慮した視覚データ拡張を可能にするツールキットを提案。単一シーンのデモから6つの新規シーンへの汎化を実現し、性能を200%以上向上させた。
- 人間のフィードバック強化学習によるパーソナライズ運転スタイルの学習自動運転2025/3/1
生成的な軌道モデルを人間のフィードバックで微調整し、多様な運転スタイルに合わせた軌道生成を可能にするTrajHFを提案。
- 衝突を活かす:接触を問わない動作を実現するヒューマノイドの影従制御ヒューマノイド全身制御2025/2/1
全身の接触を許容するヒューマノイド動作フレームワークを提案し、GPU加速シミュレータでの強化学習により、離散的な動作コマンドに従って実世界でリアルタイムに全身制御を実現した。
- VR-Robo:実環境からシミュレーションを経て実環境へ戻す、視覚的ロボットナビゲーションと歩行のためのフレームワークsim2real2025/2/1
多視点画像から3Dガウススプラッティングでフォトリアルなデジタルツイン環境を構築し、強化学習で視覚的目標追跡を学習させることで、RGBのみのsim-to-real転移を実現した。
- Mixture of Expertsによる自動運転モーションプランナーの汎化自動運転/プランニング2024/10/1
ViTエンコーダとMixture-of-Experts因果Transformerを組み合わせたスケーラブルなモーションプランナーSTR2を提案し、NuPlanデータセットで従来手法より高い汎化性能とスケーラビリティを示した。
- 遊び好きな犬型ロボット:俊敏かつ精密な四足歩行の学習歩行2024/9/1
強化学習で知覚と制御を分離したシステムを構築し、四足ロボットが最大3m/sの飛来するボールを追跡したり、跳躍して空中の小さな物体を捕まえるなど、犬のような俊敏で精密な動作を実現した。
- 堅牢なロボット歩行: 小さな罠を越える俊敏な移動の学習歩行2024/9/1
固有感覚入力のみを用いた二段階学習フレームワークにより、四足ロボットが小さな障害物を安定して通過できるようにした研究。
- SARO: 視覚言語モデルによる3D地形を横断する空間認識ロボットシステム歩行2024/7/1
視覚言語モデルを高レベル推論に用い、タスク分解と閉ループ実行、強化学習による低レベル制御を組み合わせて、四足ロボットが3D地形を横断して目標地点に到達できるシステムを構築した。
- ヒューマノイドのパルクール学習歩行2024/6/1
運動の事前知識なしに、視覚に基づく全身制御でヒューマノイドがパルクール動作を学習するフレームワークを提案。
- Large Trajectory Models are Scalable Motion Predictors and Planners2023/10/1
- GPT-Driver: Learning to Drive with GPT2023/10/1
- LiDAR-based 4D Occupancy Completion and Forecasting2023/10/1
- Robot Parkour Learning2023/9/1
- Boosting Offline Reinforcement Learning for Autonomous Driving with Hierarchical Latent Skills2023/9/1
- A Universal Semantic-Geometric Representation for Robotic Manipulation2023/6/1
- Programmatically Grounded, Compositionally Generalizable Robotic Manipulation2023/4/1
- Learning Physically Realizable Skills for Online Packing of General 3D Shapes2022/12/1
- P4P: Conflict-Aware Motion Prediction for Planning in Autonomous Driving2022/11/1
- InterSim: Interactive Traffic Simulation via Explicit Relation Modeling2022/10/1
- ViP3D: End-to-end Visual Trajectory Prediction via 3D Agent Queries2022/8/1
- VectorFlow: Combining Images and Vectors for Traffic Occupancy and Flow Prediction2022/8/1
- VectorMapNet: End-to-end Vectorized HD Map Learning2022/6/1
- M2I: From Factored Marginal Trajectory Prediction to Interactive Prediction2022/2/1
- IFR-Explore: Learning Inter-object Functional Relationships in 3D Indoor Scenes2021/12/1
- DETR3D: 3D Object Detection from Multi-view Images via 3D-to-2D Queries2021/10/1
- Learning Practically Feasible Policies for Online 3D Bin Packing2021/8/1
- DenseTNT: End-to-end Trajectory Prediction from Dense Goal Sets2021/8/1
- DenseTNT: Waymo Open Dataset Motion Prediction Challenge 1st Place Solution2021/6/1
- Large Scale Interactive Motion Forecasting for Autonomous Driving : The Waymo Open Motion Dataset2021/4/1
- Predictive Visual Tracking: A New Benchmark and Baseline Approach2021/3/1
- Unsupervised Monocular Depth Learning in Dynamic Scenes2020/10/1
- CLOUD: Contrastive Learning of Unsupervised Dynamics2020/10/1
- SEMI: Self-supervised Exploration via Multisensory Incongruity2020/9/1
- TNT: Target-driveN Trajectory Prediction2020/8/1