Hongyang Li
The University of Hong Kong
収録論文 51本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EgoHumanoid-V2: 全身協調ロコマニピュレーションのための人間からヒューマノイドへのスキル転移VLA2026/9/29
一人称視点の人間のデモデータから、全身協調を保ったままロコマニピュレーションスキルをヒューマノイドへ直接転移する枠組みを提案し、実機4タスクでゼロショット転移を実現した。
- HACo: 力覚対応の巧みな操作のための触覚アクティブコンプライアンス学習マニピュレーション2026/9/29
指尖触覚と関節トルクを統合し、接触力を調整しながら動作する巧みな操作ポリシーを学習する手法を提案。実機で摩擦・回転トルク・変形物体操作など多様なタスクにおいて83%の平均成功率を達成した。
- ピクセルからポーズへ:人間のデモンストレーションによる物体中心のツール操作学習マニピュレーション2026/9/28
人間の動画デモから物体中心の世界モデルを事前学習し、ポーズ認識方策と組み合わせることで、ロボットとの対応データなしに複雑なツール操作を実現した。
- MSK-Bench:全身筋骨格運動制御のタスク・制御パラダイム・生理指標を横断するベンチマーク筋骨格制御2026/9/22
筋骨格ヒューマノイドの全身運動制御を22タスクで評価するベンチマークを提案し、5つの制御手法を統一プロトコルで比較した。
- Bench2Dex: 多様な器用ハンドにおける視触覚両手マニピュレーションのベンチマークマニピュレーション2026/9/14
12種類の器用ハンドに対応した共通の触覚インターフェースを備えるシミュレーションベンチマークを構築し、26の両手操作タスクと約1.3Kのテレオペデモを提供して視触覚マニピュレーションを評価可能にした。
- HandEdit: 身体性を考慮した人間からロボットへの器用な手の画像編集のための統一ベンチマーク画像編集/ロボティクス2026/8/1
人間の手の画像を様々なロボットハンドに変換する大規模な画像編集データセットとベンチマークを構築し、既存の編集モデルの評価と身体性を考慮した編集モデルの発展を目指した。
- 制御された世界モデルの識別可能性について世界モデル2026/7/24
この論文は、ガウス潜在状態を持つ制御された世界モデルが非線形観測から復元可能かどうかを理論的に解析し、識別可能性の条件を提案しています。
- NativeMEM: 長期ホライズンのロボット操作のためのネイティブメモリ圧縮VLA/長期メモリ/操作2026/7/1
事前学習済みVLAモデルが高頻度更新で長い視覚履歴を保持できるように、VLA自身の視覚エンコーダを再利用して各フレームを単一トークンに圧縮するメモリ圧縮方式を提案。外部メモリや新規モジュール不要で、シミュレーション成功率を32.4%から84.0%に向上させた。
- UR-VC: 時間由来の進捗指標に対する教師なしロボット価値補正操作学習2026/7/1
デモンストレーションの時間正規化を進捗ラベルとして使う際のノイズを、他エピソードの類似状態から補正する教師なし・学習不要の手法を提案した。
- Orca:世界は心の中にある世界モデル2026/6/29
Orcaは、マルチモーダルな世界信号から統一された世界潜在空間を学習し、テキスト生成・画像予測・身体動作生成などの下流タスクを軽量デコーダで実現する世界基盤モデルである。
- ScaleHP: メートル空間での手の姿勢推定手の姿勢推定2026/6/24
手の骨の比例関係からメートル単位の手のサイズを推定し、深度モジュールなしで絶対スケールの手の姿勢を高精度に復元する新しいフレームワークを提案した。
- ワールドエンジン:自動運転におけるポストトレーニング時代に向けて自動運転2026/6/1
実世界のログから高忠実度のインタラクティブ環境を再構築し、安全上重要な長尾シナリオを合成的に生成して、事前学習済みの自動運転モデルを強化学習でポストトレーニングする枠組みを提案。これにより、実世界のリスクを回避しつつ安全性を向上させる。
- RoboNaldo: 動作誘導カリキュラム強化学習による正確で安定かつ強力なヒューマノイドサッカーシュートロコモーション/強化学習2026/6/1
人間のキック動作を参照として段階的に最適化する3段階カリキュラム強化学習フレームワークを提案し、ヒューマノイドロボットによる高インパルスで正確なサッカーシュートを実現した。
- GuidedVLA: プラグアンドプレイの行動注意特化によるタスク関連因子の指定VLA2026/5/1
VLAモデルの行動デコーダを機能部品として捉え、個々の注意ヘッドに明示的な補助信号でタスク関連因子(物体接地、空間幾何、時間的スキル論理)を学習させるフレームワークを提案し、シミュレーションと実機で汎化性能を向上させた。
- Dexora: 高自由度両腕巧緻操作のためのオープンソースVLAVLA/操作2026/5/1
両腕・両手の高自由度操作を対象とした初のオープンソースVLAシステムDexoraを提案し、ハイブリッド遠隔操作とデータ品質を考慮した学習手法により、巧緻操作の成功率を大幅に向上させた。
- MM-Hand: 遠隔駆動を備えた21自由度のマルチモーダルモジュール式器用ロボットハンドロボットハンド/遠隔駆動/腱駆動/器用操作2026/4/1
本論文は、遠隔腱駆動によりモーターを外部に配置し、指と手のひらに自由度とセンサを集約した21自由度の器用ハンドMM-Handを提案し、伝達機構、力出力、センシング、制御性能を実験で検証した。
- SMASH: 自己中心視覚によるヒューマノイド卓球のスケーラブルな全身スキルの習得全身制御2026/4/1
外部センサに頼らず、自己中心視覚のみで連続打撃可能なヒューマノイド卓球システムを構築し、全身協調動作と生成モデルによる多様な打撃動作の学習を実現した。
- TAMEn: 接触リッチなタスクにおけるクローズドループデータ収集のための触覚対応操作エンジンデータ収集/触覚/操作2026/4/1
手持ち型デモ収集システムで、異なるグリッパーに適応可能なウェアラブルインターフェースと、高精度モードとポータブルモードを組み合わせたデータ収集パイプラインを提案し、触覚情報を含むリカバリデータを統合してポリシーを改善する。
- RISE: 構成可能な世界モデルによる自己改善ロボット方策VLA2026/2/1
ロボット操作のための構成可能な世界モデルを提案し、想像空間での強化学習により実世界での安全性・コスト問題を回避しつつ、動的タスクで大幅な性能向上を実現した。
- スパース動画生成による実世界の視界外ビジョン言語ナビゲーションVLA2026/2/1
動画生成モデルを視界外ナビゲーションに初導入し、20秒先の未来をスパースに生成することでサブ秒推論を実現した手法SparseVideoNavを提案。
- χ₀: 分布の不一致を抑え込むリソース効率の良いロバストマニピュレーションマニピュレーション2026/2/1
人間のデモ分布・方策の帰納バイアス・実行時分布のずれを、重み空間マージやステージ適応型アドバンテージ推定、訓練-展開アライメントで解消し、限られた計算資源で双腕ロボットによる衣類の長期的操作を高信頼に実現した。
- EgoHumanoid:ロボット不要の一人称デモで実世界ロコマニピュレーションを実現ロコマニピュレーション2026/2/1
人間の一人称視点デモと少量のロボットデータを共訓練し、視点・動作のずれを補正することで、ヒューマノイドの実世界ロコマニピュレーション性能を51%向上させた。
- PlannerRFT:閉ループかつサンプル効率の良い微調整による拡散プランナーの強化学習自動運転プランニング2026/1/1
拡散ベースの自動運転プランナーを強化学習で微調整するフレームワークを提案し、二重分岐最適化と高速シミュレータnuMaxによりサンプル効率と性能を向上させた。
- WholeBodyVLA:全身移動操作のための統合潜在VLAVLA2025/12/1
低コストな自己視点動画から移動操作知識を学ぶ統合潜在VLAと、精密な移動指令を実行するRLポリシーを組み合わせ、ヒューマノイドの広域移動操作を実現した。
- SimScale: 実世界シミュレーションを大規模に活用した自動運転の学習自動運転/sim2real2025/11/1
既存の走行ログから大規模に未知の状態を合成するシミュレーション基盤を構築し、疑似専門家による行動監督と実データとの共同学習で計画性能の堅牢性と汎化を大幅に向上させた。
- 俊敏性と安定性の融合:異種データによる汎用人型ロボット制御人型ロボット制御2025/11/1
人間のモーションキャプチャと物理的に生成したバランス動作という異種データを組み合わせ、単一のポリシーで俊敏な動きと極限のバランス維持を両立させる人型ロボット制御フレームワークAMSを提案。
- スケーラブルなロボットマニピュレーションに多様性は本当に必要か?マニピュレーション2025/7/1
ロボット学習におけるデータ多様性の役割をタスク・身体・専門家の3次元で検証し、タスク多様性が重要である一方、専門家の速度多様性は学習を妨げることを示し、その偏りを補正する手法を提案した。
- 自己認識型拡張による強化学習ベースの洗練:エンドツーエンド自動運転のための新手法自動運転2025/6/1
エンドツーエンド自動運転の模倣学習モデルを、強化学習による残差修正と自己認識型アダプタ拡張で継続的に改善する学習パイプラインR2SEを提案。難事例への適応と一般知識の保持を両立させる。
- ReSim: 自動運転のための信頼性の高い世界シミュレーションsim2real2025/6/1
実世界の運転データにシミュレータ由来の非専門家データを加え、危険な行動も含む多様な運転シナリオを制御可能に生成する世界モデルを構築し、報酬推定モジュールと組み合わせて政策評価性能を向上させた。
- 自動運転のための疑似シミュレーション評価自動運転評価2025/6/1
3Dガウススプラッティングで生成した合成観測を実データに付加し、閉ループに近い相関で自動運転を評価する疑似シミュレーション手法を提案。
- FreeTacMan: 接触の多いマニピュレーションのためのロボット不要な視触覚データ収集システム触覚2025/6/1
人間の指に装着できる視触覚センサ付きグリッパと光学トラッキングで、ロボットなしに接触の多い操作の実演データを収集するシステムを提案し、大規模データセットを公開した。
- UniVLA:タスク中心の潜在行動でどこでも行動を学習するVLA2025/5/1
動画からタスク中心の潜在行動表現を学習し、異なるロボットや環境に展開可能な汎用視覚言語行動ポリシーを実現した研究。
- AgiBot World Colosseo:スケーラブルで知能的な身体性システムのための大規模マニピュレーションプラットフォームマニピュレーション2025/3/1
100万以上の軌道と217タスクを含む大規模ロボット操作データセットと、潜在行動表現を活用した汎用方策GO-1を提案し、データ規模の拡大に伴う性能向上と実世界での巧みな長期的タスクの成功率向上を示した。
- Centaur: テスト時訓練による堅牢なエンドツーエンド自動運転自動運転2025/3/1
テスト時訓練でプランナーの不確実性を最小化し、手設計のルールやコスト関数に頼らずに自動運転の安全性を向上させる手法を提案。
- ロボット操作のための相乗的・汎用的・効率的なデュアルシステムに向けてマニピュレーション2024/10/1
汎用ポリシーと専門ポリシーを組み合わせたデュアルシステムRoboDualを提案し、少ない学習データで高精度・高効率なロボット操作を実現した。
- 生成期待を用いた閉ループ視覚運動制御によるロボットマニピュレーションマニピュレーション2024/9/1
テキスト条件付き動画拡散モデルで視覚計画を生成し、誤差を定量化する埋め込み空間とフィードバック制御器を組み合わせて、長期的なロボット操作を閉ループで適応制御するフレームワークCLOVERを提案した。
- 対話型自動運転のための推論型マルチエージェント行動トポロジー自動運転2024/9/1
マルチエージェントの将来軌道からブレイド理論に基づく行動トポロジー(BeTop)を抽出し、予測と計画の一貫性を高める学習フレームワークBeTopNetを提案した。
- TAPTRv2: 注意に基づく位置更新で任意点追跡を改善任意点追跡2024/7/1
Transformerベースの任意点追跡手法TAPTRを改良し、コストボリュームへの依存を排除する注意ベースの位置更新(APU)を導入して精度を大幅に向上させた。
- 相互作用予測によるマニピュレーション学習マニピュレーション2024/6/1
初期・最終状態と言語指示から遷移フレームと操作対象物体を予測する事前学習手法MPIを提案し、実機・シミュレーションで従来手法を10〜64%上回る性能を達成した。
- NAVSIM: データ駆動型非反応的自動運転シミュレーションとベンチマーク自動運転ベンチマーク2024/6/1
大規模データセットと非反応的シミュレータを組み合わせ、実世界に近い大規模ベンチマークを可能にする評価手法NAVSIMを提案。CVPR 2024コンペで143チームが参加し、新たな知見を得た。
- TAPTR: 検出としてのTransformerによる任意点追跡点追跡2024/3/1
点追跡を物体検出・追跡と類似とみなし、DETR風のTransformerで各追跡点をクエリとして扱うシンプルで高性能な任意点追跡フレームワークを提案。
- FastMAC: 対応グラフの確率的スペクトルサンプリング点群位置合わせ2024/3/1
3D対応グラフにグラフ信号処理を導入し、高周波成分を保つ確率的スペクトルサンプリングでMACを高速化した3D点群位置合わせ手法を提案。
- DriveAdapter: Breaking the Coupling Barrier of Perception and Planning in End-to-End Autonomous Driving2023/8/1
- Scene as Occupancy2023/6/1
- End-to-end Autonomous Driving: Challenges and Frontiers2023/6/1
- Planning-oriented Autonomous Driving2022/12/1
- Delving into the Devils of Bird's-eye-view Perception: A Review, Evaluation and Recipe2022/9/1
- Level 2 Autonomous Driving on a Single Device: Diving into the Devils of Openpilot2022/6/1
- Trajectory-guided Control Prediction for End-to-end Autonomous Driving: A Simple yet Strong Baseline2022/6/1
- HDGT: Heterogeneous Driving Graph Transformer for Multi-Agent Trajectory Prediction via Scene Encoding2022/5/1
- Exploring intermediate representation for monocular vehicle pose estimation2020/11/1