Li Chen
The University of Hong Kong
収録論文 39本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EgoHumanoid-V2: 全身協調ロコマニピュレーションのための人間からヒューマノイドへのスキル転移VLA2026/9/29
一人称視点の人間のデモデータから、全身協調を保ったままロコマニピュレーションスキルをヒューマノイドへ直接転移する枠組みを提案し、実機4タスクでゼロショット転移を実現した。
- PORTER: 永続的な3Dシーングラフ記憶のためのエッジ・クラウド常駐化3Dシーングラフ/エッジクラウド2026/9/27
3Dシーングラフの軽量アンカーをエッジに残し重い物体ペイロードをクラウドとやり取りすることで、タスク切替をまたいだ再利用可能な情報を保持しつつロボットの限られたメモリを有効活用する手法を提案。
- HandEdit: 身体性を考慮した人間からロボットへの器用な手の画像編集のための統一ベンチマーク画像編集/ロボティクス2026/8/1
人間の手の画像を様々なロボットハンドに変換する大規模な画像編集データセットとベンチマークを構築し、既存の編集モデルの評価と身体性を考慮した編集モデルの発展を目指した。
- UR-VC: 時間由来の進捗指標に対する教師なしロボット価値補正操作学習2026/7/1
デモンストレーションの時間正規化を進捗ラベルとして使う際のノイズを、他エピソードの類似状態から補正する教師なし・学習不要の手法を提案した。
- ジャストインタイムシーングラフ成長:長時間ロボティクスにおける知覚飽和への対抗知覚/シーングラフ2026/7/1
この論文は、ロボットの長時間タスク実行中に生じる知覚の飽和問題を解決するため、タスクに応じて必要な部分だけを動的に活性化する3Dシーングラフ構築手法JITOMAを提案している。
- LH-AVLN: 長時間音声・視覚・言語ナビゲーションのベンチマークナビゲーション2026/7/1
複数目標と空間化された音響手がかりを組み合わせた長時間ナビゲーションのベンチマークを提案し、音声を活用した参照エージェントPAG-Navを開発して評価した。
- ワールドエンジン:自動運転におけるポストトレーニング時代に向けて自動運転2026/6/1
実世界のログから高忠実度のインタラクティブ環境を再構築し、安全上重要な長尾シナリオを合成的に生成して、事前学習済みの自動運転モデルを強化学習でポストトレーニングする枠組みを提案。これにより、実世界のリスクを回避しつつ安全性を向上させる。
- RoboNaldo: 動作誘導カリキュラム強化学習による正確で安定かつ強力なヒューマノイドサッカーシュートロコモーション/強化学習2026/6/1
人間のキック動作を参照として段階的に最適化する3段階カリキュラム強化学習フレームワークを提案し、ヒューマノイドロボットによる高インパルスで正確なサッカーシュートを実現した。
- 空間複雑性の分解:LLMの空間推論のための階層的分解空間推論2026/5/27
LLMの空間推論能力を向上させるため、複雑なタスクを階層的に分解する手法と、MCTS誘導のグループ相対方策最適化(M-GRPO)を提案し、ナビゲーションや計画などの空間タスクで最先端の性能を達成した。
- SMASH: 自己中心視覚によるヒューマノイド卓球のスケーラブルな全身スキルの習得全身制御2026/4/1
外部センサに頼らず、自己中心視覚のみで連続打撃可能なヒューマノイド卓球システムを構築し、全身協調動作と生成モデルによる多様な打撃動作の学習を実現した。
- TAMEn: 接触リッチなタスクにおけるクローズドループデータ収集のための触覚対応操作エンジンデータ収集/触覚/操作2026/4/1
手持ち型デモ収集システムで、異なるグリッパーに適応可能なウェアラブルインターフェースと、高精度モードとポータブルモードを組み合わせたデータ収集パイプラインを提案し、触覚情報を含むリカバリデータを統合してポリシーを改善する。
- RISE: 構成可能な世界モデルによる自己改善ロボット方策VLA2026/2/1
ロボット操作のための構成可能な世界モデルを提案し、想像空間での強化学習により実世界での安全性・コスト問題を回避しつつ、動的タスクで大幅な性能向上を実現した。
- EgoHumanoid:ロボット不要の一人称デモで実世界ロコマニピュレーションを実現ロコマニピュレーション2026/2/1
人間の一人称視点デモと少量のロボットデータを共訓練し、視点・動作のずれを補正することで、ヒューマノイドの実世界ロコマニピュレーション性能を51%向上させた。
- スパース動画生成による実世界の視界外ビジョン言語ナビゲーションVLA2026/2/1
動画生成モデルを視界外ナビゲーションに初導入し、20秒先の未来をスパースに生成することでサブ秒推論を実現した手法SparseVideoNavを提案。
- より遠く、より賢く見る:VLM政策最適化のための価値誘導マルチパス反射VLA2026/2/1
VLMを用いたロボット操作において、状態評価と行動生成を分離し、ビーム探索で複数の将来経路を探索するテスト時計算フレームワークを提案。信頼度に基づく早期終了で推論遅延を削減し、多段階操作タスクでの性能を向上させた。
- χ₀: 分布の不一致を抑え込むリソース効率の良いロバストマニピュレーションマニピュレーション2026/2/1
人間のデモ分布・方策の帰納バイアス・実行時分布のずれを、重み空間マージやステージ適応型アドバンテージ推定、訓練-展開アライメントで解消し、限られた計算資源で双腕ロボットによる衣類の長期的操作を高信頼に実現した。
- WholeBodyVLA:全身移動操作のための統合潜在VLAVLA2025/12/1
低コストな自己視点動画から移動操作知識を学ぶ統合潜在VLAと、精密な移動指令を実行するRLポリシーを組み合わせ、ヒューマノイドの広域移動操作を実現した。
- 俊敏性と安定性の融合:異種データによる汎用人型ロボット制御人型ロボット制御2025/11/1
人間のモーションキャプチャと物理的に生成したバランス動作という異種データを組み合わせ、単一のポリシーで俊敏な動きと極限のバランス維持を両立させる人型ロボット制御フレームワークAMSを提案。
- 応力誘導強化学習による変形・壊れやすい物体の穏やかなSim-to-Realマニピュレーションマニピュレーション2025/10/1
応力をペナルティとする報酬とオフライン実演・カリキュラム学習を組み合わせ、豆腐のような壊れやすい物体をシミュレーションから実世界へゼロショットで穏やかに操作する手法を提案した。
- V2X協調自動運転のエンドツーエンド競技会:研究課題と進展V2X協調自動運転2025/7/1
V2X通信を活用した協調自動運転のエンドツーエンド競技会を開催し、帯域制約下での知覚・計画の課題と上位解法の傾向を分析した。
- スケーラブルなロボットマニピュレーションに多様性は本当に必要か?マニピュレーション2025/7/1
ロボット学習におけるデータ多様性の役割をタスク・身体・専門家の3次元で検証し、タスク多様性が重要である一方、専門家の速度多様性は学習を妨げることを示し、その偏りを補正する手法を提案した。
- ReSim: 自動運転のための信頼性の高い世界シミュレーションsim2real2025/6/1
実世界の運転データにシミュレータ由来の非専門家データを加え、危険な行動も含む多様な運転シナリオを制御可能に生成する世界モデルを構築し、報酬推定モジュールと組み合わせて政策評価性能を向上させた。
- 自己認識型拡張による強化学習ベースの洗練:エンドツーエンド自動運転のための新手法自動運転2025/6/1
エンドツーエンド自動運転の模倣学習モデルを、強化学習による残差修正と自己認識型アダプタ拡張で継続的に改善する学習パイプラインR2SEを提案。難事例への適応と一般知識の保持を両立させる。
- FreeTacMan: 接触の多いマニピュレーションのためのロボット不要な視触覚データ収集システム触覚2025/6/1
人間の指に装着できる視触覚センサ付きグリッパと光学トラッキングで、ロボットなしに接触の多い操作の実演データを収集するシステムを提案し、大規模データセットを公開した。
- 折り紙 inspired 再構成可能マニピュレータの物理再構成パラメータと制御器の共最適化マニピュレーション2025/4/1
折り紙 inspired モジュールからなる腱駆動再構成マニピュレータにおいて、関節剛性を設計変数として強化学習で制御方策と共最適化し、衝突回避を伴う目標到達タスクを実現した。
- AgiBot World Colosseo:スケーラブルで知能的な身体性システムのための大規模マニピュレーションプラットフォームマニピュレーション2025/3/1
100万以上の軌道と217タスクを含む大規模ロボット操作データセットと、潜在行動表現を活用した汎用方策GO-1を提案し、データ規模の拡大に伴う性能向上と実世界での巧みな長期的タスクの成功率向上を示した。
- ロボット操作のための相乗的・汎用的・効率的なデュアルシステムに向けてマニピュレーション2024/10/1
汎用ポリシーと専門ポリシーを組み合わせたデュアルシステムRoboDualを提案し、少ない学習データで高精度・高効率なロボット操作を実現した。
- 生成期待を用いた閉ループ視覚運動制御によるロボットマニピュレーションマニピュレーション2024/9/1
テキスト条件付き動画拡散モデルで視覚計画を生成し、誤差を定量化する埋め込み空間とフィードバック制御器を組み合わせて、長期的なロボット操作を閉ループで適応制御するフレームワークCLOVERを提案した。
- 対話型自動運転のための推論型マルチエージェント行動トポロジー自動運転2024/9/1
マルチエージェントの将来軌道からブレイド理論に基づく行動トポロジー(BeTop)を抽出し、予測と計画の一貫性を高める学習フレームワークBeTopNetを提案した。
- 相互作用予測によるマニピュレーション学習マニピュレーション2024/6/1
初期・最終状態と言語指示から遷移フレームと操作対象物体を予測する事前学習手法MPIを提案し、実機・シミュレーションで従来手法を10〜64%上回る性能を達成した。
- LanguageMPC: Large Language Models as Decision Makers for Autonomous Driving2023/10/1
- DriveAdapter: Breaking the Coupling Barrier of Perception and Planning in End-to-End Autonomous Driving2023/8/1
- Scene as Occupancy2023/6/1
- End-to-end Autonomous Driving: Challenges and Frontiers2023/6/1
- Planning-oriented Autonomous Driving2022/12/1
- Delving into the Devils of Bird's-eye-view Perception: A Review, Evaluation and Recipe2022/9/1
- Level 2 Autonomous Driving on a Single Device: Diving into the Devils of Openpilot2022/6/1
- Trajectory-guided Control Prediction for End-to-end Autonomous Driving: A Simple yet Strong Baseline2022/6/1
- HDGT: Heterogeneous Driving Graph Transformer for Multi-Agent Trajectory Prediction via Scene Encoding2022/5/1