Renjing Xu
The Hong Kong University of Science and Technology (Guangzhou)
収録論文 68本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MM-ABC: 見て、協調し、想像する汎用モバイルマニピュレーションモバイルマニピュレーション2026/9/28
移動とマニピュレーションを別々のストリームとして扱い、マスク付きジョイントアテンションと未来予測の追加監督で協調させる基盤モデルを提案。
- 力に敏感なマニピュレーションのためのカリキュラム:触覚反射制御による把持行動の形成触覚2026/9/22
触覚反射制御をデータ収集時の教師として用い、力に敏感な物体の把持を学習させる手法を提案し、その有効性を検証した。
- DexTouch-WM: 人間の触覚から器用なロボット操作のための行動条件付き触覚ワールドモデルを学習触覚/ワールドモデル2026/9/17
人間とロボットの手に同じ触覚センサ配置を装着し、人間の触覚データからロボットの視覚・触覚の未来を予測するワールドモデルを学習。人間のデータを増やすほどロボット領域の予測精度が向上し、政策評価や合成データ生成にも使えることを示した。
- MoPA: サブシステム特化型知覚アラインメントによる協調的移動マニピュレーション移動マニピュレーション2026/9/10
移動とマニピュレーションで異なる知覚表現を二重ストリームで抽出し、行動レベルで協調させるフレームワークを提案。ManiSkill-HABで最高性能、実機でも成功率76.3%を達成。
- 人間が避ける行動からどう学ぶか?介入認識型ワールドモデルと実世界RLによる器用な操作操作2026/9/5
人間の介入を単なる修正ではなく、将来のリスク予測信号として活用する安全重視のRLフレームワークWHIRLを提案し、多指ロボットハンドでの複雑な把持・操作タスクで成功率向上と介入削減を実証した。
- 共有鳥瞰図による空陸協調型視覚言語ナビゲーションナビゲーション2026/9/3
UAVとUGVが協調する空陸協調型VLNの初の訓練不要ベースラインを提案し、共有鳥瞰図を用いて協調動作を実現、成功率77%を達成した。
- 学習された点群対応によるヒューマノイドの統合モーションリターゲティングモーションリターゲティング2026/9/2
人手による対応付けを必要とせず、点群の密な対応を学習することで、多様なモーションソースやロボット形態に対して統一的にモーションリターゲティングを行うフレームワークを提案した。
- DreamTrajectory: ワールドモデル整合による軌道誘導型行動生成による移動操作移動操作/VLA2026/8/1
移動操作ロボットのための軌道誘導型フレームワークを提案し、意図レベルの軌道予測と全身行動生成を統合、テスト時探索で計画軌道との整合性を高め成功率を向上させた。
- PFM-HR: 人型ロボットのためのポーズフローマッチング歩行2026/8/1
大規模な非順序ポーズデータから学習した再利用可能なフローマッチング事前分布を導入し、ポーズ幾何スコアを用いて追跡報酬を調整することで、人型ロボットの動的動作追跡性能を向上させた。
- 文脈を考慮したモーション事前分布によるヒューマノイド制御の学習ヒューマノイド制御2026/8/1
タスク文脈に応じてモーション事前分布の関連性を適応的に重み付けし、ヒューマノイド制御の性能とサンプル効率を向上させるフレームワークを提案した。
- Open-AoE: 身体化学習のためのオープンな自己中心視操作データセットとツールチェーンデータセット2026/7/1
スマートフォンで撮影した自己中心視の操作動画約2000時間と、それをロボット学習用に加工するツールチェーンを公開した論文。
- 信頼できる具現化知能に向けて:システムフレームワークと段階的信頼度レベル信頼性評価2026/7/1
具現化知能の信頼性を「持続的な安全な成功」と定義し、モデル・システム・エビデンス・展開の4層からなるフレームワークと段階的信頼度を提案する論文。
- RoboDojo: 汎用ロボット操作ポリシーの包括的評価のための統合シミュレーション・実世界ベンチマークベンチマーク2026/7/1
シミュレーションと実世界の両方で汎用ロボット操作ポリシーを評価するための統一ベンチマークを提案し、42のシミュレーションタスクと18の実世界タスクで多様な能力を評価する。
- HumanoidArena: 自己中心視点の階層的全身体学習のベンチマークヒューマノイド制御2026/6/1
ヒューマノイドロボットの階層的制御(高レベル方策と低レベル運動追跡器)の性能を評価する新しいシミュレーションベンチマークを提案し、脚部が重要な7つのタスクを設計して、方策と追跡器のインターフェースの実行可能性や頑健性を検証する。
- PL-LIT: 点・線特徴と熱画像マッピングを用いたLiDAR-慣性-熱SLAMSLAM2026/6/1
熱画像の課題を解決するため、点・線特徴抽出と光度校正を組み合わせたLiDAR-慣性-熱SLAMシステムを提案し、長距離熱赤外データセットで最先端性能を達成した。
- GPU並列マルチタスク強化学習とデモンストレーション誘導型方策最適化マルチタスクRL2026/6/1
GPU並列環境で複数の操作タスクを同時に学習するベンチマークMT-Liberoを構築し、デモンストレーションを活用したDGPOアルゴリズムを提案して性能を向上させた。
- ロボット操作のための行動効果メモリ事前学習マニピュレーション2026/6/1
視覚と行動の履歴から時間的表現を学習する事前学習フレームワークAEMを提案し、部分観測下での操作性能を向上させた。
- ニューロモルフィック強化学習による移動型ロボットフルフィルメントシステムの効率的経路探索経路探索2026/6/1
移動型ロボットフルフィルメントシステムの経路探索を、スパイクニューラルネットワークを用いたニューロモルフィックチップ上で実行する強化学習フレームワークを提案し、GPU比で約1万倍の省エネと約2倍の低遅延を実現した。
- VAIC: 視覚誘導によるヒューマノイドの俊敏な物体インタラクション制御 - 分離コマンドを用いてヒューマノイド制御2026/6/1
ヒューマノイドロボットが、深度カメラと自己状態のみから、箱運びやスケートボードなどの多様な動的物体操作を単一のポリシーで実行できるようにする、教師-生徒蒸留に基づく制御フレームワークを提案した。
- CoRe-MoE:歩容適応を備えた多地形ヒューマノイド歩行のための対比的重み付け混合エキスパート歩行2026/6/1
歩行と走行の切り替えと多地形適応を単一ポリシーで実現するため、歩容生成と地形適応を分離した二段階強化学習フレームワークを提案した。
- ParkourFormer:予測的監督と系列モデリングをパルクール移動に統合する歩行2026/5/1
ヒューマノイドのパルクール移動を未来条件付き意思決定問題として再構成し、Transformerベースの系列モデリングで将来の身体状態を予測して行動生成に活用するフレームワークを提案。シミュレーションと実機で高い成功率を達成した。
- 視覚と言語によるナビゲーションの限界は何か?ナビゲーション2026/5/1
シミュレーションから実世界への展開で性能が低下するVLNエージェントの問題を解決するため、ステレオ視覚と目標位置の事前知識を用いたStereoNavを提案し、少ないパラメータとデータで最先端の性能を達成した。
- Tabero: 視覚・触覚・言語からの閉ループ力フィードバックによる優しい操作の学習操作学習2026/5/1
触覚フィードバックを活用した優しいロボット操作を実現するため、データ効率的なパイプラインで視覚・触覚・言語データを生成し、力と位置を分離した指令インターフェースを持つモデルを提案。優しい指示下で把持力を70%以上削減しつつ高い成功率を維持した。
- MoSA: 運動制約付き応力適応による連続体力学の実機-シミュレーションギャップ緩和 - 残差異方性学習を通じて物理シミュレーション/ロボット操作2026/5/1
実世界の連続体の動力学を視覚観測から学習する際、等方性モデルを物理事前知識として使い、残差応力演算子を学習して軽度の異方性・不均一性を捉えることで、実機とシミュレーションのギャップをさらに縮小するフレームワークを提案した。
- OHP-RL: ロボット操作の強化学習におけるオンライン人間選好をガイドとして活用マニピュレーション2026/5/1
人間の介入を選好情報として捉え、状態依存のゲートで適応的に学習を導く強化学習フレームワークを提案し、実機ロボットの接触を伴う操作タスクで有効性を示した。
- RobotPan: 身体化知覚のための360度全方位ロボット視覚システム視覚システム2026/4/1
6台のカメラとLiDARを組み合わせ、ロボット周囲を360度カバーする視覚システムを構築し、リアルタイムレンダリング・再構成・ストリーミングを可能にする3Dガウシアン予測フレームワークを提案した。
- 視点汎化を超えて:多視点デモがもたらすものとロボット操作のためのその合成方法マニピュレーション2026/3/1
多視点デモデータがロボット操作の性能と汎化に与える影響を体系的に分析し、単眼入力から新視点ビデオを合成する自己教師ありフレームワークRoboNVSを提案した。
- ロボット中心の映像合成による形態整合的な人型ロボットインタラクションヒューマノイド/映像生成/ゼロショット2026/3/1
人型ロボットの対話スキルを、ポリシー学習や人間の動作リターゲティングに頼らず、映像生成モデルでロボット自身の動作を合成し、そこから関節軌道を抽出して実行するゼロショット手法を提案した。
- UniGround: トレーニング不要のシーン解析によるユニバーサル3Dビジュアルグラウンディング3Dビジュアルグラウンディング2026/3/1
3Dシーン内の物体を自然言語記述で特定する3Dビジュアルグラウンディングにおいて、既存の候補生成と視覚情報のボトルネックを解決するゼロショットフレームワークUniGroundを提案した。
- RMBench:記憶依存型ロボットマニピュレーションのベンチマークと政策設計への洞察マニピュレーション2026/3/1
記憶を必要とするロボット操作タスクを体系的に評価する9タスクのシミュレーションベンチマークRMBenchと、明示的記憶モジュールを持つ操作政策Mem-0を提案し、既存政策の記憶限界と設計指針を明らかにした。
- 球面潜在運動プリオによる物理ベース人型ロボット制御運動プリオ/人型制御2026/3/1
物理ベースの人型ロボット制御のための新しい運動プリオ学習法を提案。追跡コントローラを球面潜在空間に蒸留し、情報損失なく安定したランダムサンプリングを実現する。
- HAIC: ダイナミクス認識ワールドモデルによるヒューマノイドの俊敏な物体インタラクション制御マニピュレーション2026/2/1
固有受容感覚の履歴のみから物体の速度・加速度を予測し、動的占有マップを構築することで、スケートボードや台車の押し引きなど劣駆動物体との俊敏な全身インタラクションを実現したヒューマノイド制御フレームワーク。
- ヒューマノイドロボットのためのポーズ距離場ヒューマノイド2026/2/1
ロボットのポーズ分布を連続的で微分可能な多様体として表現する軽量な事前分布PDF-HRを提案し、報酬整形や正則化として組み込むことで運動追跡やリターゲティングなどのタスクを改善した。
- MeshMimic: 3Dシーン再構成による幾何学認識型ヒューマノイド動作学習ヒューマノイド/動作生成/sim2real2026/2/1
動画から3Dシーンと人間の動きを再構成し、地形との接触を保ったままヒューマノイドロボットの動作を学習させるフレームワークを提案。
- DexFormer: 履歴条件付きTransformerによるクロスエンボディメント器用マニピュレーションマニピュレーション2026/2/1
履歴観測を条件とするTransformerベースの単一ポリシーで、異なる多自由度ハンドの形態や動力学をオンラインで推定し、ゼロショットで多様なハンドに適応する器用マニピュレーションを実現した。
- 人間型ロボット制御の能力を拡張する反復閉ループ動作合成ヒューマノイド制御2026/2/1
物理ベースの人間型ロボット制御において、動作データを自動生成し反復的に難易度を高める閉ループフレームワークを提案。AMASSの約1/10のデータ量で失敗率を45%削減した。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- テスト時強化学習によるVLAモデルのオンライン適応VLA2026/1/1
推論中に段階的なタスク進捗を報酬として強化学習を行い、VLAモデルをその場で適応させるTT-VLAを提案。未知環境での適応性と成功率を向上させた。
- HERO: 移動可能障害物を考慮した階層的走行可能3Dシーングラフによる身体性ナビゲーションナビゲーション2025/12/1
操作可能な障害物を通路として扱う階層的3Dシーングラフを構築し、障害物のある環境でのナビゲーション効率と到達性を大幅に改善した。
- 動的構造を考慮した3D視覚表現の自己教師あり事前学習フレームワークAFRO3D視覚表現学習2025/12/1
ロボット操作向けに、行動や再構成の教師なしで状態間の動的構造を捉える3D視覚表現を学習する自己教師あり手法を提案し、拡散ポリシーと組み合わせて操作成功率を向上させた。
- VLMが計画した原子スキルのデモンストレーションによる優しいマニピュレーション方策学習マニピュレーション2025/11/1
VLMで長期的な接触を伴うタスクを原子スキルに分解し、力制約付きRLで各スキルをシミュレーション学習、そのデモを視触覚拡散方策に蒸留して実機展開する枠組みを提案。
- SocialNav-Map: 人間軌道予測を用いた動的マッピングによるゼロショット社会ナビゲーション社会ナビゲーション2025/11/1
人間の軌道予測と占有マップを組み合わせ、環境ごとの追加学習なしで安全に移動できるゼロショット社会ナビゲーション手法を提案。
- 能動的リスク知覚による社会的ナビゲーションの学習社会的ナビゲーション2025/10/1
RGB-Dとオドメトリのみを用い、周囲の人間との衝突リスクを予測する能動的リスク知覚モジュールをFalconに追加し、混雑環境での社会的に配慮したナビゲーションを実現した。
- TopoNav: トポロジカルグラフを活用した高度な物体ナビゲーションナビゲーション2025/9/1
トポロジカルグラフを空間記憶として用いることで、長期的な物体ナビゲーションタスクにおける記憶管理と動的環境への対応を改善するフレームワークを提案。
- 暗黙的キノダイナミック動作リターゲティングによるスケーラブルな全身動作転移動作リターゲティング2025/9/1
骨格グラフ畳み込みデュアルオートエンコーダと物理情報に基づく洗練により、人間の動作データを高速かつ物理的に実現可能なヒューマノイド動作へ変換する手法を提案した。
- 平面アレイUWB/GPS/IMU/気圧センサ統合による高精度クライミングロボット測位測位・センサフュージョン2025/9/1
GPS遮蔽やUWB非見通し環境に対応するため、平面アレイUWB・GPS・IMU・気圧計を注意機構で融合しUKFで軌道を精錬する測位システムを提案し、実環境で0.48mの精度を達成した。
- DreamNav: 軌道ベースの想像フレームワークによるゼロショット視覚言語ナビゲーションVLA2025/9/1
自己中心視点のみを用いて、軌道レベル計画と能動的想像を統合したゼロショット視覚言語ナビゲーション手法を提案し、VLN-CEと実世界でSOTAを達成した。
- FARM: フレーム加速拡張と残差Mixture-of-Expertsによる物理ベース高ダイナミックヒューマノイド制御ヒューマノイド制御2025/8/1
フレーム間隔を広げる拡張と残差MoEを組み合わせ、日常的な低ダイナミック動作の精度を保ちつつ爆発的な高ダイナミック動作の追従精度を大幅に改善する物理ベースヒューマノイド制御フレームワークを提案し、専用ベンチマークHDHMも構築した。
- ロボットのための占有世界モデル世界モデル2025/5/1
屋内ロボット向けに、時空間受容野と自己回帰トランスフォーマーを組み合わせて3D占有シーンの進化を予測するRoboOccWorldを提案し、新しいベンチマークで有効性を示した。
- RoboOcc: ロボットのための幾何・意味シーン理解を強化する3D占有予測3D占有予測2025/4/1
3Dガウシアンの不透明度と幾何特性を活用したエンコーダで、ロボット周囲のシーンの細かい形状と意味を高精度に予測する手法を提案。
- 蒸留PPO:ヒューマノイド知覚歩行のための新たな二段階強化学習フレームワーク歩行2025/3/1
完全観測MDPで教師方策を学習し、その知識で生徒方策を正則化・監督する二段階の知覚歩行フレームワークを提案した論文。
- 推論時の分布レベル合成によるモダリティ合成可能な拡散ポリシーVLA2025/3/1
個別の視覚モダリティで事前学習済みの拡散ポリシーを追加学習なしに分布スコアのレベルで合成し、より表現力の高いポリシーを実現する手法を提案した。
- LiPS: 直並列構造を持つヒューマノイドロボットの大規模強化学習sim2real2025/3/1
閉ループの直並列機構をシミュレーションで直接モデル化することで、ヒューマノイドロボットの強化学習を大規模並列環境で訓練可能にする手法LiPSを提案する。
- Trinity: モジュール型ヒューマノイドロボットAIシステムヒューマノイド/VLA2025/3/1
強化学習・大規模言語モデル・視覚言語モデルを統合し、複雑な環境でヒューマノイドロボットを効率的に制御するAIシステムTrinityを提案した。
- EmbodiedVSR: 動的シーングラフ誘導による視覚空間タスクの連鎖推論VLA2025/3/1
動的シーングラフとChain-of-Thought推論を組み合わせ、微調整なしで身体性エージェントの空間推論を強化するフレームワークを提案し、新ベンチマークで有効性を示した。
- ES-Parkour: 生体模倣イベントカメラとスパイキングニューラルネットワークによる高度なロボットパルクール歩行2025/3/1
イベントカメラとスパイキングニューラルネットワーク(SNN)を組み合わせ、四足ロボットのパルクールを従来のANNベース手法より88.3%少ない消費電力で実現した研究。
- HumanoidPano:ヒューマノイドロボットのための球面パノラマ-LiDARハイブリッドクロスモーダル知覚クロスモーダル知覚2025/3/1
パノラマ視覚とLiDARを球面ビジョントランスフォーマーで融合し、ヒューマノイドの自己遮蔽と狭視野を克服する360度BEV知覚フレームワークを提案。
- MapNav: 注釈付きセマンティックマップによる視覚言語ナビゲーションの新たな記憶表現VLA2025/2/1
視覚言語ナビゲーションにおいて、過去の観測フレームの代わりに注釈付きセマンティックマップを構築・更新して用いることで、記憶と計算の負荷を抑えつつ最先端性能を達成した研究。
- Mambaポリシー:ハイブリッド選択的状態モデルによる効率的な3D拡散ポリシーマニピュレーション2024/9/1
拡散モデルベースの3Dマニピュレーションポリシーを、MambaとAttentionを組み合わせた軽量なXMambaブロックで置き換え、パラメータ数を80%以上削減しつつ性能を向上させた研究。
- 多層階ゼロショット物体ナビゲーション方策ナビゲーション2024/9/1
MLLMを活用し、複数階にまたがる未知環境で対象物体を探索するゼロショット物体ナビゲーション方策を提案し、四足歩行ロボットで実環境検証も行った。
- 強化学習のためのクエリベース意味論的ガウシアンフィールドによるシーン表現シーン表現/強化学習2024/6/1
3Dガウシアンスプラッティングと階層的意味論エンコーディングを組み合わせ、強化学習エージェントのための効率的で意味情報を保持したシーン表現を学習する手法を提案。
- マルチモーダルトークンのプロンプトによるLLM活用型エンドツーエンド自動運転模倣学習の強化自動運転2024/4/1
視覚とLiDAR入力を学習可能なマルチモーダルトークンに統合し、LLMに運転モデルの誤り修正を補助させるハイブリッドなエンドツーエンド自動運転フレームワークを提案した。
- TriHelper: 動的支援によるゼロショット物体ナビゲーションナビゲーション2024/3/1
未知環境で特定物体へ向かうゼロショット物体ナビゲーションにおいて、衝突・探索・検出の課題を動的に支援する3つのヘルパーからなるフレームワークを提案し、HM3DとGibsonで既存手法を上回る性能を示した。
- 人間の参照動作を用いた全身ヒューマノイドロボットの歩行・移動歩行2024/2/1
人間の動作データを模倣学習に用いる新フレームワークを開発し、フルサイズヒューマノイド「Adam」で人間に匹敵する複雑な移動動作を実現した。
- Physical Priors Augmented Event-Based 3D Reconstruction2024/1/1
- Fully Spiking Neural Network for Legged Robots2023/10/1
- Chasing Day and Night: Towards Robust and Efficient All-Day Object Detection Guided by an Event Camera2023/9/1
- Prompt, Plan, Perform: LLM-based Humanoid Control via Quantized Imitation Learning2023/9/1