Xuelong Li
Institute of Artificial Intelligence (TeleAI), China Telecom
収録論文 71本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- NEXUS: 地形適応型テレオペレーションのための知覚的全身体制御テレオペレーション2026/9/30
人間の動作指令と機体のセンサ情報を組み合わせ、異なる地形でもロボットが姿勢と接地を適応させて全身テレオペレーションを実現する制御フレームワークを提案。
- オドメトリ支援による前方監視ソナーを用いた水中ロボットのリアルタイムマッピング水中マッピング/ソナー2026/9/21
前方監視ソナーの劣化画像からFFTノイズ除去・MCFAR検出・境界接続で特徴を抽出し、姿勢を考慮した投影と占有蓄積で2.5D地図をリアルタイム構築する手法を提案。プール実験でRMSE 3cm未満、1フレーム42.4msを達成。
- AquaOrbit: 断続的な視覚フィードバック下での水中ターゲット周回のためのSim-to-Real強化学習sim2real2026/9/21
視覚が途切れる水中環境で、目標を見失っても復帰モジュールで安定化・再捕捉しながら周回する強化学習制御器を開発し、シミュレーションから実機へゼロショット転移させた。
- 水中でのダイバーとロボットの信頼性高いインタラクションに向けて:ジェスチャ設計、対話ロジック、実環境評価水中HRI2026/9/20
ダイバーが使いやすくロボットが認識しやすい7種類の水中ジェスチャと軽量な認識手法、コマンドレベルの対話ロジックを組み合わせた閉ループ型インタラクションを構築し、水槽とプールでの実験で有効性を検証した。
- WOLF: 予測フロンティアを用いた世界モデル誘導LiDAR探索探索2026/9/20
LiDAR搭載UAVの自律探索において、再帰的世界モデルで将来の観測を予測し、予測フロンティアを生成することで遮蔽物の先の有望領域を推定し探索効率を高める手法を提案。
- TourPhysics: 物理を世界モデルに導入し、単一画像からの探索と操作を実現世界モデル2026/9/4
単一画像と物理設定から初期化し、シミュレーションとビデオ生成を組み合わせて、長期的な物理的一貫性を保ちながら探索と操作を行うオンラインフレームワークを提案する。
- WNM-3D: 3Dシーン条件付けによるクローズドループVLNのための世界ナビゲーションモデルVLA/ナビゲーション2026/8/7
連続的な視覚言語ナビゲーション(VLN)のための生成的世界行動モデルを提案し、3Dシーン表現を条件として将来の視覚と行動を同時生成することで、クローズドループのナビゲーション性能を向上させた。
- CineWeaver: トレーニング不要で参照制御可能なマルチショット長編映像生成による映画的ストーリーテリング映像生成2026/7/29
事前学習済みの動画拡散モデルを用いて、再学習なしで複数ショットからなる長編映像を生成する統一フレームワークを提案。位置エンコーディングとアテンション操作で時間的連続性を断ち、ショットごとの参照制御と長期記憶機構を導入した。
- EDAR: ロボット操作のための環境依存行動表現の学習マニピュレーション2026/7/1
ロボット操作において、行動トークンを実行可能な制御構造と環境条件付きの視覚的結果に基づいて表現する手法を提案し、長期的な操作タスクでのポリシー学習を改善した。
- KineBench: IDM不要の運動学的接地による身体化世界モデルのベンチマーク世界モデル/ベンチマーク2026/7/1
身体化世界モデルの物理的整合性を評価するため、逆動力学モデルを使わずに生成動画から直接6Dエンドエフェクタ姿勢を抽出し、物理シミュレータで閉ループ検証する新しいベンチマークKineBenchを提案した。
- 世界行動モデルから具現化された脳へ:オープンワールド物理知能へのロードマップVLA2026/7/1
本論文は、物理世界で推論・行動できる汎用AIの実現に向けて、世界行動モデル(WAM)の進化を概観し、モデル役割・標準化・システム構成の3つのギャップを整理した上で、具現化された脳を中心とした共進化ロードマップを提案している。
- RRTrack: 動的シーンにおける頑健で復元可能な物体6D姿勢追跡6D姿勢追跡2026/7/1
動的で遮蔽のあるシーンでの物体6D姿勢追跡を高速かつ頑健に行うため、2D-6D閉ループ追跡とDINOv2ベースのテンプレートマッチングによる再検出機能を備えたトラッカーRRTrackを提案した。
- SpaceVLN: オンライン空間認知記憶と推論を備えたゼロショット視覚言語ナビゲーションエージェントナビゲーション2026/6/8
連続環境での視覚言語ナビゲーションにおいて、空間構造を理解し指示に従うゼロショットエージェントを提案。空間認知記憶とタスク誘導型空間推論を導入し、探索領域を階層的に抽象化してナビゲーションを効率化する。
- VISTA: UMIデータの視覚基盤と物理検証によるVLAトレーニング適応VLA2026/6/1
UMIデータをVLAモデルの訓練に使う際の視覚的・物理的な不整合を解消するため、魚眼カメラ用VQAデータセットと物理検証パイプラインを導入し、実ロボット成功率を向上させた。
- OASIS: シミュレーションデータ収集から実世界のヒューマノイド移動操作へヒューマノイド/移動操作/sim2real2026/6/1
実世界の画像から3D生成モデルで物体アセットを自動構築し、シミュレーション内で遠隔操作によりデータを収集・拡張して、ヒューマノイドの移動操作ポリシーを訓練する枠組みを提案。実機ゼロショット展開で、多くのタスクで実機遠隔操作データによる訓練を上回る成功率を達成。
- GN0: 視覚言語ナビゲーションにおける生成・評価・方策学習の統一的パラダイムに向けてナビゲーション2026/6/1
大規模データセットと高忠実度シミュレータを構築し、RL駆動のナビゲーション基盤モデルを提案して、視覚言語ナビゲーションの性能を向上させた。
- PhysOmni: 単一画像からの物理基盤マルチオブジェクトシーン生成とリアルタイムインタラクションシーン生成2026/5/19
単一画像から物理的に一貫性のある3Dシーンを再構成し、リアルタイムで操作可能なビデオを生成するトレーニング不要のフレームワークを提案。
- PRTS: 対比表現を用いたプリミティブ推論とタスク実行システムVLA2026/4/1
視覚言語行動モデルを、教師あり模倣学習ではなく目標条件付き強化学習として再構成し、言語指示を目標として扱うことで、物理的な到達可能性を評価する統一埋め込み空間を学習する基盤モデルを提案した。
- RPG: 人間型格闘における複数スキル遷移のためのロバストなポリシーゲーティング歩行/格闘/スキル遷移2026/4/1
人間型ロボットの格闘動作において、複数のスキルを切り替える際の不安定さを解決するため、遷移ランダム化と時間ランダム化を用いたハイブリッド専門家ポリシーフレームワークを提案し、シミュレーションと実機で検証した。
- 無重力状態を学ぶ:人型ロボットにおける非自己安定動作の模倣模倣学習/全身制御2026/4/1
人型ロボットが環境に依存する動作(椅子に座る、横になる、壁に寄りかかるなど)を実行する際、人間が行う「無重力状態」を模倣し、関節を選択的に弛緩させる手法を提案した。
- 対話強化型長期間協調視覚言語ナビゲーション DeCoNav群制御2026/4/1
複数ロボットが対話で情報交換し、動的にタスクを再割り当て・再計画しながら長期間の協調ナビゲーションを行う枠組みを提案し、ベンチマークで成功率を大幅に向上させた。
- ZeroWBC: 一人称視点の人間データから自然な全身ヒューマノイド動作を学習全身制御2026/3/1
人間の一人称視点動画と全身動作・テキスト注釈から、テレオペレーションなしでヒューマノイドの全身インタラクションを学習するフレームワークを提案し、Unitree G1で多様なシーン適応行動を実現した。
- Pro-HOI: 知覚に基づくルート誘導型ヒューマノイド物体インタラクションロコマニピュレーション2026/3/1
ヒューマノイドロボットの物体運搬操作を、ルート軌道を条件としたポリシー学習とデジタルツインによる物体状態推定で実現する汎用フレームワークを提案した。
- PCHC: 多目的強化学習による嗜好条件付きヒューマノイド制御の実現ヒューマノイド制御2026/3/1
複数の競合する目的(速度とエネルギー消費など)をバランスするヒューマノイド制御のため、単一のポリシーで嗜好ベクトルに応じて多様な行動を生成できる多目的強化学習フレームワークを提案した。
- 動的補正を備えた閉ループアクションチャンクによる学習不要の拡散ポリシー拡散ポリシー/操作2026/3/1
拡散ベースのポリシーに動的環境情報を注入し、リアルタイムでアクションを補正する閉ループ拡散ポリシーフレームワークDCDPを提案。再学習なしで動的シナリオへの適応性を向上させる。
- X-Loco: 協調的ポリシー蒸留による汎用人型ロコモーション制御歩行2026/3/1
複数の専門家ポリシーを蒸留し、転倒復帰から地形走破、全身協調までを単一の視覚ベース人型ロコモーションポリシーとして学習させるフレームワークを提案。
- 短期的視野を超えて:非マルコフ的シミュレーションベンチマークにおける頑健な長期操作のためのVQメモリ操作2026/3/1
非マルコフ的で長期的な操作タスクを評価する新しいベンチマーク「RuleSafe」を提案し、過去の状態を離散トークンに符号化するVQメモリ表現が、既存のVLAモデルの長期計画と汎化性能を向上させることを示した。
- HUSKY: 物理を考慮した全身制御によるヒューマノイド・スケートボードシステム全身制御2026/2/1
ヒューマノイドがスケートボード上で安定して動的に操縦するため、ボードとトラックの連成をモデル化し、AMPと物理誘導型のリーン・トゥ・ステア戦略を組み合わせた全身制御フレームワークを提案した。
- TextOp: テキストでリアルタイムに動くヒューマノイドの動作生成と制御ヒューマノイド制御2026/2/1
テキスト指示を逐次受け取りながら、上位の拡散モデルで動作軌道を生成し下位の追従制御で実機ヒューマノイドを動かす、対話的に指示変更できる枠組みを提案した。
- SAGE-LLM:ファジィCBF検証とグラフ構造知識検索による安全で汎用性の高いUAV意思決定LLMコントローラUAV意思決定/LLM制御/安全検証2026/2/1
UAVの動的意思決定において、LLMの出力をファジィ制御バリア関数で検証し、グラフ構造の知識検索でシーン適応を強化する、訓練不要の二層意思決定アーキテクチャを提案した。追跡・回避シナリオで安全性と汎化性能の向上を実証している。
- ヒューマノイドロボットのサッカースキル学習:段階的知覚-行動フレームワークsim2real2026/2/1
サッカースキル獲得を運動スキル獲得・知覚行動統合・sim-to-real転移の3段階に分解し、Unitree G1で多様な条件下でのキックを実現した研究。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- VLAモデルをアンチ探索として誘導:テスト時スケーリングによる安定化VLA2025/12/1
VLAモデルの推論時不安定性を、軽量な疑似カウント推定器で行動チャンクを検証し、最も確からしいものを選ぶテスト時スケーリング手法TACOで解決する。
- CompassNav: ナビゲーションにおける経路模倣から意思決定理解への転換ナビゲーション2025/10/1
視覚言語モデルによるナビゲーションを「経路の模倣」から「意思決定の理解」へと転換する新パラダイムを提案し、全行動にA*距離を注釈したデータセットとギャップ認識型ハイブリッド報酬で訓練した7Bエージェントが目標ナビゲーションでSOTAを達成した。
- 不確実性推定の統合による信頼性の高いLLMベースのロボットプランニングVLA2025/10/1
LLMによるロボットプランニングの不確実性を認識論的不確実性と内在的不確実性に分解し、さらにタスクの明確さと馴染み深さに細分して推定する手法CUREを提案し、キッチン操作と卓上整理の実験で実行結果との整合性が向上することを示した。
- FastUMI-100K:大規模UMI形式データセットによるデータ駆動型ロボットマニピュレーションの進展マニピュレーション2025/10/1
モジュール型ハードウェアと軽量トラッキングを備えたFastUMIシステムで収集した10万件超の家庭内タスク実演データセットを構築し、多様な模倣学習アルゴリズムで高い成功率を示した。
- Align-Then-stEer:統一潜在ガイダンスによる視覚-言語-行動モデルの適応VLA2025/9/1
VLAモデルを下流タスクに適応させる際、事前学習との行動分布のずれを統一潜在空間でのアライメントと生成過程のガイダンスで解消し、少ないデータで効率的に微調整する手法を提案。
- MLM: アーム付き四足ロボットのマルチタスク全身移動操作制御の学習移動操作2025/8/1
実世界とシミュレーションのデータを活用した強化学習フレームワークMLMを提案し、6自由度アーム付き四足ロボットが複数タスクの全身移動操作を自律的または遠隔操作で行えるようにした。
- EO-1: 汎用ロボット制御のためのオープンな統合身体性基盤モデルVLA2025/8/1
視覚・言語・行動を統合的に扱う基盤モデルEO-1と150万件のデータセットEO-Data1.5Mを提案し、多様なロボットでの長期的な器用マニピュレーションを実現した。
- KungfuBot:物理ベースのヒューマノイド全身制御による高ダイナミック技能の学習ヒューマノイド全身制御2025/6/1
人間のカンフーやダンスのような高速・高ダイナミックな動作を、物理制約を考慮した動作処理と適応的な追従カリキュラムでヒューマノイドに模倣させる全身制御フレームワークを提案し、Unitree G1で実機検証した。
- MoRE: 複雑地形におけるヒューマノイドの人間らしい歩容学習のための残差エキスパート混合歩行2025/6/1
複数の潜在残差エキスパートとマルチ識別器を組み合わせた強化学習により、深度カメラを用いて複雑地形を人間らしい歩容で移動し、歩容パターンを切り替えられるヒューマノイド制御を実現した。
- 生涯ロボット学習のための動的混合プログレッシブパラメータ効率エキスパートライブラリ生涯学習2025/6/1
低ランクエキスパートのライブラリを漸進的に構築し、軽量ルーターで動的に組み合わせることで、破滅的忘却を抑えつつ生涯にわたるロボット学習を効率化する手法を提案。
- Hume:視覚-言語-行動モデルにシステム2思考を導入VLA2025/5/1
価値誘導型の熟考(システム2)と軽量な反応型ポリシー(システム1)を組み合わせた二重システムVLAモデルを提案し、器用なロボット制御を実現した。
- 3次元変形物体の動的マニピュレーション:シミュレーション・ベンチマーク・学習戦略マニピュレーション2025/5/1
低次元ダイナミクスに基づく3Dロープ操作のシミュレーション環境とベンチマークを構築し、模倣学習と物理情報を組み合わせた拡散ポリシー(DIDP)を提案した。
- フローベース動画予測による汎用両腕基盤ポリシー両腕マニピュレーション2025/5/1
テキストからフロー、フローから動画への2段階ファインチューニングで動画予測を行い、軽量拡散ポリシーで両腕ロボットの行動を生成する基盤ポリシーを提案。
- AutoBio:デジタル生物学実験室におけるロボット自動化のためのシミュレーションとベンチマークsim2real2025/5/1
生物学実験室でのロボット自動化を評価するためのシミュレーションフレームワークとベンチマークAutoBioを提案し、言語誘導型マニピュレーションの課題を明らかにした。
- 左脳から右脳へ:視覚と言語によるナビゲーションのための適応的テキストドリーマーVLA2025/5/1
視覚と言語によるナビゲーション(VLN)において、LLMをベースに左脳(論理統合)と右脳(想像的予測)の二重分岐構造で将来の環境意味を言語形式で適応的に想像し、ナビゲーション専門モジュールと統合する手法を提案。R2Rベンチマークで少ないパラメータで最先端性能を達成。
- 上半身と下半身の敵対的学習によるヒューマノイドの全身運動制御歩行2025/4/1
上半身と下半身のポリシーを敵対的に学習させ、歩行と動作模倣を両立する全身制御フレームワークALMIを提案し、実機ヒューマノイドで検証した。
- 小さく考え、大きく行動する:生涯ロボットマニピュレーションのためのプリミティブプロンプト学習マニピュレーション2025/4/1
スキル間で共有されるプリミティブをプロンプトとして学習し、生涯にわたるロボットマニピュレーションを実現する手法を提案。
- MoMa-Kitchen: モバイルマニピュレーションにおけるアフォーダンスに基づく最終接近ナビゲーションのための10万件超ベンチマークモバイルマニピュレーション2025/3/1
キッチン環境でロボットが物体を掴むために最適な最終ナビゲーション位置を学習するための10万件超のデータセットとベンチマークを構築し、軽量なベースラインモデルNavAffを提案した。
- OpenFly: 空中視覚言語ナビゲーションのための包括的プラットフォームVLA2025/2/1
空中視覚言語ナビゲーションのための多様なレンダリングエンジンと自動データ収集ツールチェーンを統合したプラットフォームを提案し、10万軌道の大規模ベンチマークとキーフレーム重視のナビゲーションモデルを構築した。
- 動的バランスと強化学習による狭所でのヒューマノイド全身移動歩行2025/2/1
固有感覚のみを用い、ZMPに基づく動的バランス報酬と全身のactor-critic強化学習で、ヒューマノイドが狭い足場や予期せぬ障害物を安定して歩行できる手法を提案した。
- リーダーとフォロワー:軌道制約下でのインタラクティブ動作生成動作生成2025/2/1
ペアダンスの役割分担に着想を得て、テキストと軌道制約から2者間のインタラクティブな動作を生成する訓練不要のフレームワークを提案。
- SpatialVLA:視覚-言語-行動モデルのための空間表現の探求VLA2025/1/1
ロボット操作における空間理解の重要性に着目し、3D位置エンコーディングと適応的行動グリッドを導入した視覚-言語-行動基盤モデルSpatialVLAを提案。110万件の実世界ロボットデータで事前学習し、ゼロショットでの操作や新環境への適応を実現した。
- 強化学習によるUAV協調追跡逃避ゲームの自律的意思決定群制御2024/11/1
深層強化学習を用いて複数UAVの協調追跡逃避ゲームにおける自律的意思決定モデルを構築し、役割と目標の割り当てにより協調性とタスク効率を向上させた。
- G3Flow: 姿勢を考慮した汎化可能な物体操作のための生成的3Dセマンティックフローマニピュレーション2024/11/1
基盤モデルを活用して物体中心の動的な3Dセマンティック表現をリアルタイムに構築し、拡散ポリシーに組み込むことで、遮蔽下でも意味理解を可能にし、操作と物体間汎化を改善した。
- 選好整合拡散プランナによる四足歩行制御歩行2024/10/1
報酬ラベルなしの専門家データで拡散プランナをオフライン学習し、弱い選好ラベリングを用いたオンライン強化学習でロバスト性を高め、四足歩行の速度追従と実機ゼロショット転移を実現した。
- COHERENT: 大規模言語モデルによる異種マルチロボット協調システムマルチロボット協調2024/9/1
ドローン・ロボット犬・ロボットアームなど異種ロボットの協調を、LLMによる提案・実行・フィードバック・調整のループで計画するフレームワークを提案し、100タスクのベンチマークで従来手法を大きく上回った。
- FastUMI: スケーラブルでハードウェア非依存の汎用マニピュレーションインターフェースとデータセットマニピュレーション2024/9/1
ロボットアームの実世界データ収集を低コスト・ハードウェア非依存で実現するため、UMIを再設計したFastUMIを提案し、22タスク・1万軌跡超のデータセットを公開した。
- AlignBot: ユーザーのリマインダーに沿ったVLM駆動型家庭用ロボットのカスタマイズタスクプランニングVLA2024/9/1
家庭用ロボット向けに、微調整したLLaVA-7BをGPT-4oのアダプタとして用い、ユーザーのリマインダーを構造化指示に変換してカスタマイズされたタスク計画を生成するフレームワークを提案し、実環境実験で成功率86.8%を達成した。
- KOI: ハイブリッドキー状態ガイダンスによるオンライン模倣学習の加速模倣学習2024/8/1
視覚言語モデルとオプティカルフローで専門家軌道から意味的・動作的キー状態を抽出し、報酬推定を改善することでオンライン模倣学習の探索効率を高める手法を提案。
- 奥行きが効く:RGBベースの事前学習済み方策への奥行き情報注入による改善マニピュレーション2024/8/1
RGB入力のみで動作するロボット操作方策に、学習時のみRGB-Dを使う奥行き情報注入フレームワークを提案し、3D知覚能力を高めて細かい操作タスクの性能を向上させた。
- スコアに合わせて演じる:ロボットマニピュレーションのための段階誘導型動的マルチセンサ融合マルチモーダル融合2024/8/1
サブゴールで区切ったタスク段階を模倣学習に組み込み、予測した現在段階の細かい状態に応じて視覚・聴覚・触覚の優先度を動的に調整するマルチセンサ融合手法MS-Botを提案し、注ぎとキー溝付きペグ挿入で有効性を示した。
- 相互作用予測によるマニピュレーション学習マニピュレーション2024/6/1
初期・最終状態と言語指示から遷移フレームと操作対象物体を予測する事前学習手法MPIを提案し、実機・シミュレーションで従来手法を10〜64%上回る性能を達成した。
- 身体性マルチエージェント協調のための効率的なLLMグラウンディングに向けてマルチエージェント協調2024/5/1
LLMによるマルチエージェント協調計画において、強化学習のアドバンテージ関数を活用したフィードバックで自己改善を効率化するフレームワークReAdを提案。
- SAM-E: 視覚基盤モデルと系列模倣による身体性マニピュレーションマニピュレーション2024/5/1
大規模画像で事前学習されたSegment Anything (SAM) を基盤モデルとして活用し、ロボットデータで効率的に微調整することで、長期的な行動推論と汎化性能を高めたマニピュレーション手法を提案。
- 大規模アクションなし動画事前学習による実行可能な離散拡散ポリシーの学習VLA2024/2/1
人間のアクションなし動画で離散拡散モデルを事前学習し、少数のロボット動画で微調整することで、ロボットの行動ポリシーを効率的に学習する手法を提案。
- Kinematic-aware Prompting for Generalizable Articulated Object Manipulation with LLMs2023/11/1
- Affordance-Driven Next-Best-View Planning for Robotic Grasping2023/9/1
- Robust Quadrupedal Locomotion via Risk-Averse Policy Learning2023/8/1
- On the Value of Myopic Behavior in Policy Reuse2023/5/28