Xiaofan Li
収録論文 17本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GaussianWAM: 3Dガウス場から世界行動モデルへの幾何学と意味の蒸留VLA2026/8/25
多視点観測から3Dガウス場を介して幾何・意味情報を世界行動モデルに蒸留し、ロボット操作の視覚予測と行動生成を強化する手法を提案。
- SoftVTBench: 変形を考慮した視覚触覚データセットと変形物体操作のベンチマーク変形物体操作/データセット/ベンチマーク2026/8/19
変形物体操作の物理的相互作用品質を評価するため、視覚触覚データセットと閉ループベンチマークを構築し、変形許容度を考慮した成功率を提案した。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステムロボットポリシー評価2026/8/1
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減した。
- RoboDojo: 汎用ロボット操作ポリシーの包括的評価のための統合シミュレーション・実世界ベンチマークベンチマーク2026/7/1
シミュレーションと実世界の両方で汎用ロボット操作ポリシーを評価するための統一ベンチマークを提案し、42のシミュレーションタスクと18の実世界タスクで多様な能力を評価する。
- SoftVTBench: 物理的制約下での変形物体操作のための安全性を考慮した視覚触覚ベンチマークベンチマーク/変形物体操作/触覚2026/7/1
変形物体の操作において、タスク完了だけでなく物理的安全性(落下や過度な変形の回避)を評価するベンチマークを提案し、触覚センシングが安全性向上に寄与することを示した。
- MemoryWAM: 持続的メモリによる効率的な世界行動モデリングマニピュレーション2026/6/1
ロボット操作のための世界行動モデルに、最近のフレーム、イベント境界アンカーフレーム、長期履歴を要約するコンパクトなgistトークンを組み合わせたハイブリッドメモリ設計を導入し、長期的な記憶依存タスクを効率的に処理する手法を提案した。
- GaussianDream: ロボット操作のためのフィードフォワード3Dガウス世界モデルVLA/世界モデル2026/5/1
本論文は、ロボット操作のためのフィードフォワード型3Dガウス世界モデルを提案し、現在の3D空間構造と短期的な未来の進化を捉えることで、行動生成の精度を向上させる。
- UniLab: GPU中心パラダイムを超えたロボット強化学習のためのヘテロジニアスアーキテクチャ強化学習/システムアーキテクチャ2026/5/1
CPUシミュレーションとGPU学習を分離したヘテロジニアスな強化学習システムUniLabを提案し、GPUシミュレーションに依存せずに3〜10倍の学習効率向上を実証した。
- 生成モデルは空間を理解している:暗黙の3D事前知識を活用したシーン理解VLA2026/3/1
動画生成モデルが内部に持つ暗黙の3D構造・物理の事前知識を抽出し、マルチモーダル大規模言語モデルに組み込むことで、明示的な3D教師なしに空間推論や操作タスクの性能を高めるフレームワークVEGA-3Dを提案した。
- ManipArena:推論指向の汎用ロボットマニピュレーションの実世界包括評価マニピュレーション2026/3/1
実機ロボットでのマニピュレーション汎化を公平に評価するため、20タスク・1万超の専門家軌道・約188時間分のデータを備えた標準化ベンチマークを構築し、VLAやワールドアクションモデルなど7構成を比較した。
- 水中ロボットの身体化知能:計画・制御・展開における制約連成の視点水中ロボット2026/3/1
水中ロボットの自律性を阻む物理的制約(流体力学的不確実性、部分観測性、通信帯域、エネルギー制約)が相互に連成する問題を整理し、強化学習や信念計画、ハイブリッド制御などの最新手法を統合するレビュー論文。
- プロンプトから印刷可能モデルへ:オフセット直接選好最適化によるサポート効率の良い3D生成3D生成2025/11/1
テキストから3Dモデルを生成する際に、サポート材の使用量を抑えるよう直接選好最適化(ODPO)を組み込み、印刷しやすさとプロンプト忠実度を両立させたフレームワークSEGを提案。
- EasyUUV:LLMを活用したUUV姿勢制御のための汎用・軽量sim-to-real強化学習フレームワークsim2real2025/10/1
並列強化学習と適応S-Surface制御を組み合わせ、マルチモーダルLLMで実行時にパラメータを調整するUUV姿勢制御フレームワークを提案し、実機実験で有効性を検証した。
- U-ViLAR: 不確実性を考慮した自動運転向け視覚自己位置推定自己位置推定2025/7/1
視覚情報をBEV空間に変換し、知覚・位置推定の不確実性を考慮した対応付けと位置合わせを組み合わせることで、GNSSが不安定な都市環境でも高精度に自己位置を推定するフレームワークを提案。
- Ocean Diviner: 拡散モデル強化強化学習によるAUVの堅牢な水中制御フレームワーク強化学習/水中ロボティクス2025/7/1
拡散モデルで実現可能な行動を生成し強化学習と組み合わせることで、動的で不確実な水中環境におけるAUVの制御を高精度かつ堅牢にする手法を提案した。
- DriVerse: マルチモーダル軌跡プロンプトとモーション整合による運転シミュレーション用ナビゲーション世界モデル運転シミュレーション/世界モデル2025/4/1
単一画像と将来の軌跡から運転シーン動画を生成する世界モデル。軌跡をテキスト化し2Dモーションプライアとして与え、動き整合モジュールで時間的一貫性を高める。
- 潜在世界モデルから複数の確率的決定を学習する自動運転フレームワーク自動運転/世界モデル2024/9/1
自動運転において、自己回帰型世界モデルから混合分布を用いて複数の確率的仮説を生成し、決定論的な制御信号を導出するLatentDriverを提案。Waymaxベンチマークで強化学習・模倣学習を上回る専門家レベルの性能を達成した。