Xiu Li
収録論文 23本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- V-JEPAポリシー:予測的視覚潜在表現上に構築する効果的な世界行動モデルVLA2026/9/29
凍結したV-JEPA 2.1エンコーダの潜在空間上に世界行動モデルを構築し、将来潜在予測器とフローマッチング行動エキスパートを下流で一括学習することで、LIBERO等で競争力のある性能を達成した研究。
- EMERGE-Policy: ロボットの心は単一ポリシーを超えて出現するVLA2026/8/30
複数の専門エージェントが協調して知覚・推論・検証・記憶を行うグラフ構造のエージェントフレームワークを提案し、追加のファインチューニングなしでベンチマークと実ロボット実験で高い性能を達成した。
- VidForensics-M1: 検証可能な時間的接地を用いたメタ検出強化学習によるAI生成ビデオ鑑識ビデオ鑑識2026/8/11
AI生成ビデオ検出のための新しいメタ検出強化学習フレームワークを提案し、時間的接地を証拠として利用することで、ラベル予測と証拠の統合を強化し、未見の生成モデルへの一般化を向上させた。
- KAM-WM: 潜在世界モデルからの運動学的アフォーダンスマップによるロボット操作マニピュレーション2026/7/1
凍結したビデオ世界モデルから粗い方向性の相互作用手がかりを抽出し、拡散ポリシーを条件付ける運動学的アフォーダンスマップを生成するフレームワークを提案。LIBEROとRoboTwin2.0で高い成功率を達成した。
- PhysEditWorld: 物理編集可能なワールドモデル向け大規模データセットデータセット2026/6/25
ゲームワールドモデルの物理ダイナミクスを制御可能にするため、重力パラメータを明示的に付与した大規模マルチモーダルデータセットを構築した。
- 意味論と幾何学的接地の分離:言語条件付き模倣学習のための空間的視覚プロンプト模倣学習2026/6/1
言語条件付きロボット操作において、意味推論と空間制御を分離し、視覚基盤モデルで生成した空間的視覚プロンプトを行動生成器に注入する新しいアーキテクチャSVP-ILを提案。少ないデモデータでも高精度を達成した。
- ELAN4D: 身体中心の4D監視による視覚言語行動モデルのプラグアンドプレイ適応VLA2026/5/1
ロボットのキーポイントの未来の3D軌跡を予測する補助分岐をVLAモデルに追加し、外乱下での汎化性能を向上させるフレームワークを提案した。
- PRTS: 対比表現を用いたプリミティブ推論とタスク実行システムVLA2026/4/1
視覚言語行動モデルを、教師あり模倣学習ではなく目標条件付き強化学習として再構成し、言語指示を目標として扱うことで、物理的な到達可能性を評価する統一埋め込み空間を学習する基盤モデルを提案した。
- ST-BiBench:双腕身体性タスクにおけるマルチストリーム・マルチモーダル協調のMLLMベンチマークVLA2026/2/1
双腕ロボットの身体性タスクを対象に、マルチモーダル大規模言語モデルの時空間的なマルチストリーム協調能力を評価する多層ベンチマークST-BiBenchを提案し、30以上のモデルを評価して高次推論と細粒度実行の乖離を明らかにした。
- MIND-V: 物理整合のための強化学習を用いた階層型ワールドモデルによる長期的ロボットマニピュレーションワールドモデル2025/12/1
認知科学に着想を得た階層型ワールドモデルMIND-Vを提案し、物理的に妥当で論理的に一貫した長期的ロボット操作動画を合成する。強化学習による物理整合でSOTAを達成。
- VLAモデルをアンチ探索として誘導:テスト時スケーリングによる安定化VLA2025/12/1
VLAモデルの推論時不安定性を、軽量な疑似カウント推定器で行動チャンクを検証し、最も確からしいものを選ぶテスト時スケーリング手法TACOで解決する。
- 一点ではなく面で捉える:ロボットタスクの空間グラウンディングのための適応的アフォーダンスヒートマップによる不確実性の表現VLA2025/10/1
空間的な目標を離散的な点ではなく連続的なアフォーダンスヒートマップとして表現し、不確実性を捉えることで、実世界のマニピュレーション成功率82%と最大50倍の高速化を実現したフレームワークRoboMAPを提案。
- CGoT:合成可能な思考グラフを用いた身体性マルチエージェントシステムのための新規推論機構VLA2025/10/1
自動運転車がサービスロボットを目的地まで運び、ロボットがタスクを行う協調システムにおいて、LLMを活用した合成可能な思考グラフ(CGoT)による推論機構を提案し、その性能を実験的に検証した。
- Align-Then-stEer:統一潜在ガイダンスによる視覚-言語-行動モデルの適応VLA2025/9/1
VLAモデルを下流タスクに適応させる際、事前学習との行動分布のずれを統一潜在空間でのアライメントと生成過程のガイダンスで解消し、少ないデータで効率的に微調整する手法を提案。
- VLP: 身体性マニピュレーションのための視覚言語選好学習マニピュレーション2025/2/1
人間の選好ラベルなしで視覚言語選好モデルを学習し、身体性マニピュレーションタスクの報酬設計を自動化するフレームワークを提案。
- UW-SDF: 水中多視点単眼画像からのニューラルSDF再構成のためのハイブリッド幾何事前分布の活用3D再構成/NeRF/SDF2024/10/1
水中の多視点画像からニューラルSDFを用いて物体を3D再構成するフレームワークを提案し、ハイブリッド幾何事前分布とSAMを活用した少数ショット多視点セグメンテーションで高精度・高効率を実現した。
- SkillMimic: デモンストレーションからバスケットボールのインタラクションスキルを学習模倣学習2024/8/1
人間と物体のインタラクションを模倣する統一的な報酬設計で、バスケットボールのドリブル・レイアップ・シュートなど多様なスキルを単一の方策で学習し、スキル遷移や長期タスクも可能にした研究。
- SAM-E: 視覚基盤モデルと系列模倣による身体性マニピュレーションマニピュレーション2024/5/1
大規模画像で事前学習されたSegment Anything (SAM) を基盤モデルとして活用し、ロボットデータで効率的に微調整することで、長期的な行動推論と汎化性能を高めたマニピュレーション手法を提案。
- 身体性マルチエージェント協調のための効率的なLLMグラウンディングに向けてマルチエージェント協調2024/5/1
LLMによるマルチエージェント協調計画において、強化学習のアドバンテージ関数を活用したフィードバックで自己改善を効率化するフレームワークReAdを提案。
- Robust Quadrupedal Locomotion via Risk-Averse Policy Learning2023/8/1
- MHER: Model-based Hindsight Experience Replay2021/7/1
- Bias-reduced Multi-step Hindsight Experience Replay for Efficient Multi-goal Reinforcement Learning2021/2/1
- Wasserstein Distance guided Adversarial Imitation Learning with Reward Shape Exploration2020/6/1