Xiaolong Wang
University of California, San Diego
収録論文 104本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FINGR: 実世界でのルービックキューブ解法のための巧みな手の制御学習マニピュレーション2026/9/27
指先基準の幾何表現と将来の接触・回転進捗を予測する補助タスクを組み合わせた方策を学習し、実機の巧みな手でルービックキューブの層回しを高成功率で実現した。
- 世界モデルによる汎化可能なロボット挿入マニピュレーション2026/9/23
手首カメラの視覚と固有感覚を統合した単一の世界モデルを最大90の挿入タスクで訓練し、未知形状の物体へのゼロショット挿入を実現した研究。
- Neverwhere ビジュアルパルクールベンチマークスイートsim2real2026/9/14
3Dガウススプラッティングで再構成した60以上の都市シーンからなる、視覚移動制御の閉ループ評価環境を構築し、多様なデータの必要性を示した。
- 離散的な心から連続的な行動へ:エンドツーエンド自動運転のための潜在整合プランニング自動運転2026/9/3
Vision-Language Modelの離散的な推論と自動運転の連続的な物理制約を橋渡しするため、潜在整合プランニングを備えたVLAフレームワークLaPlaを提案。量子化誤差を排除し、物理的に妥当な軌道を生成する。
- ReForce: 力覚を考慮した器用な操作のためのリターゲティング学習マニピュレーション2026/8/16
人間のデモからロボットの操作へ変換する際、運動学的なリターゲティングに加えて力の情報を考慮し、接触を再現する手法を提案。シミュレーションと実機で力追従誤差を低減し、多指接触を強化した。
- FACT: 失敗を考慮した因果的ワールドアクションモデル訓練VLA2026/8/1
ワールドアクションモデルに失敗データを組み込み、行動の結果を予測させることで、将来予測の偏りを減らし、操作タスクの性能を向上させる手法を提案した。
- EgoPhys: 一人称視点動画から変形物体の汎用的物理モデルを学習する変形物体/物理モデル/一人称視点2026/6/15
一人称視点のRGB動画のみから変形物体の物理デジタルツインを構築するフレームワークを提案し、未知物体へのゼロショット一般化を実現した。
- ConTrack: 適応的トレードオフ制御による拘束付き手の動作追跡模倣学習/強化学習2026/6/1
物体追跡を制約とし、残りの制御権を動作忠実度に割り当てる強化学習フレームワークを提案。長期的な接触豊富な手の動作追跡を安定化し、シミュレーションと実ロボットで精度を向上させた。
- TactX: 多様なセンサにわたる共有触覚表現の学習触覚2026/6/1
異なる原理の触覚センサ(抵抗、磁気、視覚)からのデータを共通の潜在空間に写像するフレームワークTactXを提案し、あるセンサで訓練した操作ポリシーを別のセンサへゼロショット転移できることを示した。
- 人間のデモンストレーションからロボットハンドを生成するロボットハンド設計2026/6/1
人間の指先動作データを用いて、ロボットハンドの設計を自動生成するデータ駆動型フレームワークを提案した。
- 世界モデルにおける幻覚は予測可能であり、防止可能である世界モデル2026/6/1
生成的世界モデルが幻覚を起こす現象を、データカバレッジの観点から分析し、幻覚を検出するシグナルと、それを用いたデータ収集・ファインチューニング手法を提案した論文。
- Lucid-XR: ロボット操作のための拡張現実データエンジンデータ生成/操作2026/5/1
XRヘッドセット上で動作する物理シミュレーションとビデオ生成を組み合わせ、多様な合成データを生成してロボットの視覚ポリシーを訓練し、実環境へのゼロショット転移を実現する。
- TacO: 物体操作のための触覚センサのベンチマーク触覚2026/5/1
物体操作における4種類の触覚センサ(視覚、音響、磁気、抵抗)の性能を、3つの操作タスクで系統的に評価し、タスクに適したセンサ選択の枠組みを提案した論文。
- EgoVerse:世界各地から収集したロボット学習用の自己中心視点人間データセットデータセット/模倣学習2026/4/1
人間の自己中心視点のデモデータを大規模に収集・共有するプラットフォームとデータセットを構築し、人間データからロボットへの転移学習の大規模実験を行った。
- トレース条件付きVLA計画による長期的操作マニピュレーション2026/4/1
長期的な操作タスクを、タスク管理VLMが現在の観察から残りの計画を予測し、視覚的トレースを実行VLAに提供することで、短期的なVLA実行を長期的な指示追従に拡張するフレームワークを提案。
- 人間とロボットの共同操縦によるデータ効率的な模倣学習模倣学習2026/4/1
限られたデモデータでロボットの模倣学習を行う際、人間の介入を効率的に取り入れるフレームワークを提案し、少ないデモで高い性能を達成した。
- 視覚言語行動モデルのためのクロスハンド潜在表現VLA/器用操作2026/3/1
多様な器用なロボットハンド間で共有可能な統一潜在行動空間を導入し、標準的なVLAアーキテクチャに組み込むことで、クロスエンボディメント学習を可能にするXL-VLAを提案した。
- 接触を考慮したニューラルダイナミクスsim2real2026/1/1
シミュレータの力学を触覚接触情報で補正するニューラルダイナミクスモデルを学習し、接触を伴うタスクのsim-to-realギャップを縮小する手法を提案。
- Dextraの家:器用なハンドのためのクロスエンボディド共同設計マニピュレーション2025/12/1
タスクに特化したハンドの形態と制御方策を同時に学習する共同設計フレームワークを提案し、24時間以内に新しいロボットハンドを設計・訓練・製作・展開できることを示した。
- 大規模マルチタスク世界モデルによる連続制御の学習マルチタスク強化学習2025/11/1
200の多様なタスクで言語条件付き世界モデルを事前学習し、オンライン強化学習で微調整することで、マルチタスク性能とデータ効率を向上させた研究。
- ACE-F: 力覚フィードバックを備えた異形態間対応の折りたたみ式巧みな遠隔操作システム遠隔操作2025/11/1
折りたたみ可能な遠隔操作システムACE-Fを提案し、逆運動学と人間-ロボットインターフェースで精密な操作を実現、エンドエフェクタの位置偏差を仮想力として力覚フィードバックを異形態ロボットに汎化した。
- パワーから精密へ:多指ロボットハンドのための微細な器用さの学習マニピュレーション2025/11/1
多指ハンドの指先形状を軽量に変更し、制御と形状を同時最適化することで、パワーグラスプと精密把持の両立を実現し、sim-to-realで高い成功率を示した。
- In-N-On: 野生データとタスク特化データで自己中心視マニピュレーションをスケールアップマニピュレーション2025/11/1
自己中心視データを「野生のデータ」と「タスク特化データ」に分類し、1000時間超の多様なデータで言語条件付きフローマッチング方策Human0を学習。人間とヒューマノイドのギャップを埋め、指示追従や少数ショット学習、ロバスト性向上を実現した。
- HMC:接触の多い移動操作のための異種メタ制御の学習移動操作2025/11/1
位置・インピーダンス・力制御をトルク空間で統合する枠組みを提案し、実機ヒューマノイドで接触を伴う拭き掃除や引き出し開けの成功率を大幅に改善した。
- VT-Refine: 視触覚フィードバックによる両手組立のシミュレーション微調整学習マニピュレーション2025/10/1
少数の実演と高忠実度の触覚シミュレーションを組み合わせ、強化学習で両手組立ポリシーを微調整することで、接触の多い精密作業の実世界性能を向上させた研究。
- 報酬モデルを用いたソフトハンドの設計学習ソフトロボティクス/設計最適化2025/10/1
遠隔操作データから報酬モデルを学習し、腱駆動ソフトロボットハンドの設計を効率的に最適化するCEM-RMフレームワークを提案。シミュレーションと実機で把持成功率が向上。
- GSWorld:ロボットマニピュレーションのための閉ループ写実的シミュレーションスイートsim2real2025/10/1
3Dガウシアンスプラッティングと物理エンジンを組み合わせ、実機データからの方策評価やsim2real学習を閉ループで行える写実的マニピュレーションシミュレータを提案。
- ManiFlow:一貫性フロー学習による汎用ロボットマニピュレーションポリシーマニピュレーション2025/9/1
視覚・言語・固有感覚入力を条件に、一貫性フロー学習で1〜2ステップの高精度なロボット動作生成を実現する汎用模倣学習ポリシーを提案。
- 巧みな触覚による物体姿勢推定触覚2025/9/1
強化学習でロボットハンドを能動的に動かして触覚データを収集し、物体の形状と姿勢を反復的に推定する手法を提案。
- EgoVLA:自己中心視点の人間動画から視覚-言語-行動モデルを学習VLA2025/7/1
一人称視点の人間動画でVLAモデルを訓練し、逆運動学とリターゲティングで人間の手の動きをロボット動作に変換、少数のロボット実演で微調整してロボットポリシーを獲得する手法を提案。
- GMT: ヒューマノイド全身制御のための汎用動作追従全身制御2025/6/1
多様な全身動作を実世界で追従できるよう、適応的サンプリングと動作Mixture-of-Expertsを組み合わせた単一の汎用方策を学習するフレームワークを提案。
- Dex1B: 10億件のデモンストレーションによる巧みな手の操作学習マニピュレーション2025/6/1
生成モデルを用いて把持と関節操作の10億件のデモンストレーションを生成し、シミュレーションと実機で従来手法を上回る性能を示した。
- ニューラル物理モデルを用いたソフトグリッパのコデザインソフトロボティクス/グリッパ設計2025/5/1
シミュレーションで学習したニューラル物理モデルを最適化ループに組み込み、ソフトグリッパの剛性分布と把持姿勢を同時に設計する手法を提案し、3Dプリントした実機で有効性を示した。
- AMO: 超柔軟ヒューマノイド全身制御のための適応運動最適化全身制御2025/5/1
シミュレーションから実機への強化学習と軌道最適化を統合し、29自由度のヒューマノイドでリアルタイム全身制御を実現した研究。
- M3: 3D空間マルチモーダルメモリ3D表現/マルチモーダル2025/3/1
3Dガウシアンスプラッティングと基盤モデルを統合し、動画から静的な屋内シーンのマルチモーダルな特徴表現を効率的に保持・描画するメモリシステムを提案。四足歩行ロボットへの実装も行った。
- ヒューマノイド方策~ヒューマン方策VLA2025/3/1
一人称視点の人間の操作データをヒューマノイドロボットの学習に活用するため、人間とロボットの状態行動空間を統合したHuman Action Transformer (HAT)を提案し、汎化性能とロバスト性を向上させた。
- LMMプランナと3Dスキルポリシーの統合による汎用マニピュレーションマニピュレーション2025/1/1
大規模マルチモーダルモデルによる高レベル計画と3D特徴場を用いた低レベル制御を統合し、実環境のキッチンで長期的タスクの成功率を向上させたフレームワークLMM-3DPを提案。
- NaVILA: 脚式ロボットのための視覚-言語-行動モデルによるナビゲーションVLA2024/12/1
脚式ロボットの視覚言語ナビゲーションにおいて、VLAモデルで「75cm前進」のような中間行動を生成し、それを強化学習による歩行ポリシーで実行する2階層フレームワークを提案した論文。
- Mobile-TeleVision: 予測的動作プライアによるヒューマノイド全身制御全身制御2024/12/1
上半身の精密操作をIKと動作リターゲティングで、下半身の歩行を強化学習で分離制御し、CVAEによる予測的動作プライアで両者を統合したヒューマノイド遠隔操作手法を提案。
- ExBody2: 高度で表現豊かなヒューマノイド全身制御全身制御2024/12/1
人間のモーションキャプチャとシミュレーションデータで全身追従制御器を学習し、実機に転移することで、ヒューマノイドが歩行・しゃがみ・ダンスなどの表現豊かな動きを安定して行えるようにした研究。
- SPOT: 物体中心操作のためのSE(3)姿勢軌道拡散模倣学習2024/11/1
物体のSE(3)姿勢軌道をタスク表現として用い、拡散ポリシーを条件付ける物体中心模倣学習フレームワークを提案。iPhoneで撮影した8つの実演のみで実世界タスクを制約遵守しつつ完遂した。
- WildLMa: 実環境における長期的な移動マニピュレーション移動マニピュレーション2024/11/1
四足歩行ロボットにマニピュレータを搭載し、VR遠隔操作と模倣学習による汎用スキル、LLMプランナを組み合わせて、実世界での長期的な移動マニピュレーションを実現した研究。
- お手伝いわんちゃんボット:脚式ロボットと視覚言語モデルによるオープンワールド物体取得マニピュレーション2024/10/1
四足歩行ロボットにグリッパと視覚言語モデルを組み合わせ、未知の屋内環境で指示に従って物を取ってくるシステムを実現した。
- 脚による視覚マニピュレーションマニピュレーション2024/10/1
四足ロボットが脚を使って物体を操作できるシステムを開発し、強化学習による視覚操作方策と歩行・操作コントローラを組み合わせて、シミュレーションと実機で物体の姿勢合わせを実現した。
- HOVER: ヒューマノイドのための汎用全身制御ニューラルコントローラヒューマノイド全身制御2024/10/1
全身の運動模倣を共通の抽象表現として活用し、ナビゲーションや卓上操作など複数の制御モードを単一の方策に蒸留統合したヒューマノイド全身コントローラを提案した。
- GraspSplats: 3D特徴スプラッティングによる効率的なマニピュレーションマニピュレーション2024/9/1
ガウススプラッティングと深度教師あり学習を用いて60秒未満で高品質な3Dシーン表現を構築し、VLMと組み合わせてロボットのゼロショット把持や動的物体操作を実現する手法を提案。
- ACE:低コストな器用テレオペレーションのためのクロスプラットフォーム視覚外骨格システムテレオペレーション2024/8/1
手の3D姿勢をカメラと外骨格で捉え、人型ハンドやグリッパなど多様なロボットに汎用できる低コストなテレオペレーションシステムを開発した。
- Open-TeleVision: 没入型アクティブ視覚フィードバックによる遠隔操作遠隔操作2024/7/1
操作者がロボットの周囲を立体的に知覚し、腕と手の動きがロボットに反映される没入型遠隔操作システムを提案し、2種類のヒューマノイドで模倣学習データを収集して実世界で検証した。
- ペンを回す学習から得られた教訓マニピュレーション2024/7/1
シミュレーションで強化学習と軌道データを生成し、実世界で微調整することで、ペンのような物体を手の中で回転させる技能を習得した研究。
- Bunny-VisionPro:模倣学習のためのリアルタイム両手巧みな遠隔操作遠隔操作2024/7/1
VRヘッドセットと低コスト触覚フィードバックデバイスを用いて、両手巧みな遠隔操作をリアルタイムで実現し、模倣学習の性能を向上させるシステムを提案。
- 大規模ヒューマンデータを用いた自動運転レースのシミュレーションベンチマーク自動運転レース2024/7/1
Assetto Corsaをベースに自動運転レースアルゴリズムを評価するシミュレーションプラットフォームを構築し、強化学習やMPCのベンチマークと人間ドライバーのデータセットを公開した。
- 潜在空間アライメントによる異形態ロボットマニピュレーションスキルの転移マニピュレーション2024/6/1
異なる形態のロボット間で制御方策を転移するため、状態と行動を共通の潜在空間に射影し、敵対的学習とサイクル整合性でターゲットのエンコーダ・デコーダを訓練する手法を提案。sim-to-simおよびsim-to-realで有効性を実証。
- 階層型ワールドモデルによる視覚ベース全身ヒューマノイド制御全身制御2024/5/1
視覚観測から56自由度ヒューマノイドの全身制御を強化学習で実現するため、高レベルエージェントが視覚に基づきコマンドを生成し低レベルエージェントが実行する階層型ワールドモデルを提案した。
- DNAct: 拡散モデル誘導によるマルチタスク3Dポリシー学習マニピュレーション2024/3/1
ニューラルレンダリングによる事前学習と拡散モデルによる訓練を組み合わせ、言語条件付きマルチタスク操作ポリシーを少ない実演から学習する手法を提案。
- 触覚強化学習による未知物体のSim2Realマニピュレーションsim2real2024/3/1
多様な物体をシミュレータ上で触覚入力を用いた強化学習により訓練し、未知物体への汎化と実機転移を実現する手法を提案。
- 脚式ロコマニピュレーションのための視覚的全身体制御ロコマニピュレーション2024/3/1
脚とアームを同時に制御する全身体制御を視覚入力のみで行う階層型フレームワークを提案し、シミュレーションで訓練して実機に転移、多様な物体の把持を実現した。
- モバイルマニピュレーションのための汎化可能な特徴場の学習モバイルマニピュレーション2024/3/1
移動と操作の両方に使える統一的なシーン表現として、リアルタイムで動作する汎化可能なニューラル特徴場GeFFを提案し、四足歩行ロボットで物体・部位レベルの操作と意味認識ナビゲーションを実証した。
- Expressive Whole-Body Control for Humanoid Robots2024/2/1
- CyberDemo: Augmenting Simulated Human Demonstration for Real-World Dexterous Manipulation2024/2/1
- DexTouch: Learning to Seek and Manipulate Objects with Tactile Dexterity2024/1/1
- Robot Synesthesia: In-Hand Manipulation with Visuotactile Sensing2023/12/1
- Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis2023/12/1
- Harmonic Mobile Manipulation2023/12/1
- TD-MPC2: Scalable, Robust World Models for Continuous Control2023/10/1
- GenSim: Generating Robotic Simulation Tasks via Large Language Models2023/10/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Generalized Animal Imitator: Agile Locomotion with Versatile Motion Prior2023/10/1
- Finetuning Offline World Models in the Real World2023/10/1
- Dynamic Handover: Throw and Catch with Bimanual Hands2023/9/1
- GNFactor: Multi-Task Real Robot Learning with Generalizable Neural Feature Fields2023/8/1
- Elastic Decision Transformer2023/7/5
- AnyTeleop: A General Vision-Based Dexterous Robot Arm-Hand Teleoperation System2023/7/1
- DexArt: Benchmarking Generalizable Dexterous Manipulation with Articulated Objects2023/5/1
- ContactArt: Learning 3D Interaction Priors for Category-level Articulated Object and Hand Poses Estimation2023/5/1
- Neural Volumetric Memory for Visual Locomotion Control2023/4/1
- Rotating without Seeing: Towards In-hand Dexterity through Touch2023/3/1
- On Pre-Training for Visuo-Motor Control: Revisiting a Learning-from-Scratch Baseline2022/12/1
- Policy Adaptation from Foundation Model Feedback2022/12/1
- MoDem: Accelerating Visual Model-Based Reinforcement Learning with Demonstrations2022/12/1
- DexPoint: Generalizable Point Cloud Reinforcement Learning for Sim-to-Real Dexterous Manipulation2022/11/1
- MonoNeRF: Learning Generalizable NeRFs from Monocular Videos without Camera Pose2022/10/1
- Visual Reinforcement Learning with Self-Supervised 3D Representations2022/10/1
- Self-Supervised Geometric Correspondence for Category-Level 6D Object Pose Estimation in the Wild2022/10/1
- Learning Continuous Grasping Function with a Dexterous Hand from Human Demonstrations2022/7/1
- Graph Inverse Reinforcement Learning from Diverse Videos2022/7/1
- Category-Level 6D Object Pose Estimation in the Wild: A Semi-Supervised Learning Approach and A New Dataset2022/6/1
- Coordination-free Multi-robot Path Planning for Congestion Reduction Using Topological Reasoning2022/5/1
- From One Hand to Multiple Hands: Imitation Learning for Dexterous Manipulation from Single-Camera Teleoperation2022/4/1
- Learning Generalizable Dexterous Manipulation from Human Grasp Affordance2022/4/1
- Temporal Difference Learning for Model Predictive Control2022/3/1
- Look Closer: Bridging Egocentric and Third-Person Views with Transformers for Robotic Manipulation2022/1/1
- Vision-Guided Quadrupedal Locomotion in the Wild with Multi-Modal Delay Randomization2021/9/1
- DexMV: Imitation Learning for Dexterous Manipulation from Human Videos2021/8/1
- Learning Vision-Guided Quadrupedal Locomotion End-to-End with Cross-Modal Transformers2021/7/1
- Stabilizing Deep Q-Learning with ConvNets and Vision Transformers under Data Augmentation2021/7/1
- Single RGB-D Camera Teleoperation for General Robotic Manipulation2021/6/1
- DAIR: Disentangled Attention Intrinsic Regularization for Safe and Efficient Bimanual Manipulation2021/6/1
- Learning Cross-Domain Correspondence for Control with Dynamics Cycle-Consistency2020/12/1
- Fast ORB-SLAM without Keypoint Descriptors2020/8/1
- Self-Supervised Policy Adaptation during Deployment2020/7/1
- State-Only Imitation Learning for Dexterous Manipulation2020/4/1
- Evolutionary Population Curriculum for Scaling Multi-Agent Reinforcement Learning2020/3/1
- Multi-Task Reinforcement Learning with Soft Modularization2020/3/1
- Visual Semantic Navigation using Scene Priors2018/10/1