Danfei Xu
収録論文 80本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PrefPI: 選好ガイドによる分布外行動への誘導VLA2026/9/30
自己生成軌道への相対選好のみを用い、事前学習済み生成ロボット方策を初期の有効範囲を超えた行動へ反復的に誘導する枠組みを提案。拡散方策やVLAで実機の物体運搬高さを10.7cmから19.8cmへと大幅に変化させた。
- Opt2VLA: 接触の多いヒューマノイド全身マニピュレーションのための力認識型視覚-言語-行動モデルVLA2026/9/21
ヒューマノイドの全身操作において、VLAモデルが運動目標と接触力の指令を同時に予測し、強化学習ベースの全身制御器で追従する力認識型フレームワークを提案。軌道最適化で接触を考慮した訓練データを生成し、接触の多い3タスクで力の調整精度が向上することを示した。
- ロボット学習と制御のための世界行動モデル:サーベイVLA2026/9/13
未来の世界予測と実行可能な行動生成を統合したWorld-Action Models(WAMs)について、ロボティクス視点で分類・応用・評価・課題を整理したサーベイ。
- バッチ型ロボットポリシー配信のためのアクションチャンクスケジューリング群制御2026/8/1
複数のロボットにリモートGPUからポリシーを配信する際のスケジューリング問題を定式化し、ロボットごとのアクションチャンク消費速度の違いを考慮したスケジューリングアルゴリズムを提案。実機実験で最大18%のスループット向上を確認した。
- EgoWAM: 実世界の自己中心視点データによるピクセルを超えた世界行動モデル模倣学習/転移学習2026/7/1
自己中心視点の人間データからロボット操作を学習する際、世界の変化を予測する「世界行動モデル」の訓練信号として、ピクセルではなくDINO特徴や3Dフローを用いることで、人間からロボットへの転移性能が向上することを示した。
- 時間的比率によるビデオ行動汎化ギャップの理解と緩和VLA2026/7/1
ビデオ基盤モデルをロボット行動データで微調整すると構成的一般化能力が失われる問題を分析し、注意機構に基づく指標「時間的比率」を導入してその原因を解明し、推論時に適応的にガイドする手法を提案した。
- 静的入力・動的出力:移動物体操作のための反事実行動拡張マニピュレーション2026/7/1
静的物体のデモのみで訓練したポリシーを、テスト時の物体の動きに適応させる手法SIDOを提案。物体の未来位置予測と到達を分離し、反事実的な位置ずらしで行動を拡張する。
- 人間のデモから接触力ガイダンスを用いた器用操作の学習器用操作2026/7/1
人間のデモから物体に加わる力・トルク空間でガイダンスを作り、強化学習で長期的な器用操作を学習するフレームワークCHORDを提案。大規模ベンチマークで高い成功率を示し、実世界にも転移可能。
- 視覚運動制御のための対比的行動-画像事前学習視覚エンコーダ/事前学習/模倣学習2026/6/15
大規模な人間の第一人称ビデオから手のキーポイントを行動の代理として抽出し、対比学習でロボットの視覚エンコーダを事前学習する手法を提案。実機の器用操作タスクで既存手法を30%以上上回る性能を達成した。
- GRAFT: グラフベースのアフォーダンス転移と部品対応付けマニピュレーション2026/6/1
物体を部品ベースのグラフで表現し、幾何学的類似性に基づいてデモンストレーションから未見物体への操作転移を行う、ゼロショット操作転移手法を提案した。
- Human2Any: 制約を考慮した構成的プランニングによる人間からロボットへの転移操作学習/転移学習2026/6/1
人間の動画から物体間の相互作用の事前知識を学習し、ロボットの制約を考慮したプランニングと組み合わせることで、実ロボットのデモデータなしに多様なロボットへ操作スキルを転移するフレームワークを提案。
- 計画整合型トークン圧縮による長文脈自動運転自動運転2026/6/1
自動運転のためのモノリシックな視覚行動モデルにおいて、長期の文脈を圧縮する際に計画情報を活用するフレームワークを提案し、成功率を向上させた。
- T-Rex: 触覚反応型巧みな操作触覚/操作2026/6/1
触覚信号に動的に反応する操作を実現するため、大規模な触覚データセットと可変レートのMixture-of-Transformersアーキテクチャを導入し、12の操作タスクで成功率を大幅に向上させた。
- エネルギーに基づく合成的拡散プランニングプランニング2026/6/1
長期的なロボットタスクを解決するための合成的拡散プランナーを提案し、局所的な橋ポテンシャルの和を最小化するエネルギー的視点から、従来のヒューリスティックなステッチングが欠落していた境界反応項を導入し、効率的な推論を実現した。
- EgoEngine: 一人称人間ビデオから高忠実度の器用なロボットデモへ器用操作/データ生成2026/6/1
一人称視点の人間の操作ビデオを、ロボットが実行可能な高品質なデモデータに変換するフレームワークを提案。実ロボットデモなしで初のゼロショット視覚運動器用操作学習を実現。
- 見ながら学ぶ:ロボット模倣学習における能動的知覚のための拡散モデル模倣学習/能動的知覚2026/6/1
オクルージョンがある環境で、ロボットが行動予測と視点選択を同時に学習する模倣学習手法See2Actを提案。拡散モデルを用いて行動と視点を共同で最適化し、シミュレーションと実世界で性能を向上させた。
- SimFoundry: ポリシー学習と評価のためのモジュール式自動シーン生成sim2real2026/6/1
実世界のビデオからシミュレーション用のシーンを自動生成し、多様なバリエーションを作成してロボットポリシーの訓練と評価を行うシステムを提案。シミュレーションでの評価が実世界性能を強く予測し、訓練時のバリエーション追加が成功率を向上させることを示した。
- WARP: オフラインの人間デモからの学習のための全身リターゲティング全身操作/模倣学習2026/6/1
人間のデモからロボットの全身動作を正確に抽出するオフラインパイプラインを提案し、ゼロショットでの全身移動操作を実現した。
- 異方性可視性場による不確実性駆動の3Dガウシアンスプラッティング能動マッピング能動マッピング2026/5/1
3Dガウシアンスプラッティング(3DGS)の未観測領域の不確実性を定量化する異方性可視性場を導入し、能動マッピングを実時間で行うフレームワークを提案した。
- EgoVerse:世界各地から収集したロボット学習用の自己中心視点人間データセットデータセット/模倣学習2026/4/1
人間の自己中心視点のデモデータを大規模に収集・共有するプラットフォームとデータセットを構築し、人間データからロボットへの転移学習の大規模実験を行った。
- KinDER: ロボット学習と計画のための物理的推論ベンチマークベンチマーク2026/4/1
ロボットの物理的推論能力を評価するためのベンチマークKinDERを提案し、既存手法が多くの環境で課題を抱えることを示した。
- ReSteer: マルチタスクロボットポリシーの操縦可能性の定量化と改善マルチタスク学習2026/3/1
マルチタスクロボットポリシーが指示に従ってタスクを切り替える能力(操縦可能性)を定量化し、データ生成と自己改善により向上させるフレームワークを提案した。
- 推論時拡散スケーリングによる合成的視覚プランニングプランニング2026/3/1
短時間の動画拡散モデルを組み合わせて長時間のロボットプランを生成する際、ノイズ付き中間状態ではなく推定クリーンデータ(Tweedie推定)で境界整合性を強制する新しい推論手法を提案し、追加学習なしで未見の開始・目標組み合わせに一般化できることを示した。
- 上半身ヒューマノイドロボット遠隔操作のための閉形式幾何学的リターゲティング解法遠隔操作2026/2/1
人間の腕の向きにロボットアームを合わせることで、高速かつ高精度な遠隔操作を実現する閉形式解法SEW-Mimicを提案。
- EgoScale:多様な一人称視点ヒューマンデータによる器用なマニピュレーションのスケーリングマニピュレーション2026/2/1
2万時間超の一人称視点ヒューマン動画でVLAモデルを事前学習し、人間データ量と検証損失の対数線形則を発見。軽量な人間-ロボット中間学習により、22自由度ハンドの器用な操作成功率を54%向上させた。
- EgoAVFlow: 人間の一人称視点動画から3Dフローを介した能動視覚によるロボット方策学習VLA2026/2/1
人間の一人称視点動画から3Dフロー表現を共有して操作と能動視覚を学習し、ロボット実演なしで視点制御と操作を実現する手法を提案。
- 世界行動モデルはゼロショット方策であるVLA2026/2/1
動画拡散モデルを基盤に未来の世界状態と行動を予測するWorld Action Model「DreamZero」を提案し、実機でVLAを上回る汎化性能と7Hzのリアルタイム閉ループ制御を実現した。
- 誘導探索付き合成拡散による長期的計画計画2026/1/1
局所的な拡散モデルを組み合わせて長期タスクを計画する際のモード平均化問題を、拡散のノイズ除去過程に探索を組み込むことで解決し、ロボット操作や画像・動画生成で有効性を示した論文。
- 視覚-言語-行動モデルにおける人間からロボットへの転移の創発VLA2025/12/1
多様なロボットデータで事前学習したVLAモデルに人間の動画を共訓練すると、人間からロボットへのスキル転移が自然に生じることを示し、その要因が身体非依存の表現獲得にあると分析した。
- 反事実的VLA:適応的推論を備えた自己反省型視覚-言語-行動モデルVLA2025/12/1
自動運転VLAモデルが計画した行動を反事実的に推論して修正する自己反省フレームワークを提案し、軌道精度と安全性を向上させた。
- 参照データに基づくスキル発見スキル発見2025/10/7
参照データを用いて意味のある潜在空間でスキルを発見するRGSDを提案し、高次元ヒューマノイドの多様な動作生成とスタイル制御を実現した。
- シミュレーションと実機のポリシー共同学習のための汎化可能なドメイン適応sim2real2025/9/1
シミュレーションと少数の実機デモを組み合わせ、最適輸送に基づく損失でドメイン不変な特徴空間を学習し、実機でのマニピュレーション成功率を最大30%向上させる手法を提案。
- EMMA: 一人称視点の人間データでモバイルマニピュレーションをスケールさせるモバイルマニピュレーション2025/9/1
ロボットの遠隔操作なしに、人間の一人称視点の全身動作データと静的ロボットデータを共同学習させ、実世界のモバイルマニピュレーション方策を訓練するフレームワークEMMAを提案。
- モデルベースとモデルフリー拡散の統合による制約付き計画計画/拡散モデル2025/9/1
モデルフリー拡散プランナとモデルベース最適化モジュールを、追加学習なしで統合する生成モデリング枠組みJM2Dを提案し、安全制約下のロボット操作で性能と安全性を両立させた。
- EgoBridge: 一人称視点の人間データから汎化可能な模倣学習のためのドメイン適応模倣学習2025/9/1
人間の一人称視点データとロボットのデータ間の視覚・センサ・運動学的なギャップを、最適輸送に基づくドメイン適応でポリシーの潜在空間を揃えることで橋渡しし、実機の片腕・両腕マニピュレーションタスクで成功率を大幅に改善した。
- ImMimic: 人間動画からのドメイン横断模倣によるロボットマニピュレーション模倣学習2025/9/1
人間の動画と少量のロボット実演を組み合わせ、DTWとMixUp補間でドメインギャップを埋めてロボットのマニピュレーションを学習する枠組みを提案。
- ロボットマニピュレーションのための大規模データセット学習で重要な要素は何かマニピュレーション2025/6/1
大規模ロボットデータセットの構成を体系的に研究し、多様性の強調点と既存データからの効果的なデモンストレーション検索方法を明らかにした。
- SAIL: 模倣学習ポリシーのデモンストレーション超高速実行模倣学習2025/6/1
模倣学習ポリシーをデモより速く実行するためのシステムSAILを提案し、シミュレーションで最大4倍、実機で最大3.2倍の高速化を実現した。
- 視覚運動協調の予測学習視覚運動協調2025/3/1
一人称視点の映像と身体運動から頭部姿勢・視線・上半身の動きを予測する拡散ベースのモデルを提案し、大規模データセットで汎化性能を示した。
- 拡散モデルの合成による生成的な軌道スティッチング軌道計画2025/3/1
学習済みの短い軌道チャンクを双方向拡散モデルで合成的につなぎ合わせ、未見の長期的タスクを計画できる手法CompDiffuserを提案した。
- LoRA3D: 3D幾何学基盤モデルの低ランク自己校正3D再構成2024/12/1
スパースなRGB画像から3D幾何学基盤モデルを自己校正し、低ランク適応でシーンに特化させる手法を提案。単一GPUで5分以内に完了し、3D再構成と多視点姿勢推定で最大88%の性能向上を達成。
- EgoMimic: 一人称視点映像による模倣学習のスケーリング模倣学習2024/10/1
スマートグラスで撮影した一人称視点の人間の手の映像とロボットのデータを統合して模倣学習を行い、多様な長期的マニピュレーションタスクの性能と汎化を向上させるフレームワークを提案。
- RAIL: 到達可能性を活用した模倣学習による安全な方策実行模倣学習2024/9/1
模倣学習の方策に到達可能性ベースの安全フィルタを組み合わせ、ハード制約下での性能と安全性の関係を分析し、実機でリアルタイム動作を確認した。
- 生成的ファクターチェイニング:拡散モデルベースのファクターグラフによる協調マニピュレーションマニピュレーション2024/9/1
時空間ファクターグラフを拡散モデルで構成し、双方向メッセージパッシングで長期的な両手マニピュレーション計画を生成する手法を提案。
- Opt2Skill: 動的に実行可能な全身軌道を模倣する多様なヒューマノイド移動操作ヒューマノイド移動操作2024/9/1
モデルベースの軌道最適化と強化学習を組み合わせ、Digitヒューマノイドの全身移動操作を実現するパイプラインを提案。最適軌道を追従するRLポリシーを学習し、実機転移にも成功した。
- ロボティクスにおける深層生成モデル:マルチモーダル実演からの学習に関するサーベイ模倣学習2024/8/1
ロボットの実演学習に深層生成モデル(拡散モデルやGANなど)を活用する近年の研究を、モデル種別・応用・分布外汎化の観点から統一的に整理したサーベイ。
- 不確実性駆動型アクティブマッピングのためのニューラル可視性フィールドアクティブマッピング2024/6/1
NeRFの未観測領域で不確実性が高くなる性質をベイズネットワークでモデル化し、ロボットが次に見るべき情報量の多い視点を選べるようにしたアクティブマッピング手法を提案した。
- 最適化ベースのタスク・動作計画のサーベイ:古典的手法から学習ベース手法までタスク・動作計画2024/4/1
タスク計画と動作計画を統合するTAMPについて、最適化ベースの手法を古典的手法から学習ベース手法まで体系的にレビューしたサーベイ論文。
- Generative Skill Chaining: Long-Horizon Skill Planning with Diffusion Models2024/1/1
- C3DM: Constrained-Context Conditional Diffusion Models for Imitation Learning2023/11/1
- NOD-TAMP: Generalizable Long-Horizon Planning with Neural Object Descriptors2023/11/1
- Neural Field Dynamics Model for Granular Object Piles Manipulation2023/11/1
- Human-in-the-Loop Task and Motion Planning for Imitation Learning2023/10/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- MimicTouch: Leveraging Multi-modal Human Tactile Demonstrations for Contact-rich Manipulation2023/10/1
- Learning to Discern: Imitating Heterogeneous Human Demonstrations with Preference and Representation Learning2023/10/1
- Language-Guided Traffic Simulation via Scene-Level Diffusion2023/6/1
- Evolutionary Curriculum Training for DRL-Based Navigation Systems2023/6/1
- Zero-Shot Object Searching Using Large-scale Object Relationship Prior2023/3/1
- MimicPlay: Long-Horizon Imitation Learning by Watching Human Play2023/2/1
- Guided Conditional Diffusion for Controllable Traffic Simulation2022/10/1
- LEAGUE: Guided Skill Learning and Abstraction for Long-Horizon Manipulation2022/10/1
- ProgPrompt: Generating Situated Robot Task Plans using Large Language Models2022/9/1
- BITS: Bi-level Imitation for Traffic Simulation2022/8/1
- Generalizable Task Planning through Representation Pretraining2022/5/1
- Co-GAIL: Learning Diverse Strategies for Human-Robot Collaboration2021/8/1
- What Matters in Learning from Offline Human Demonstrations for Robot Manipulation2021/8/1
- Generalization Through Hand-Eye Coordination: An Action Space for Learning Spatially-Invariant Visuomotor Control2021/3/1
- Human-in-the-Loop Imitation Learning using Remote Teleoperation2020/12/1
- Deep Affordance Foresight: Planning Through What Can Be Done in the Future2020/11/1
- Learning to Generalize Across Long-Horizon Tasks from Human Demonstrations2020/3/1
- 6-PACK: Category-level 6D Pose Tracker with Anchor-Based Keypoints2019/10/1
- Regression Planning Networks2019/9/1
- Continuous Relaxation of Symbolic Planner for One-Shot Imitation Learning2019/8/1
- DenseFusion: 6D Object Pose Estimation by Iterative Dense Fusion2019/1/1
- Neural Task Graphs: Generalizing to Unseen Tasks from a Single Video Demonstration2018/7/1
- Neural Task Programming: Learning to Generalize Across Hierarchical Tasks2017/10/1
- Model-Driven Feed-Forward Prediction for Manipulation of Deformable Objects2016/7/1
- Multi-Sensor Surface Analysis for Robotic Ironing2016/2/1
- Folding Deformable Objects using Predictive Simulation and Trajectory Optimization2015/12/1