Yilun Du
Harvard
収録論文 98本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SyncWorld: 視覚キャリブレーションによるワールドモデルのゼロショットシミュレータ化ワールドモデル/シミュレーション2026/9/8
ロボットの行動と視覚変化の対応を視覚キャリブレーションで文脈的に指定することで、未見環境でも追加学習なしに行動結果を正確にシミュレートできるワールドモデルを提案した。
- Hydra-0: 汎用世界モデリングと制御のためのアクションフロー世界モデル2026/8/18
ロボットの動作をピクセル運動として表現するアクションフローを用いた汎用世界モデルを提案し、動作誤差を大幅に低減し、ゼロショット合成やデータ効率的な適応を実現した。
- Bスプライン方策:Bスプライン行動表現による操作方策の高速化マニピュレーション2026/7/1
離散時刻の行動チャンクの代わりにBスプライン曲線で行動を表現し、操作方策の実行を高速化する手法を提案した論文。
- ロボット計画のための構造化4D潜在予測モデル計画/ビデオ予測2026/7/1
ロボットの計画に使うため、観測とテキスト指示に基づいてシーンの3D構造の進化を潜在空間で予測するモデルを提案し、将来のシーンを生成して行動に変換する。
- 視覚運動ポリシー学習のための順序付きアクショントークンVLA2026/7/1
ロボットの連続的なアクションを離散トークンに変換する際、高圧縮・完全復号可能・順序性を満たす新しいトークナイザーOATを提案し、複数のベンチマークで有効性を示した。
- マスク視覚アクションによる統一世界モデリング世界モデル2026/7/1
ロボットの行動をビデオのピクセル空間で表現する新しいインターフェースを導入し、少量のデータで学習したモデルが将来予測や逆モデリングを実現する。
- ワールドアクションプランナー:行動条件付きワールドモデルによる汎用意思決定VLA/計画2026/7/1
視覚言語モデルとマルチタスクのポーズ画像条件付きワールドモデルを組み合わせ、初期行動計画を提案し、想像上のロールアウトを最適化・探索で反復改良するロボット計画システムを提案。構成タスクや新規レイアウト、ゼロショット汎化で既存のVLAやWAMを上回る性能を示した。
- DriftWorld: ドリフトによる高速ワールドモデリングワールドモデル2026/7/1
拡散ベースのワールドモデルは推論時の反復サンプリングが遅いため、ロボットの行動計画に必要な多数のロールアウト生成がボトルネックとなる。本論文では、訓練中に行動条件付きドリフトを学習し、単一の順伝播で未来フレームを生成できるDriftWorldを提案し、拡散ベースのベースラインより平均17倍高速で、複数の操作ベンチマークで最先端の意思決定性能を達成した。
- テスト時生成ビデオ推論のための時間的バックトラッキング探索ビデオ生成/推論2026/6/11
ビデオ生成モデルの推論を改善するため、時間軸上で生成・検証・再開を繰り返すTBS法を提案し、単発生成やBoNサンプリングより高い成功率を達成した。
- IMPACT: 力強いロボット操作のための内部モデル予測制御の学習マニピュレーション2026/6/9
力強い操作タスクをタスク計画と内部モデル予測制御に分離するフレームワークを提案し、シミュレーションと実世界で成功率と汎化性を向上させた。
- 日常の人間ビデオを用いたロボット操作ポリシーの共学習で重要な要素は何か?操作学習2026/6/4
ロボット操作ポリシーの共学習に日常の人間ビデオを用いる際、手のポーズの品質とネットワークの専門化が重要であることを示し、低ロボットデータ環境で成功率を29.7%向上させるレシピを提案した。
- 一度触れるだけ:単一触覚接触からの6自由度物体姿勢推定触覚/姿勢推定2026/6/1
視覚が使えない状況でも、2点の同時触覚接触から物体の6自由度姿勢を推定するシステムYOTOを提案。接触を点群として物体表面に位置合わせし、閉形式解法で姿勢を復元する。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- スペクトル分解による階層的ポリシー学習マニピュレーション2026/6/1
ロボットの行動系列をスペクトル分解し、低周波成分で大まかな動き、高周波成分で精密な調整を捉える階層的ポリシーを提案。シミュレーションと実機で精密操作タスクの性能を向上させた。
- CoStream: 単純な行動の合成による汎用的な複雑操作の実現マニピュレーション2026/6/1
複雑な操作タスクを、基盤モデルと多様なセンシングを組み合わせた複数の単純な行動(意味的・予測的・反応的)に分解し、それらをSE(3)インターフェース上で合成することで、高精度と汎用性を両立するフレームワークを提案した。
- GEM-4D: ロボット操作のための幾何学強化ビデオワールドモデルVLA2026/5/1
ビデオ生成モデルに4次元対応関係の教師信号を注入し、外観と幾何構造を同時に学習させることで、物理的に一貫した未来予測とロボット操作への直接適用を可能にした。
- まず計画、その後拡散:長期的拡散計画のための外部グラフガイダンス拡散計画2026/5/1
拡散モデルによる長期計画において、ノイズ除去プロセスの外部で状態空間グラフ上の計画を先に計算し、その計画で単一軌道のノイズ除去を導くことで、探索の負担を軽減し、未見のタスクや低品質データでも性能を向上させる手法を提案した。
- ロボット学習のためのワールドモデル:包括的サーベイサーベイ2026/5/1
ロボット学習におけるワールドモデルの役割と進化を体系的にレビューし、ポリシー学習、シミュレーション、評価への応用や課題を整理したサーベイ論文。
- 世界行動検証器:順方向・逆方向の非対称性による自己改善型世界モデル世界モデル2026/4/1
世界モデルが自身の予測誤差を検出し自己改善するフレームワークWAVを提案。状態の妥当性と行動の到達可能性を分離検証し、順方向・逆方向の非対称性を活用してサンプル効率とポリシー性能を向上させる。
- ComSim: 構成シミュレーションによるスケーラブルな実世界ロボットデータ生成sim2real2026/4/1
古典的シミュレーションとニューラルシミュレーションを組み合わせ、少量の実データから多様な実世界データを生成するハイブリッド手法を提案。sim2realギャップを低減し、実世界でのポリシー学習成功率を向上させる。
- アクションイメージ:マルチビュー動画生成によるエンドツーエンド方策学習VLA2026/4/1
ロボットの7自由度動作をピクセルに接地したアクション動画として表現し、動画生成モデル自体を方策として用いる統一的な世界行動モデルを提案した。RLBenchと実機評価で高いゼロショット成功率を達成した。
- タスクをスケールせよ:マルチタスクモデルベース強化学習によるヒューマノイド制御の習得強化学習2026/3/1
サンプル数ではなくタスク数を増やすことで、モデルベース強化学習がヒューマノイドの多様なスキルを効率的に学習できることを示した論文。
- 検証器による更新不要のオン方策ステアリングマニピュレーション2026/3/1
ロボットの行動成功率を予測する検証器を訓練し、実行時に方策を高成功率の行動へと誘導する、パラメータ更新不要の手法を提案。実タスクで成功率を平均49%向上させた。
- 順序付き行動トークン化(OAT)VLA2026/2/1
連続的なロボット行動を、自己回帰生成に適した順序付きトークン列に変換する学習型トークナイザを提案し、シミュレーションと実機の20以上のタスクで従来手法を上回る性能と推論時の柔軟性を示した。
- 世界行動モデルはゼロショット方策であるVLA2026/2/1
動画拡散モデルを基盤に未来の世界状態と行動を予測するWorld Action Model「DreamZero」を提案し、実機でVLAを上回る汎化性能と7Hzのリアルタイム閉ループ制御を実現した。
- 超大規模動画推論スイート動画推論2026/2/1
200種類の推論タスクと100万本以上の動画からなる大規模データセットVBVRと、ルールベースで検証可能な評価ベンチマークVBVR-Benchを構築し、動画推論のスケーリング則と未見タスクへの汎化の兆候を示した。
- 流れ同変ワールドモデル:部分観測動的環境のための記憶ワールドモデル2026/1/3
自己運動と物体運動に応じて潜在記憶を同変的に移動・変換することで、部分観測下でも長期的な動力学予測を安定かつ高精度に行うワールドモデルを提案した。
- マルチエージェントロボットシステム(MARS)チャレンジの進歩と革新マルチエージェント2026/1/1
NeurIPS 2025ワークショップで開催されたMARSチャレンジを紹介し、VLMを用いたマルチエージェントの計画とロボットマニピュレーションの制御という2領域での取り組みを概説した論文。
- OpenTouch: 実世界インタラクションに全手触覚をもたらす触覚2025/12/1
一人称視点の動画と全手の触覚・姿勢を同期した初の実世界データセットを構築し、触覚が把持理解やクロスモーダル alignment に有効であることを示した。
- 大規模動画プランナーによる汎用ロボット制御VLA2025/12/1
インターネット規模の人間活動動画で生成的なロボット計画モデルを基盤モデル規模で学習し、新しい場面やタスクに対してゼロショットで動画計画を生成して実機の行動に変換する手法を提案した。
- VeoワールドシミュレータによるGeminiロボティクスポリシーの評価sim2real2025/12/1
最先端の動画生成モデルVeoを基盤とした生成評価システムを構築し、ロボットポリシーの通常性能から分布外汎化、物理・意味的安全性までをシミュレーションで評価できることを示した。
- SIMPACT: 視覚言語モデルによるシミュレーション活用型行動計画マニピュレーション2025/12/1
視覚言語モデルにテスト時に物理シミュレーションを組み合わせ、追加学習なしで接触を伴う細かいマニピュレーションの行動計画を可能にした手法。
- モデルベース拡散サンプリングによるオフライン意思決定の予測制御拡散モデル/予測制御2025/12/1
拡散プランナと動力学拡散モデルを組み合わせ、サンプリング中に両者を交互更新することで、タスク意図を保ちつつ動的に実現可能な軌道を生成するMPDiffuserを提案。オフライン制御ベンチマークと実機四足ロボットで有効性を示した。
- 因子分解拡散ポリシーによる柔軟なマルチタスク学習マニピュレーション2025/12/1
複雑な行動分布を専門化した拡散モデルの合成に分解するモジュラー拡散ポリシーを提案し、マルチタスク操作で性能と適応性を向上させた。
- 巧みな操作のためのクロスエンボディメント世界モデルのスケーリングマニピュレーション2025/11/1
人間とロボットの手を3D粒子で表現し、エンドエフェクタの粒子変位場を行動として定義することで、異なる身体構造を超えて共有できる世界モデルを学習し、新しいハードウェアでの操作制御を実現した。
- 目標条件付き強化学習のためのテスト時グラフ探索強化学習2025/10/8
既存の目標条件付き強化学習ポリシーに、学習不要の軽量なグラフ探索ラッパーを組み合わせることで、長期的タスクの成功率を大幅に向上させる手法を提案した。
- 拡散モデル予測制御による柔軟な歩行学習歩行2025/10/1
生成拡散モデルをダイナミクスの事前分布として使うMPCで、報酬と制約を考慮した歩行制御を実現し、テスト時の適応性を高めた。
- Gemini Robotics 1.5:高度な身体性推論・思考・動作転移で汎用ロボットの最前線を押し広げるVLA2025/10/1
異種ロボットデータから学ぶ動作転移機構と自然言語での多段階推論を組み合わせたVLAモデルと、身体性推論に特化したモデルを発表し、複雑な多段階タスクの実行と解釈性を向上させた。
- ビデオ再計画による暗黙的な状態推定VLA2025/10/1
ビデオベースの計画フレームワークにインタラクション時のデータを統合し、モデルパラメータをオンライン更新して失敗した計画を除外することで、暗黙的な状態推定を実現する手法を提案。
- MoTVLA: 高速・低速推論を統合した視覚-言語-行動モデルVLA2025/10/1
事前学習済みVLMとドメイン専門家トランスフォーマーを組み合わせ、高速・低速の推論を統合してロボットの行動方策を学習するVLAモデルを提案。
- 幾何学を考慮した方策模倣模倣学習2025/10/1
模倣学習を実演の幾何学的曲線として捉え、距離場から進行流と吸引流を導出することで、拡散ベースの方策より高成功率かつ20倍高速でメモリ効率の良いロボット制御を実現した。
- マルチモーダル政策コンセンサスによるマルチモーダルマニピュレーションマニピュレーション2025/9/1
視覚や触覚など複数の感覚モダリティを、それぞれに特化した拡散モデルと適応的な重み付けを行うルータネットワークで統合し、接触の多いタスクや遮蔽された物体の操作を可能にする手法を提案。
- 記号計画と連続計画を同時に生成するハイブリッド拡散モデルVLA2025/9/1
拡散モデルで連続的なロボット軌道を生成しつつ、高レベルの記号計画も同時に生成するハイブリッド手法を提案し、長期的タスクの意思決定を改善した。
- Set It Up:構成可能な生成モデルによる機能的物体配置物体配置2025/8/1
大規模言語モデルと拡散モデルを組み合わせ、食卓や本棚、家具の配置など、指示に応じた機能的で美的な物体配置を実現するフレームワークを提案。
- MindJourney:世界モデルによるテスト時スケーリングで空間推論を実現VLA2025/7/1
VLMに動画拡散ベースの世界モデルを組み合わせ、テスト時に視点移動を探索させることで3D空間推論を強化するフレームワークを提案。
- 視覚ロボット計画のための自己改善ループVLA2025/6/1
ロボットタスクを解くための視覚計画モデルを、自己生成した軌跡で反復的に改善するSILVRを提案し、未見タスクでも性能が向上することを示した。
- 合成による異常検知:オフロードナビゲーションのための生成拡散モデルを用いた異常検出異常検知2025/5/1
拡散モデルで入力画像から異常を除去した画像を合成し、その編集箇所を解析することで、訓練データにない異常を画素単位で検出する手法を提案。
- 3D永続的具現化ワールドモデルの学習ワールドモデル2025/5/1
過去に生成した内容を明示的に記憶する3Dマップを条件付けし、RGB-D動画拡散モデルで長期的に一貫した未来予測を可能にする永続的ワールドモデルを提案。計画や方策学習に有効性を示す。
- 身体性を持つ生成AIシステムの性能・効率・拡張性に関するシステムレベル分析VLA2025/4/1
LLMを活用した身体性エージェントシステムを4つのパラダイムに分類し、ベンチマークを通じて性能とシステム効率を評価して課題を明らかにし、最適化戦略を提案した初のシステムレベル分析。
- インターネット動画知識の適応による新規タスクの解決VLA2025/4/1
大規模動画生成モデルに少量のロボット実演データを適応させ、テキスト条件付けで新規タスクへ汎化する手法を比較し、逆確率適応という新手法を提案した。
- TesserAct: 4D身体化世界モデルの学習世界モデル2025/4/1
RGB-DN動画を生成するビデオモデルを微調整し、身体化エージェントの行動に応じた4Dシーン予測を可能にする世界モデルを提案。
- Gemini Robotics:AIを物理世界へVLA2025/3/1
Gemini 2.0を基盤に、ロボットを直接制御できる汎用VLAモデル「Gemini Robotics」と、空間・時間理解を強化した推論モデル「Gemini Robotics-ER」を提案した論文。
- AdaWorld: 潜在行動で適応可能な世界モデルを学習する世界モデル2025/3/1
動画から自己教師ありで潜在行動を抽出し、それに条件づけた自己回帰的世界モデルを事前学習することで、新しい環境や行動への適応を効率化する手法を提案。
- MoE-Loco:複数タスク歩行のための専門家混合歩行2025/3/1
脚型ロボットの多様な地形・歩容に対応する単一ポリシーを、専門家混合(MoE)で勾配衝突を抑えつつ学習させる手法を提案し、実機でも検証した。
- 拡散モデルの合成による生成的な軌道スティッチング軌道計画2025/3/1
学習済みの短い軌道チャンクを双方向拡散モデルで合成的につなぎ合わせ、未見の長期的タスクを計画できる手法CompDiffuserを提案した。
- 予測的世界モデルによる生成ロボットポリシーの推論時強化マニピュレーション2025/2/1
学習済み拡散ポリシーを再学習せずに、行動条件付き世界モデルで推論時にオンライン計画を行い、操作タスクの性能を向上させる手法GPCを提案。
- 人間との対話による推論時ポリシーステアリングVLA2024/11/1
事前学習済みの生成ポリシーを微調整せずに、人間の介入でサンプリング過程をバイアスし、意図に沿った行動を引き出す枠組みを提案。
- 逆生成モデリングによる少数ショットタスク学習少数ショット学習2024/11/1
事前学習した可逆生成モデルを使い、重み更新なしで数例から新しいタスク概念(目標や動作スタイル)を学習する手法を提案。物体再配置・ナビゲーション・動作キャプション・自動運転・実機卓上操作で検証。
- 目標条件付き探索による動画モデルの行動への接地VLA2024/11/1
大規模動画モデルを自己探索によって連続行動に直接接地させ、報酬や行動ラベルなしで複雑なタスクを解くフレームワークを提案した。
- 3D-Mem: 身体性エージェントのための3Dシーンメモリ身体性AI2024/11/1
探索領域を多視点画像の「メモリスナップショット」として記憶し、未探索領域の「フロンティアスナップショット」も活用することで、身体性エージェントの探索と推論を向上させる3Dシーンメモリを提案した。
- 柔軟な制約に対応する合成拡散モデルによる動力降下軌道生成軌道生成/拡散モデル2024/10/1
拡散モデルで6自由度の動力降下軌道を生成し、複数の制約を組み合わせて最適化の初期値に使うことで、頑健性と速度を向上させた研究。
- ロボティクスにおける深層生成モデル:マルチモーダル実演からの学習に関するサーベイ模倣学習2024/8/1
ロボットの実演学習に深層生成モデル(拡散モデルやGANなど)を活用する近年の研究を、モデル種別・応用・分布外汎化の観点から統一的に整理したサーベイ。
- マルチモーダル物理シーン理解のための分離音響場音響・マルチモーダル2024/7/1
音の生成・伝播過程を分離表現でモデル化し、落下物の位置に関する空間不確実性マップを構築して探索候補を提示することで、物体探索の成功率を高める手法を提案。
- 拡散強制:次トークン予測と全系列拡散の融合生成モデル2024/7/1
各トークンに独立なノイズレベルを与えて拡散モデルを訓練する新手法を提案し、次トークン予測と全系列拡散の長所を組み合わせて可変長生成や計画タスクで性能を向上させた。
- ポテンシャルベース拡散運動計画運動計画2024/7/1
ポテンシャルベースの運動計画をニューラルネットワークで学習し、拡散モデルを用いて局所解を回避しながら高次元空間での計画を可能にした手法を提案。
- ストリーミング拡散ポリシー:可変ノイズ拡散モデルによる高速方策生成模倣学習2024/6/1
拡散モデルによるロボット模倣学習の方策生成を高速化するため、部分的にノイズ除去した行動軌跡を逐次更新するSDPを提案し、蒸留なしで性能を保ちつつ大幅な高速化を実現した。
- セット・イット・アップ!:構成的生成モデルによる機能的物体配置物体配置2024/5/1
「二人用の食卓をセットして」のような曖昧な指示から、物体間の抽象的な空間関係をLLMで推論し、拡散モデルを組み合わせて機能的で美しい配置を生成するフレームワークを提案。
- RoboDreamer: ロボットの想像のための構成的世界モデルの学習世界モデル2024/4/1
言語指示を低レベルプリミティブに分解して動画生成を条件付けすることで、未見の物体と行動の組み合わせに対応できる構成的世界モデルを提案し、ロボットの計画生成を実現した。
- インターネット動画からの汎用ロボット学習に向けて:サーベイVLA2024/4/1
インターネット上の大規模動画を活用してロボット学習のデータ不足を補う「動画からの学習(LfV)」の研究動向を体系的に整理し、課題と将来展望を論じたサーベイ論文。
- 3D-VLA:3D視覚・言語・行動の生成的ワールドモデルVLA2024/3/1
3D知覚・推論・行動を生成的ワールドモデルで結びつけた基盤モデルを提案し、拡散モデルによる将来の画像・点群生成を通じて行動計画能力を向上させた。
- PoCo: 異種ロボット学習のためのポリシー合成マニピュレーション2024/2/1
拡散モデルで表現された異なるデータ分布を合成し、マルチモーダル・マルチドメインのデータから汎用的な操作スキルを学習する手法を提案。
- 構成可能な生成モデリング:単一モデルだけでは不十分生成モデル2024/2/1
大規模単一生成モデルではなく、小さな生成モデルを組み合わせて構成する手法を提案し、データ効率や未見分布への汎化、新タスクへのプログラム的構築が可能であることを示した。
- DiffuseBot: Breeding Soft Robots With Physics-Augmented Generative Diffusion Models2023/11/1
- Adaptive Online Replanning with Diffusion Models2023/10/1
- Video Language Planning2023/10/1
- Learning to Act from Actionless Videos through Dense Correspondences2023/10/1
- Compositional Foundation Models for Hierarchical Planning2023/9/1
- Compositional Diffusion-Based Continuous Constraint Solvers2023/9/1
- Building Cooperative Embodied Agents Modularly with Large Language Models2023/7/1
- 3D-LLM: Injecting the 3D World into Large Language Models2023/7/1
- Planning with Sequence Models through Iterative Energy Minimization2023/3/1
- Diffusion Policy: Visuomotor Policy Learning via Action Diffusion2023/3/1
- NeuSE: Neural SE(3)-Equivariant Embedding for Consistent Spatial Understanding with Objects2023/3/1
- 3D Concept Learning and Reasoning from Multi-View Images2023/3/1
- Local Neural Descriptor Fields: Locally Conditioned Object Representations for Manipulation2023/2/1
- MIRA: Mental Imagery for Robotic Affordances2022/12/1
- Visibility-Aware Navigation Among Movable Obstacles2022/12/1
- StructDiffusion: Language-Guided Creation of Physically-Valid Structures using Unseen Objects2022/11/1
- SE(3)-Equivariant Relational Rearrangement with Neural Descriptor Fields2022/11/1
- Robust Change Detection Based on Neural Descriptor Fields2022/8/1
- Learning Neural Acoustic Fields2022/4/1
- Neural Descriptor Fields: SE(3)-Equivariant Object Representations for Manipulation2021/12/1
- Learning to Compose Visual Relations2021/11/1
- Curious Representation Learning for Embodied Intelligence2021/5/1
- Neural Radiance Flow for 4D View Synthesis and Video Processing2020/12/1
- Learning Object-Based State Estimators for Household Robots2020/11/1
- A Long Horizon Planning Framework for Manipulating Rigid Pointcloud Objects2020/11/1
- Model Based Planning with Energy Based Models2019/9/1