Jiajun Wu
収録論文 103本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ECoMEM: 記憶依存型ロボット制御のための明示的概念メモリVLA2026/9/30
タスクに関連する過去の情報を「概念」として明示的に記録・更新し、それをVLAポリシーの条件付けに使うメモリ機構を提案。長期的タスクや実機タスクで高い成功率を達成した。
- DITTO-X: 巧みな操作と人間介入のための順方向・逆方向テレオペレーションテレオペレーション2026/9/30
ロボットハンドの関節力と指先接触を提示し、逆方向テレオペレーションで操作者の指をロボットの姿勢に合わせる、ハンド非依存の巧みなテレオペレーションインターフェースを提案。
- T²Mem: ロボティクスのためのテスト時メモリ学習VLA2026/9/29
事前学習済み視覚言語行動ポリシーに、テスト時訓練で観測履歴を圧縮した高速重みとして記憶させ、記憶不要なベース方策を大きく上回る成功率を達成した手法。
- DexAgent: 自己進化するツールライブラリを備えたエージェント型Human2Sim2Robotフレームワークによる巧みな操作マニピュレーション2026/9/28
一人称視点の人間動画とタスク指示から、物理的に妥当なロボット軌道を生成して方策学習を可能にするエージェント型フレームワークを提案。ツールライブラリを自己進化させ、多様な物体や長期的タスクに対応する。
- TrAct: ロボット制御と視覚予測を視覚トラックで橋渡しするVLA/世界モデル2026/8/25
ロボットの行動と画像変化の弱い対応を補うため、視覚トラックを中間表現として用いる世界モデルベースの意思決定フレームワークTrActを提案。シミュレーションと実機で成功率を大幅に向上させた。
- マスク視覚アクションによる統一世界モデリング世界モデル2026/7/1
ロボットの行動をビデオのピクセル空間で表現する新しいインターフェースを導入し、少量のデータで学習したモデルが将来予測や逆モデリングを実現する。
- APIVOT: 視覚と言語の思考を適応的に交互配置する長期的計画手法計画2026/7/1
長期的なロボット計画において、言語による意味推論と視覚による幾何学的検証を適応的に交互に行うVLMベースのプランナーを提案し、キッチンタスクで性能を向上させた。
- DIRECT: 身体化プランナーにおけるテスト時計算の割り当てはいつ、どこで行うべきか?VLA/プランニング2026/6/10
VLMを高レベルプランナーとして使う際、テスト時計算を増やすと性能が上がるが、コストも増える。シーン文脈に基づいて計算をルーティングするDIRECTを提案し、成功率とコストのトレードオフを改善した。
- CoStream: 単純な行動の合成による汎用的な複雑操作の実現マニピュレーション2026/6/1
複雑な操作タスクを、基盤モデルと多様なセンシングを組み合わせた複数の単純な行動(意味的・予測的・反応的)に分解し、それらをSE(3)インターフェース上で合成することで、高精度と汎用性を両立するフレームワークを提案した。
- InSight: 操縦可能なVLAによる自己誘導型スキル獲得VLA/スキル獲得2026/6/1
VLAモデルにプリミティブ動作レベルでの操縦性を持たせ、デモンストレーションの自動分割とVLMによるデータ収集のフィードバックループを通じて、人間のデモなしに新しい操作スキルを自律的に獲得するフレームワークを提案した。
- Fishbone: 1つの3Dアセットから100万通りの制御可能な編集へ3Dアセット生成2026/5/24
3Dメッシュの形状変形を制御するための統一的なリブ・スパイン表現を提案し、リアルタイムで予測可能な変形やアニメーションを可能にする。
- ESI-Bench:知覚と行動のループを閉じる身体化空間知能のベンチマーク身体化空間知能2026/5/1
受動的な観察ではなく、能動的な探索を通じて空間理解を行う身体化空間知能のベンチマークを提案し、能動的探索が受動的観察より優れていることを示した。
- 視点計画:VLMによる3D空間の能動的推論と計画VLA2026/5/1
VLMがカメラ移動による視点変化を予測し、複数ステップの計画で目標視点を特定できるかを検証し、その能力を高める反復的自己探索と視点グラフ蒸留の枠組みを提案した。
- ステレオポリシー:ステレオ知覚によるロボット操作ポリシーの改善マニピュレーション2026/5/1
ステレオ画像ペアを直接利用して3次元幾何推論を強化する視覚運動ポリシー学習フレームワークを提案し、シミュレーションと実ロボットの操作タスクで性能を向上させた。
- ロボット学習のためのワールドモデル:包括的サーベイサーベイ2026/5/1
ロボット学習におけるワールドモデルの役割と進化を体系的にレビューし、ポリシー学習、シミュレーション、評価への応用や課題を整理したサーベイ論文。
- 大規模言語モデルを用いた具現化プランニングには系統的な安全リスクが存在する安全性評価2026/4/1
大規模言語モデルをロボットのプランナーとして使う際の安全性を評価するベンチマークDESPITEを導入し、計画能力が高くても危険な計画を生成するリスクが高いことを示した。
- IMPASTO: モデルベース計画と学習された力学モデルを統合したロボット油絵再現ロボットアート/計画2026/3/1
ロボットが油絵の画像列から筆の軌道や力、色を推論して再現するシステムを提案。学習したピクセル力学モデルとモデル予測制御を統合し、自己対戦のみで学習する。
- CaP-X: ロボットマニピュレーションのためのコーディングエージェントのベンチマークと改善フレームワークマニピュレーション2026/3/1
コードを方策として使うエージェントを体系的に評価する環境CaP-GymとベンチマークCaP-Benchを構築し、テスト時計算の拡張で人間レベルの信頼性を達成する手法を提案した。
- 試行錯誤からの学習:身体性LLMのための内省的テスト時計画VLA2026/2/1
実行前の内省で行動候補を生成・評価し、実行後の内省でモデルと方針を更新する内省的テスト時計画を提案し、長期的な家庭内タスクやロボット実験で性能向上を実証した。
- 動的物体の世界を振り付ける:CHORD4D生成2026/1/1
2D動画の生成モデルからラグランジュ運動情報を蒸留し、カテゴリに依存せず多様な4D動的シーンを生成する手法を提案。ロボットマニピュレーション方策の生成にも応用可能。
- Dream2Flow: 3Dオブジェクトフローで動画生成とオープンワールド操作をつなぐマニピュレーション2025/12/1
生成動画から3Dオブジェクトの動きを再構成し、それを中間表現として軌道追跡問題に変換することで、実演なしに多様な物体を操作できるフレームワークを提案。
- 閉ループ自律走行のためのモデルベース方策適応自動運転2025/11/1
拡散モデルとQ値モデルを組み合わせ、事前学習済みのEnd-to-End自律走行エージェントを閉ループ環境で適応させるフレームワークを提案。
- TWIST2: スケーラブルでポータブルな全身ヒューマノイドデータ収集システムヒューマノイド2025/11/1
VRと低コストのロボット首を用いてモーションキャプチャ不要でヒューマノイドの全身遠隔操作とデータ収集を実現し、15分で100件のデモをほぼ100%の成功率で収集できるシステムを開発した。
- 視覚-言語-行動モデルの未来を導く10の未解決課題VLA2025/11/1
VLAモデルの発展における10の主要マイルストーンと新たな研究動向を議論し、今後の研究方向に注目を促す論文。
- ENACT: 自己中心的なインタラクションの世界モデリングによる身体性認知の評価身体性認知/ベンチマーク2025/11/1
ロボティクスシミュレーションから生成した自己中心視点の行動と観測の系列並べ替えタスクにより、視覚言語モデルが身体性認知の能力(アフォーダンス認識、行動効果推論など)をどの程度持つかを評価するベンチマークを提案。
- MoMaGen: ソフト・ハード制約下で多段階両腕移動マニピュレーションのデモを生成sim2real2025/10/1
移動ベースと両腕の多段階タスク向けに、到達可能性などのハード制約と視認性などのソフト制約を満たすデータ生成を制約付き最適化として定式化し、多様なデモを自動生成する手法を提案。
- Phys2Real: VLMの事前知識と対話型オンライン適応を融合した不確実性を考慮したSim-to-Realマニピュレーションsim2real2025/10/1
VLMが推定した物理パラメータの事前分布と、実機での対話データから得られるオンライン推定を不確実性を考慮して統合し、シミュレーションで学習したマニピュレーションポリシーを実世界に転移させる手法を提案。
- リターゲティングが重要:ヒューマノイド動作追従のための汎用モーションリターゲティング動作追従2025/10/1
人間の動作データをヒューマノイドにリターゲティングする際の品質が強化学習ポリシーの性能に与える影響を系統的に評価し、既存手法の問題を解決する新手法GMRを提案した。
- DexSkin:接触の多いマニピュレーション学習のための高被覆型柔軟ロボットスキン触覚2025/9/1
柔軟で形状適合性の高い静電容量式電子皮膚を開発し、グリッパ指全体を覆う触覚センシングを実現して、物体の持ち替えや輪ゴム巻き付けなどの接触の多いマニピュレーションを模倣学習と強化学習で習得できることを示した。
- VisualMimic: 視覚によるヒューマノイドの移動操作を運動追跡と生成で実現sim2real2025/9/1
一人称視覚と階層的な全身制御を組み合わせ、シミュレーションで訓練した視覚運動方策を実機ヒューマノイドにゼロショット転移し、箱の持ち上げやサッカーのドリブルなど多様な移動操作を屋外でも実現した。
- UAD: ロボットマニピュレーションの汎化のための教師なしアフォーダンス蒸留マニピュレーション2025/6/1
大規模視覚モデルと視覚言語モデルを組み合わせて、手動アノテーションなしでタスク条件付きアフォーダンスモデルを学習し、ロボット操作の汎化性能を向上させる手法を提案。
- TWIST: 遠隔操作による全身模倣システム全身遠隔操作2025/5/1
人間のモーションキャプチャを人型ロボットに再ターゲティングし、強化学習と行動クローニングを組み合わせた単一のニューラルネットワーク制御器で、全身の協調動作を実現する遠隔操作システムを開発した。
- 神経記号的コンセプトVLA2025/5/1
感覚入力と行動出力に基づく神経記号的コンセプトの語彙を用いて、継続学習と柔軟な推論が可能なエージェントを構築する概念中心の枠組みを提案。
- 言語と実演から構成可能な行動を学習するフレームワークBLADEマニピュレーション2025/5/1
言語注釈付き実演とLLMを活用し、長期ロボットマニピュレーションのための構造化された高レベル行動表現を自動構築する手法を提案。新規状況への一般化性能をシミュレーションと実機で検証した。
- デジタルツインカタログ:大規模フォトリアリスティック3Dオブジェクトデータセット3D再構成/データセット2025/4/1
2000体の高精細3Dオブジェクトと、DSLRカメラおよびARグラスで撮影した画像列を含む大規模データセットを構築し、3Dデジタルツイン再構成の評価ベンチマークを提供した。
- X-Capture: マルチセンサー学習のためのオープンソース携帯デバイス触覚2025/4/1
RGBD画像・触覚・打音を同時に収集できる1000ドル以下のオープンソース携帯デバイスを開発し、500物体のデータセットを構築してマルチモーダル表現学習の有効性を示した。
- BEHAVIORロボットスイート:日常家事のための実世界全身マニピュレーションを効率化全身マニピュレーション2025/3/1
両腕・車輪・4自由度胴体を備えたロボットで、全身遠隔操作インターフェースと視覚運動ポリシー学習アルゴリズムを統合し、家庭内の全身マニピュレーションタスクを実現するフレームワークを提案。
- 述語階層による少数ショット状態分類の改善状態分類/少数ショット学習2025/2/1
述語間の階層構造を活用し、画像と述語のペアを双曲空間に埋め込むことで、ロボット環境における状態分類を少数の例から高精度に汎化させる手法PHIERを提案。
- IKEAマニュアルの実践:インターネット動画における組立指示の4Dグラウンディング4Dグラウンディング2024/11/1
家具の3Dモデル・組立説明書・インターネット動画を密に対応付けたデータセットを構築し、組立計画生成や動画内の部品位置推定など5つのタスクの評価基盤を提供した。
- Lipschitz制約付きポリシーによる滑らかなヒューマノイド歩行の学習歩行2024/10/1
方策にLipschitz制約を勾配ペナルティとして課すことで、低域通過フィルタや平滑化報酬を使わずに滑らかで頑健なヒューマノイド歩行制御を学習する手法を提案し、実機で検証した。
- ロバストな方策学習のためのデジタルいとこの自動生成sim2real2024/10/1
実世界のシーンを模した「デジタルいとこ」を自動生成し、シミュレーションから実世界へのゼロショット転移で高い成功率を達成する手法を提案。
- 身体性エージェントインターフェース:身体的意思決定のためのLLMベンチマークVLA2024/10/1
LLMを用いた身体的意思決定を統一的に評価するための汎用インターフェースを提案し、多様なタスク・モジュール・細粒度エラー指標でLLMの能力を体系的に分析するベンチマークを構築した。
- 3D拡散ポリシーによる汎化可能なヒューマノイドマニピュレーションマニピュレーション2024/10/1
上半身テレオペで収集した単一場面のデータと機載計算のみで、25自由度ヒューマノイドが多様な実環境で自律マニピュレーションを実現するシステムを構築した。
- ゼロショット新規視点合成による視点不変な方策学習マニピュレーション2024/9/1
単一画像から新規視点を合成するモデルをデータ拡張に用い、単一視点の実演データから視点に頑健な操作方策を学習する手法を提案し、実機・シミュレーションで有効性を示した。
- FactorSim: 因子分解表現による生成的シミュレーションsim2real2024/9/1
自然言語入力からエージェント訓練用の完全なシミュレーションコードを生成する手法を提案し、因子分解POMDP表現で文脈依存を低減、ゼロショット転移性能で既存手法を上回ることを示した。
- D5RL: データ駆動型深層強化学習のための多様なデータセットオフライン強化学習2024/8/1
実世界のロボット操作・移動環境を模したシミュレーションで、スクリプト・人間操作・その他多様なデータ源を含むオフライン強化学習の新ベンチマークを提案。
- RoboPack: 触覚情報を活用した動力学モデルによる高密度パッキング触覚2024/7/1
視覚と触覚を組み合わせたリカレントグラフニューラルネットワークで物体状態を推定し、モデル予測制御により非把持操作や高密度パッキングを実現する手法を提案。
- 部品ベースの組み合わせ可能なマニピュレーションマニピュレーション2024/5/1
物体を部品に分解し、部品間の機能的対応関係を拡散モデルで学習することで、新しい物体やカテゴリにも汎化するロボット操作手法を提案した。
- 言語から計画抽象を学習するVLA2024/5/1
言語注釈付きデモンストレーションを用いて、記号的な抽象行動空間と潜在状態抽象を自動獲得し、長期的な計画を可能にするフレームワークPARLを提案。
- 実世界ロボットマニピュレーションポリシーのシミュレーション評価sim2real2024/5/1
実環境とシミュレーションの制御・視覚ギャップを緩和し、実機セットアップに対応した評価環境SIMPLERを構築。実機とシミュレーションの性能が強く相関することを示した。
- TRANSIC: オンライン修正から学ぶSim-to-Realポリシー転移sim2real2024/5/1
人間が実世界でロボットの動作を観察・介入して修正を加え、その修正から残差ポリシーを学習することで、シミュレーションと実世界のギャップを埋めて家具組立などの接触の多いタスクを実現する手法。
- BEHAVIOR-1K:1000の日常活動とリアルなシミュレーションによる人間中心の身体性AIベンチマークsim2real2024/3/1
人間がロボットにやってほしいと望む1000の日常活動を、50のシーンと9000以上の物体を含む物理シミュレーション環境OMNIGIBSONで再現し、実世界への転移も検証したベンチマークを提案した。
- DROID: 大規模実環境ロボットマニピュレーションデータセットマニピュレーション2024/3/1
北米・アジア・欧州の50名が12ヶ月かけて564シーン・84タスクで収集した76k軌道・350時間のロボット操作データセットを構築し、学習ポリシーの性能と汎化性能が向上することを示した。
- Holodeck: Language Guided Generation of 3D Embodied AI Environments2023/12/1
- Foundation Models in Robotics: Applications, Challenges, and the Future2023/12/1
- Model-Based Control with Sparse Neural Dynamics2023/12/1
- NOIR: Neural Signal Operated Intelligent Robots for Everyday Activities2023/11/1
- Learning to Design and Use Tools for Robotic Manipulation2023/11/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Mini-BEHAVIOR: A Procedurally Generated Benchmark for Long-horizon Decision-Making in Embodied AI2023/10/1
- Physically Grounded Vision-Language Models for Robotic Manipulation2023/9/1
- D$^3$Fields: Dynamic 3D Descriptor Fields for Zero-Shot Generalizable Rearrangement2023/9/1
- PyPose v0.6: The Imperative Programming Interface for Robotics2023/9/1
- Learning Sequential Acquisition Policies for Robot-Assisted Feeding2023/9/1
- Compositional Diffusion-Based Continuous Constraint Solvers2023/9/1
- Primitive Skill-based Robot Learning from Human Evaluative Feedback2023/7/1
- VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models2023/7/1
- Giving Robots a Hand: Learning Generalizable Manipulation with Eye-in-Hand Human Video Demonstrations2023/7/1
- The ObjectFolder Benchmark: Multisensory Learning with Neural and Real Objects2023/6/1
- RoboCook: Long-Horizon Elasto-Plastic Object Manipulation with Diverse Tools2023/6/1
- Sonicverse: A Multisensory Simulation Platform for Embodied Household Agents that See and Hear2023/6/1
- Dynamic-Resolution Model Learning for Object Pile Manipulation2023/6/1
- Multi-Object Manipulation via Object-Centric Neural Scattering Functions2023/6/1
- Programmatically Grounded, Compositionally Generalizable Robotic Manipulation2023/4/1
- A Control-Centric Benchmark for Video Prediction2023/4/1
- See, Hear, and Feel: Smart Sensory Fusion for Robotic Manipulation2022/12/1
- Physically Plausible Animation of Human Upper Body from a Single Image2022/12/1
- STAP: Sequencing Task-Agnostic Policies2022/10/1
- Differentiable Physics Simulation of Dynamics-Augmented Neural Objects2022/10/1
- PyPose: A Library for Robot Learning with Physics-based Optimization2022/9/1
- BEHAVIOR in Habitat 2.0: Simulator-Independent Logical Task Description for Benchmarking Embodied AI Agents2022/6/1
- MaskViT: Masked Visual Pre-Training for Video Prediction2022/6/1
- RoboCraft: Learning to See, Simulate, and Shape Elasto-Plastic Objects with Graph Networks2022/5/1
- ObjectFolder 2.0: A Multisensory Object Dataset for Sim2Real Transfer2022/4/1
- Vision-Based Manipulators Need to Also See from Their Hands2022/3/1
- ObjectFolder: A Dataset of Objects with Implicit Visual, Auditory, and Tactile Representations2021/9/1
- BEHAVIOR: Benchmark for Everyday Household Activities in Virtual, Interactive, and Ecological Environments2021/8/1
- iGibson 2.0: Object-Centric Simulation for Robot Learning of Everyday Household Tasks2021/8/1
- DASH: Modularized Human Manipulation Simulation with Vision and Language for Embodied AI2021/8/1
- Neural Radiance Flow for 4D View Synthesis and Video Processing2020/12/1
- Learning 3D Dynamic Scene Representations for Robot Manipulation2020/11/1
- Look, Listen, and Act: Towards Audio-Visual Embodied Navigation2019/12/1
- Accurate Vision-based Manipulation through Contact Reasoning2019/11/1
- Learning Compositional Koopman Operators for Model-Based Control2019/10/1
- DualSMC: Tunneling Differentiable Filtering and Planning under Continuous POMDPs2019/9/1
- DensePhysNet: Learning Dense Physical Object Representations via Multi-step Dynamic Interactions2019/6/1
- Combining Physical Simulators and Object-Based Networks for Control2019/4/1
- Reasoning About Physical Interactions with Object-Oriented Prediction and Planning2018/12/1
- ChainQueen: A Real-Time Differentiable Physical Simulator for Soft Robotics2018/10/1
- Learning Particle Dynamics for Manipulating Rigid Bodies, Deformable Objects, and Fluids2018/10/1
- Propagation Networks for Model-Based Control Under Partial Observation2018/9/1
- 3D Shape Perception from Monocular Vision, Touch, and Shape Priors2018/8/1
- Augmenting Physical Simulators with Stochastic Neural Networks: Case Study of Planar Pushing and Bouncing2018/8/1