Huazhe Xu
収録論文 72本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 対話型アニマトロニクスロボットの顔機構の自動合成アニマトロニクス/顔機構設計2026/7/1
2Dポートレートから3D顔を再構築し、衝突のない製造可能な内部機構を自動設計するアルゴリズムを提案。さらに、会話中の発話・傾聴行動を統合する双方向対話型顔運動合成フレームワークも開発した。
- MemoryWAM: 持続的メモリによる効率的な世界行動モデリングマニピュレーション2026/6/1
ロボット操作のための世界行動モデルに、最近のフレーム、イベント境界アンカーフレーム、長期履歴を要約するコンパクトなgistトークンを組み合わせたハイブリッドメモリ設計を導入し、長期的な記憶依存タスクを効率的に処理する手法を提案した。
- 行動残差を超えて:ボトルネック潜在強化学習による実世界ロボットポリシーの操縦強化学習/模倣学習/操作2026/5/1
事前学習済みの模倣ポリシーを、行動空間ではなくボトルネック潜在空間で強化学習により微調整する手法ZPRLを提案し、シミュレーションと実世界の操作タスクで性能を向上させた。
- Dexora: 高自由度両腕巧緻操作のためのオープンソースVLAVLA/操作2026/5/1
両腕・両手の高自由度操作を対象とした初のオープンソースVLAシステムDexoraを提案し、ハイブリッド遠隔操作とデータ品質を考慮した学習手法により、巧緻操作の成功率を大幅に向上させた。
- AffordGen: アフォーダンス対応による汎用物体操作のための多様なデモ生成模倣学習/データ生成2026/4/1
3D生成モデルと視覚基盤モデルを用いて、物体の意味的キーポイント対応に基づき多様な操作軌道を自動生成し、閉ループ視覚運動ポリシーの訓練データとして活用することで、未見物体へのゼロショット汎化を実現するフレームワークを提案した。
- AssemLM: ロボット組立のための空間推論マルチモーダル大規模言語モデルマニピュレーション2026/4/1
組立マニュアル、点群、テキスト指示を統合し、6D組立姿勢を予測する空間推論マルチモーダル大規模言語モデルを提案。専用の点群エンコーダと大規模ベンチマークAssemBenchを導入し、実ロボット評価で最先端性能を達成した。
- 万能ポリシー:幾何学を考慮した行動潜在表現による異種ロボット間操作マニピュレーション2026/3/1
異なるロボット間で共有可能な行動潜在表現を学習し、単一のポリシーで複数のロボットを操作するフレームワークを提案。
- ArrayTac:形状・硬さ・摩擦を連続的に提示する閉ループ圧電触覚ディスプレイ触覚2026/3/1
圧電アクチュエータアレイと閉ループ制御により、形状・硬さ・摩擦の3次元触覚を連続的に提示する触覚ディスプレイを開発し、遠隔腫瘍触診などへの応用を示した。
- UniDex: 人間の一人称視点ビデオからの汎用器用ハンド制御のためのロボット基盤スイート器用操作2026/3/1
人間の一人称視点ビデオからロボット実行可能な軌道を生成し、統一された行動空間と3D VLAポリシーを用いて、複数の器用ハンドへの汎用制御を実現する基盤スイートを提案した。
- DexImit: 単眼人間動画からの両手巧みなマニピュレーション学習マニピュレーション2026/2/1
単眼の人間の操作動画を物理的に妥当なロボットデータへ自動変換する4段階パイプラインを提案し、両手巧みなマニピュレーションの学習を可能にした。
- ViTaS: 視覚触覚ソフト融合コントラスト学習による視覚運動学習マニピュレーション2026/2/1
視覚と触覚の情報をソフト融合コントラスト学習とCVAEで統合し、遮蔽環境でもロボット操作を可能にするフレームワークを提案。
- 失敗を考慮した強化学習:自己回復を備えた実世界マニピュレーションのための信頼性の高いオフライン・オンライン強化学習マニピュレーション2026/1/1
実世界での強化学習中に発生する人間の介入が必要な失敗を減らすため、世界モデルベースの安全クリティックとオフラインで訓練された回復ポリシーを統合したFARLを提案し、失敗を73.1%削減しつつ性能を11.3%向上させた。
- MoE-DP:専門家混合で強化した拡散ポリシーによる長期的ロボット操作の堅牢化とスキル分解・失敗回復マニピュレーション2025/11/1
視覚エンコーダと拡散モデルの間に専門家混合層を挿入し、タスク段階ごとに専門家を動的に活性化することで、長期的操作の失敗回復と解釈可能なスキル分解を実現した。
- RL-100: 実世界強化学習による高性能ロボットマニピュレーションマニピュレーション2025/10/1
拡散視覚運動ポリシーに模倣学習と強化学習を統合し、軽量な蒸留で高速制御を実現した実世界ロボットマニピュレーションのフレームワーク。8つの多様な実タスクで100%の成功率を達成。
- DA-MMP: ダイナミクスを考慮した運動多様体プリミティブによる協調的で高精度な投擲の学習マニピュレーション2025/9/1
運動多様体プリミティブを可変長軌道に拡張し、実機試行から条件付きフローマッチングでダイナミクスを学習することで、リング投げタスクにおいて人間専門家を超える成功率を達成した。
- Embodied Arena:具現化AIのための包括的・統合・進化型評価プラットフォーム評価基盤2025/9/1
具現化AIの能力を3階層・7能力・25次元で体系化し、22のベンチマークと30以上のモデルを統合評価する進化型プラットフォームを構築した。
- GalaxeaオープンワールドデータセットとG0デュアルシステムVLAモデルVLA2025/9/1
実環境で収集した大規模ロボット行動データセットを構築し、VLMによる計画とVLAによる実行を組み合わせた二重システムモデルG0を3段階学習で訓練した。
- HERMES: 多源运动データからの人間→ロボット身体化学習による移動型巧みなマニピュレーションマニピュレーション2025/8/1
複数の人間の手の動きデータを強化学習で統合し、移動型双腕多指ハンドロボットの器用な操作を実現するフレームワークを提案。深度画像ベースのsim2real転移とPnP位置推定による自律ナビゲーションを組み合わせ、実環境での汎化性能を向上させた。
- Morpheus: ハイブリッド駆動と多様な感情制御を実現するニューラル駆動型アニマトロニクス顔アニマトロニクス/感情表現2025/7/1
剛体駆動と腱駆動を組み合わせたハイブリッド機構と、自己モデリングネットワークにより、音声から多様な感情表現を生成できるアニマトロニクス顔を開発した。
- DemoSpeedup:エントロピー誘導によるデモンストレーション加速で視覚運動ポリシーを高速化模倣学習2025/6/1
人間が収集した遅いデモを、フレームごとの行動エントロピーに基づいて間引き、精度が必要な区間はそのままに余裕のある区間を加速して学習させることで、成功率を保ちつつ最大3倍速く動く視覚運動ポリシーを実現した自己教師あり手法。
- 三重階層拡散方策による視覚運動学習VLA2025/5/1
RGB-D入力・多スケール視覚表現・階層的条件付き拡散を組み合わせ、視覚特徴と行動生成の統合を強化した視覚運動方策を提案。44のシミュレーションタスクで平均27.5%改善し、実機双腕タスクでも高性能を示した。
- FACET: インピーダンス参照追従による脚式ロボットの力適応制御脚式ロボット制御2025/5/1
仮想質量-バネ-ダンパ系を模倣する強化学習方策を訓練し、外力に応じて柔軟に適応する脚式ロボットの制御を実現した。
- 2BY2:汎用ロボット操作のためのマルチタスクペア物体組立学習マニピュレーション2025/4/1
日常的なペア物体の組立タスク18種を含む大規模データセット2BY2を構築し、同変特徴を用いた2段階SE(3)姿勢推定法で高精度な組立を実現した。
- AIとロボット科学者による科学発見のスケーリング則自律実験/ロボット科学者2025/3/1
エージェントAIと身体性ロボティクスを統合した自律型汎用科学者(AGS)を構想し、研究ライフサイクル全体の自動化と新たなスケーリング則の可能性を論じた論文。
- 反応的拡散ポリシー:接触の多い操作のための低速・高速視触覚ポリシー学習視触覚模倣学習2025/3/1
拡散ポリシーで低速に行動チャンクを生成し、高速な触覚トークナイザで閉ループ制御する視触覚模倣学習手法を提案し、接触の多い操作タスクでの性能を向上させた。
- DOGlove:低コストオープンソースの力覚フィードバックグローブによる巧みな操作遠隔操作/触覚2025/2/1
600ドル以下で自作できる力覚フィードバック付きグローブを開発し、ロボットハンドの遠隔操作と接触の多いタスクの模倣学習を実現した。
- DemoGen: データ効率の良い視覚運動方策学習のための合成デモンストレーション生成模倣学習2025/2/1
タスクごとに1回の人間デモから、3D点群編集と行動軌道の適応により空間的に多様な合成デモを自動生成し、実世界のマニピュレーション方策の性能を大幅に向上させる手法を提案。
- シミュレート困難な目的関数の微調整による四足歩行:総消費電力削減の事例研究sim2real2025/2/1
実世界データでバッテリー消費電力などのシミュレート困難な目的をモデル化し、シミュレーションに組み込んで歩行ポリシーを微調整することで、四足歩行の総消費電力を24〜28%削減した。
- DenseMatcher: 単一デモからのカテゴリレベル操作のための3Dセマンティック対応学習マニピュレーション2024/12/1
マルチビュー2D特徴をメッシュに投影して3Dネットワークで精錬し、関数写像で密な3D対応を計算する手法を提案。単一デモからのロボット操作のクロスカテゴリ汎化を実現。
- Stem-OB: 拡散逆変換による幹状収束観測を用いた汎化可能な視覚模倣学習模倣学習2024/11/1
事前学習済み拡散モデルの逆変換で観測画像から照明やテクスチャの違いを除去し、追加学習なしで視覚模倣学習の汎化性能を高めるプラグアンドプレイ手法を提案した。
- GenSim2: マルチモーダル推論LLMによるロボットデータ生成のスケーリングsim2real2024/10/1
マルチモーダル推論LLMを活用して多様なシミュレーションタスクとデモデータを自動生成し、生成データで学習するマルチタスク方策により実機へのゼロショット転移や実データとの共同学習で性能向上を実現した。
- MENTOR: タスク指向摂動を備えた視覚強化学習のためのMixture-of-Expertsネットワーク視覚強化学習2024/10/1
視覚強化学習のサンプル効率を改善するため、MLPをMixture-of-Expertsバックボーンに置き換え、タスク指向の摂動機構を導入した手法MENTORを提案。実機のマニピュレーションタスクで平均83%の成功率を達成した。
- ロボットがロボットを事前学習:大規模ロボットデータセットからの操作中心のロボット表現マニピュレーション2024/10/1
大規模ロボットデータセットDROIDを用い、視覚特徴と操作のダイナミクス(行動・固有感覚)を対比学習で結びつけた操作中心の基盤表現MCRを提案し、4シミュレーション領域20タスクで有効性を示した。
- DTactive:能動表面を備えた視覚ベース触覚センサ触覚2024/10/1
表面が動く機構を組み込んだ視覚ベース触覚センサを開発し、触覚知覚と把持内操作を同時に実現、学習により物体の回転操作を高精度に制御した。
- 生成的ロボットシミュレーションの評価についてsim2real2024/10/1
生成されたロボットタスクの品質・多様性・汎化性を評価する枠組みを提案し、人間評価との高い一致を確認した。
- キャッチせよ!移動型多指ハンドによる飛来物の捕球学習マニピュレーション2024/9/1
移動ベース・6自由度アーム・12自由度ハンドからなる移動マニピュレータで、飛んでくる物体を捕球する全身制御方策を2段階強化学習で訓練し、シミュレーションで約80%の成功率を達成、実機にも直接展開した。
- どこでも操作を学習する:強化学習のための視覚的汎化フレームワークsim2real2024/7/1
多視点表現学習と空間トランスフォーマー、カリキュラムベースのランダム化を組み合わせ、多様な視覚的擾乱下でも汎化する視覚運動強化学習フレームワークを提案し、実機転移を実証した。
- RoboGolf:反射的マルチモーダル視覚言語モデルによる実世界ミニゴルフの習得VLA2024/6/1
2台のカメラによる知覚と閉ループ行動修正、さらに反射的均衡ループを組み合わせたVLMベースの枠組みで、実世界のミニゴルフをプレイするロボットを実現した。
- RoboDuet:四足ロボットの全身協調移動操作のための協調ポリシー学習移動操作2024/3/1
四足ロボットとアームの全身制御を、移動と操作の2つの協調ポリシーで実現し、類似形態のロボットへのゼロショット転移も可能にしたフレームワーク。
- 3D拡散方策:単純な3D表現による汎化可能な視覚運動方策学習模倣学習2024/3/1
疎な点群から抽出したコンパクトな3D視覚表現を拡散方策に組み込み、少ないデモンストレーションで器用なロボット技能を汎化可能に学習する手法を提案した。
- RiEMann: 点群セグメンテーション不要の準リアルタイムSE(3)同変ロボットマニピュレーションマニピュレーション2024/3/1
シーン点群から対象物をセグメンテーションせずに直接操作目標姿勢を予測するSE(3)同変な模倣学習フレームワークを提案し、5〜10回のデモで学習して未知のSE(3)変換や妨害物体に頑健、準リアルタイムで動作することを示した。
- 四足歩行ロボットの脚による実世界操作をデモンストレーションから学習マニピュレーション2024/3/1
四足歩行ロボットが脚のみを使って物体を操作できるよう、強化学習ベースの低レベル制御と模倣学習ベースの高レベル計画を組み合わせた手法を提案し、実機で籠の持ち上げやボタン押しなどを実現した。
- Premier-TACO:時間的行動駆動型対照損失によるマルチタスク表現の事前学習と少数ショット方策学習少数ショット学習2024/2/1
マルチタスクのオフラインデータから時間的行動対照損失(TACO)を改良して汎用的な視覚表現を事前学習し、少数の専門家デモンストレーションで微調整することで、新しい連続制御タスクの少数ショット模倣学習を効率化する手法を提案。
- DeformNet: Latent Space Modeling and Dynamics Prediction for Deformable Object Manipulation2024/2/1
- RoboScript: 実機とシミュレーションをまたぐ自由形式マニピュレーションのためのコード生成マニピュレーション2024/2/1
ROS抽象化に基づく統一インターフェースで、コード生成による実機・シミュレーション両対応のロボットマニピュレーションパイプラインと自由記述タスクのベンチマークを提案。
- Robo-ABC: Affordance Generalization Beyond Categories via Semantic Correspondence for Robot Manipulation2024/1/1
- DittoGym: Learning to Control Soft Shape-Shifting Robots2024/1/1
- Diffusion Reward: Learning Rewards via Conditional Video Diffusion2023/12/1
- Generalizable Visual Reinforcement Learning with Segment Anything Model2023/12/1
- Uni-O4: Unifying Online and Offline Deep Reinforcement Learning with Multi-Step On-Policy Optimization2023/11/1
- H-InDex: Visual Reinforcement Learning with Hand-Informed Representations for Dexterous Manipulation2023/10/1
- GenSim: Generating Robotic Simulation Tasks via Large Language Models2023/10/1
- A Wearable Robotic Hand for Hand-over-Hand Imitation Learning2023/9/1
- 9DTact: A Compact Vision-Based Tactile Sensor for Accurate 3D Shape Reconstruction and Generalizable 6D Force Estimation2023/8/1
- Can Pre-Trained Text-to-Image Models Generate Visual Goals for Reinforcement Learning?2023/7/1
- MoVie: Visual Model-Based Policy Adaptation for View Generalization2023/7/1
- ArrayBot: Reinforcement Learning for Generalizable Distributed Manipulation through Touch2023/6/1
- RoboCook: Long-Horizon Elasto-Plastic Object Manipulation with Diverse Tools2023/6/1
- Decision Transformer under Random Frame Dropping2023/3/1
- On Pre-Training for Visuo-Motor Control: Revisiting a Learning-from-Scratch Baseline2022/12/1
- See, Hear, and Feel: Smart Sensory Fusion for Robotic Manipulation2022/12/1
- Scaling up and Stabilizing Differentiable Planning with Implicit Differentiation2022/10/1
- Simple Emergent Action Representations from Multi-Task Policy Training2022/10/1
- Extraneousness-Aware Imitation Learning2022/10/1
- USEEK: Unsupervised SE(3)-Equivariant 3D Keypoints for Generalizable Manipulation2022/9/1
- DTact: A Vision-Based Tactile Sensor that Measures High-Resolution 3D Geometry Directly from Darkness2022/9/1
- RoboCraft: Learning to See, Simulate, and Shape Elasto-Plastic Objects with Graph Networks2022/5/1
- Learning Vision-Guided Quadrupedal Locomotion End-to-End with Cross-Modal Transformers2021/7/1
- DAIR: Disentangled Attention Intrinsic Regularization for Safe and Efficient Bimanual Manipulation2021/6/1
- Towards Learning to Play Piano with Dexterous Hands and Touch2021/6/1
- PyTouch: A Machine Learning Library for Touch Processing2021/5/1
- Multi-Task Reinforcement Learning with Soft Modularization2020/3/1