Haoran Geng
収録論文 30本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 物理的インタラクションの学習:触覚・力覚を考慮したロボット学習のサーベイ触覚・力覚学習2026/8/1
触覚・力覚センシングを統合したロボット学習手法を、マルチモーダルかつ多段階のシステム設計の観点から統一的な分類学TF-ARTを用いて整理し、今後の研究課題を考察したサーベイ論文。
- ロボット学習のためのワールドモデル:包括的サーベイサーベイ2026/5/1
ロボット学習におけるワールドモデルの役割と進化を体系的にレビューし、ポリシー学習、シミュレーション、評価への応用や課題を整理したサーベイ論文。
- D-REX: 巧みな把持学習のための微分可能な実世界-シミュレーション-実世界エンジン把持/シミュレーション2026/3/1
ガウススプラット表現を用いた微分可能エンジンを構築し、実世界の視覚観測とロボット制御信号から物体質量を同定しつつ、把持ポリシーを同時学習する手法を提案。
- 大規模動画プランナーによる汎用ロボット制御VLA2025/12/1
インターネット規模の人間活動動画で生成的なロボット計画モデルを基盤モデル規模で学習し、新しい場面やタスクに対してゼロショットで動画計画を生成して実機の行動に変換する手法を提案した。
- M³Aポリシー:フォトメトリック再レンダリングによる可変材料操作拡張ポリシーマニピュレーション2025/12/1
単一の実演から光輸送に基づくフォトメトリック再レンダリングで多様な材料の実演を生成し、材料に依存しない操作ポリシーを学習する枠組みを提案。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- DIPOLE: 視覚と幾何を融合したロバストな視覚運動汎化VLA2025/11/1
視覚と言語・幾何の相補的なモダリティを訓練時のドロップアウトとクロスアテンションで融合し、照明や視点変化に強い拡散ポリシーを実現した。
- シミュレーションの音:生成的音声でマルチモーダルなsim-to-realロボット方策を学習sim2real2025/7/1
物理シミュレータに大規模生成モデルを統合し、映像に条件づけたリアルな音声を合成することで、実機データなしに注ぐタスクのマルチモーダル方策を学習し、未知の容器や液体へのゼロショット転移を実現した。
- SimLauncher: シミュレーション事前学習によるサンプル効率の高い実世界ロボット強化学習の起動sim2real2025/7/1
デジタルツインシミュレーションで視覚運動ポリシーを事前学習し、その知識を実世界強化学習の価値ブートストラップと行動提案に活用することで、サンプル効率と成功率を大幅に向上させるフレームワークを提案。
- SkillBlender:スキルブレンドによる汎用人型ロコマニピュレーションロコマニピュレーション2025/6/1
目標条件付きの汎用プリミティブスキルを事前学習し、それらを動的にブレンドすることで、タスク固有の報酬設計を最小限に抑えつつ多様な人型ロコマニピュレーションを実現する階層型強化学習フレームワークを提案。
- ロドリゲスネットワーク:ロボット動作学習のためのキネマティクス誘導バイアス模倣学習2025/6/1
関節系の運動学構造を反映した帰納バイアスを持つニューラル演算子「Neural Rodrigues Operator」を提案し、それを用いた動作処理特化型ネットワークRodriNetを構築。模倣学習や単眼3Dハンド再構成で有効性を示した。
- ViTacFormer:視触覚クロスモーダル表現による巧みなマニピュレーションマニピュレーション2025/6/1
視覚と触覚をクロスアテンションで融合し、将来の触覚信号を予測する自己回帰ヘッドを備えた表現学習手法を提案。多指ハンドの模倣学習に応用し、実世界タスクで成功率を約50%向上させ、11段階・2.5分の長期的操作を自律遂行した。
- FastTD3:ヒューマノイド制御のためのシンプルで高速かつ高性能な強化学習歩行2025/5/1
並列シミュレーションや大バッチ更新、分布型クリティックなどの改良を加えたTD3エージェントにより、ヒューマノイドロボットの強化学習を単一GPUで3時間未満に高速化した手法を提案。
- DexGarmentLab: 巧みな衣類操作のための環境と汎化可能な方策マニピュレーション2025/5/1
両手での巧みな衣類操作に特化した大規模シミュレーション環境DexGarmentLabを構築し、単一の実演から多様な軌道を自動生成する手法と、形状・変形の多様性に汎化する階層的な操作方策HALOを提案した。
- RoboVerse:スケーラブルで汎化可能なロボット学習のための統合プラットフォーム・データセット・ベンチマークsim2real2025/4/1
複数のシミュレータとロボット形態に対応する統合シミュレーション基盤MetaSimと、高品質な合成データセット、模倣学習・強化学習の統一ベンチマークを提供するフレームワークを提案。
- 大規模人間動画から学ぶ汎用人型ポーズ制御VLA2024/12/1
2000万件超の人間動画から人型ロボットのポーズとテキスト指示のデータセットHumanoid-Xを構築し、テキスト入力で人型ロボットを制御する大規模モデルUH-1を学習した。
- GAPartManip:材質に依存しない関節物体操作のための大規模パーツ中心データセットマニピュレーション2024/11/1
透明な蓋や反射する取っ手など深度知覚が難しい家庭内の関節物体を操作するため、材質ランダム化とパーツ単位の操作姿勢注釈を備えた大規模データセットを構築し、頑健な操作を可能にするモジュール型フレームワークを提案した。
- DexGraspNet 2.0:大規模合成乱雑シーンでの生成的器用把持の学習マニピュレーション2024/10/1
1319物体・8270シーン・4億2700万把持からなる大規模合成ベンチマークを構築し、局所形状を条件とする拡散モデルによる二段階把持手法を提案。乱雑シーンでの実世界把持成功率90.7%を達成。
- D3RoMa: 素材に依存しないロボットマニピュレーションのための視差拡散ベース深度センシング深度推定2024/9/1
ステレオ画像から拡散モデルで視差マップを予測し、透明・鏡面物体でも高精度な深度推定を実現してロボット操作を改善する手法を提案。
- PhysPart: 操作可能物体の物理的に妥当な部品補完3D生成2024/8/1
操作可能な物体の欠けた部品を、形状だけでなく物理的な安定性と可動性を考慮して拡散モデルで生成する手法を提案。
- RAM: 検索ベースのアフォーダンス転移による汎用ゼロショットロボットマニピュレーションマニピュレーション2024/7/1
ロボット・人間・カスタムデータからアフォーダンス記憶を構築し、言語指示に応じて類似デモを検索して2Dアフォーダンスを3D実行可能な形に転移することで、未知の物体・環境・身体でもゼロショットで操作を実現するフレームワーク。
- Ag2Manip: エージェント非依存の視覚・行動表現による新規マニピュレーションスキルの学習マニピュレーション2024/4/1
人間の操作動画からエージェント非依存の視覚表現と、ロボットの運動学を汎用エージェント代理に抽象化した行動表現を学習し、ドメイン固有のデモなしで新規マニピュレーションタスクの性能を大幅に向上させた。
- SAGE: Bridging Semantic and Actionable Parts for GEneralizable Manipulation of Articulated Objects2023/12/1
- ManipLLM: Embodied Multimodal Large Language Model for Object-Centric Robotic Manipulation2023/12/1
- Make a Donut: Hierarchical EMD-Space Planning for Zero-Shot Deformable Manipulation with Tools2023/11/1
- UniDexGrasp++: Improving Dexterous Grasping Policy Learning via Geometry-aware Curriculum and Iterative Generalist-Specialist Learning2023/4/1
- ARNOLD: A Benchmark for Language-Grounded Task Learning With Continuous States in Realistic 3D Scenes2023/4/1
- PartManip: Learning Cross-Category Generalizable Part Manipulation Policy from Point Cloud Observations2023/3/1
- UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal Generation and Goal-Conditioned Policy2023/3/1
- End-to-End Affordance Learning for Robotic Manipulation2022/9/1