Kaichun Mo
収録論文 25本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- DreamDojo: 大規模人間動画から学ぶ汎用ロボット世界モデル世界モデル2026/2/1
44,000時間の一人称視点人間動画から汎用的なロボット世界モデルを学習し、連続潜在行動を代理ラベルとして活用することで、巧みな操作の物理理解と精密な行動制御を実現した研究。
- PointWorld: 実世界ロボット操作のための3D世界モデルのスケーリングマニピュレーション2026/1/1
RGB-D画像とロボットの行動コマンドから3D点群の動きを予測する大規模事前学習済み3D世界モデルを提案し、実機ロボットのモデル予測制御に応用した。
- Openpi Comet:2025 BEHAVIORチャレンジ競技解法マニピュレーション2025/12/1
2025 BEHAVIORチャレンジに向けた解法を提案し、事前学習と事後学習のスケーリング効果を明らかにして、検証Qスコア0.345を達成した。
- 物理AIのための動画基盤モデルによる世界シミュレーション世界モデル2025/11/1
テキスト・画像・動画から世界を生成する動画基盤モデルCosmos-Predict2.5と、Sim2Real/Real2Real変換を行うCosmos-Transfer2.5を発表し、ロボティクス向けの合成データ生成やシミュレーションを可能にした。
- 人間の単一動画からの視覚的模倣によるスロット単位のロボット配置模倣学習2025/4/1
人間の作業動画を1本見せるだけで、どの物体をどこに置くかを理解し、ロボットが同じ配置作業を再現できるモジュール式システムSLeRPを提案した。
- MatchMaker: ロボット組立のための組立アセット自動生成sim2real2025/3/1
干渉するアセットペアをシミュレーション可能なペアに変換し、単一アセットから嵌合する相手を生成し、接触面を侵食して現実的な部品を作るパイプラインを提案。生成データは多様性と組立スキル学習の有効性で従来手法を上回る。
- 物理AIのためのCosmos世界基盤モデルプラットフォーム世界モデル2025/1/1
物理AI開発者向けに、カスタマイズ可能な世界モデルを構築するための基盤モデル・動画キュレーション・トークナイザを提供するオープンソースプラットフォーム。
- 3D-MVP: ロボットマニピュレーションのための3Dマルチビュー事前学習マニピュレーション2024/6/1
マスク付きオートエンコーダを用いて大規模3Dデータセットで視覚エンコーダを事前学習し、ロボットマニピュレーションの汎化性能を向上させる手法を提案した。
- URDFormer: 実世界画像から関節構造を持つシミュレーション環境を構築するパイプラインsim2real2024/5/1
実世界の画像から関節構造や物理特性を推定し、シミュレーションシーンを自動生成するURDFormerを提案。テキストから画像生成モデルを活用して学習データを生成し、大規模でリアルなシーン構築を可能にした。
- STOW: Discrete-Frame Segmentation and Tracking of Unseen Objects for Warehouse Picking Robots2023/11/1
- Where2Explore: Few-shot Affordance Learning for Unseen Novel Categories of Articulated Objects2023/9/1
- COPILOT: Human-Environment Collision Prediction and Localization from Egocentric Videos2022/10/1
- DualAfford: Learning Collaborative Visual Affordance for Dual-gripper Manipulation2022/7/1
- Fixing Malfunctional Objects With Learned Physical Simulation and Functional Prediction2022/5/1
- RoboAssembly: Learning Generalizable Furniture Assembly Policy in a Novel Multi-robot Contact-rich Simulation Environment2021/12/1
- IFR-Explore: Learning Inter-object Functional Relationships in 3D Indoor Scenes2021/12/1
- AdaAfford: Learning to Adapt Manipulation Affordance for 3D Articulated Objects via Few-shot Interactions2021/12/1
- Learning to Regrasp by Learning to Place2021/9/1
- VAT-Mart: Learning Visual Action Trajectory Proposals for Manipulating 3D ARTiculated Objects2021/6/1
- O2O-Afford: Annotation-Free Large-Scale Object-Object Affordance Learning2021/6/1
- Where2Act: From Pixels to Actions for Articulated 3D Objects2021/1/1
- SAPIEN: A SimulAted Part-based Interactive ENvironment2020/3/1
- Learning 3D Part Assembly from a Single Image2020/3/1
- The AdobeIndoorNav Dataset: Towards Deep Reinforcement Learning based Real-world Indoor Robot Visual Navigation2018/2/1