Winson Han
収録論文 13本 ・ フィジカルAI/ロボット学習
動作予測VLA操作sim2real把持ナビゲーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MolmoMotion: 言語指示による3D点軌跡予測動作予測2026/6/17
言語指示に基づいて物体上の3D点の将来軌跡を予測するモデルと、大規模データセット・ベンチマークを構築した論文。
- MolmoAct2: 実世界展開のための行動推論モデルVLA2026/5/1
実世界展開に適した完全オープンな行動推論モデルMolmoAct2を提案し、空間推論に特化したVLMバックボーン、新しいデータセット、オープンな行動トーカナイザ、適応的推論機構などを導入して性能と効率を向上させた。
- MolmoB0T: 大規模シミュレーションによるゼロショット操作の実現操作2026/3/1
大規模で多様なシミュレーションデータのみを用いて、実世界へのゼロショット転移が可能であることを示し、静的・移動操作の両方で有効なポリシーを訓練した。
- MolmoSpaces:ロボットナビゲーションとマニピュレーションのための大規模オープンエコシステムsim2real2026/2/1
23万以上の多様な屋内環境と13万の物体アセットを備え、MuJoCoやIsaacなど複数シミュレータで使えるオープンなロボットベンチマーク基盤を構築し、実機との高い相関を示した。
- MolmoAct: 空間で推論できる行動推論モデルVLA2025/8/1
知覚・計画・制御を3段階で統合し、深度を考慮した知覚トークンから編集可能な軌道計画を生成して低レベル行動を予測するロボット基盤モデルを提案。シミュレーションと実世界で高い性能を示し、1万件超の軌道データセットも公開した。
- GraspMolmo:大規模合成データ生成による汎用タスク指向把持把持2025/5/1
自然言語指示とRGB-D画像から、大規模合成データで学習した視覚言語モデルにより、意味的に適切な把持を予測する汎用タスク指向把持モデルを提案。
- One RING:ロボット屋内ナビゲーションの汎用モデルナビゲーション2024/12/1
シミュレーションで大規模な機体形状のランダム化を行い、様々な実機ロボットに適応できる機体非依存の屋内ナビゲーション方策を学習した。
- Holodeck: Language Guided Generation of 3D Embodied AI Environments2023/12/1
- SPOC: Imitating Shortest Paths in Simulation Enables Effective Navigation and Manipulation in the Real World2023/12/1
- ProcTHOR: Large-Scale Embodied AI Using Procedural Generation2022/6/1
- ManipulaTHOR: A Framework for Visual Object Manipulation2021/4/1
- RoboTHOR: An Open Simulation-to-Real Embodied AI Platform2020/4/1
- ALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday Tasks2019/12/1