Wilbert Pumacay
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MolmoB0T: 大規模シミュレーションによるゼロショット操作の実現操作2026/3/1
大規模で多様なシミュレーションデータのみを用いて、実世界へのゼロショット転移が可能であることを示し、静的・移動操作の両方で有効なポリシーを訓練した。
- MolmoSpaces:ロボットナビゲーションとマニピュレーションのための大規模オープンエコシステムsim2real2026/2/1
23万以上の多様な屋内環境と13万の物体アセットを備え、MuJoCoやIsaacなど複数シミュレータで使えるオープンなロボットベンチマーク基盤を構築し、実機との高い相関を示した。
- MolmoAct: 空間で推論できる行動推論モデルVLA2025/8/1
知覚・計画・制御を3段階で統合し、深度を考慮した知覚トークンから編集可能な軌道計画を生成して低レベル行動を予測するロボット基盤モデルを提案。シミュレーションと実世界で高い性能を示し、1万件超の軌道データセットも公開した。
- RoboEval:ロボットマニピュレーションのための構造化・スケーラブルな評価フレームワークマニピュレーション2025/7/1
ロボットマニピュレーションの評価を二値的成功から拡張し、効率・協調・安全性などの行動指標と段階的進捗・失敗局所化を含む構造化ベンチマークを提案。8つの両手タスクと3000以上の実演を提供。
- SAM2Act:視覚基盤モデルと記憶アーキテクチャを統合したロボットマニピュレーションマニピュレーション2025/1/1
視覚基盤モデルを活用したマルチビューロボット方策SAM2Actを提案し、RLBenchで86.8%の成功率を達成。さらに記憶バンクを備えたSAM2Act+と記憶依存タスク評価用ベンチマークMemoryBenchを導入し、94.3%の成功率を実現した。
- AHA: ロボットマニピュレーションの失敗を検出・推論する視覚言語モデルVLA2024/10/1
ロボット操作の失敗を自然言語で検出・説明するオープンソースVLM「AHA」を提案し、シミュレーションで生成した大規模失敗データセットで学習させ、実世界や未見タスクへの汎化性能を示した。
- RoboPoint: ロボティクス向け空間アフォーダンス予測の視覚言語モデルVLA2024/6/1
合成データで視覚言語モデルをロボット向けに微調整し、言語指示から画像内のキーポイントアフォーダンスを予測するRoboPointを開発。実世界データ不要でスケーラブルに学習でき、ナビゲーションや操作などのタスクで既存手法を上回る。
- Manipulate-Anything:視覚言語モデルによる実世界ロボット操作の自動化マニピュレーション2024/6/1
視覚言語モデルを活用し、特権的な状態情報や手設計スキルなしで実世界の任意の静的物体を操作する軌道を自動生成する手法を提案し、既存手法を上回る性能とロバストな模倣学習を実現した。
- コロッセウム:ロボットマニピュレーションの汎化性能を評価するベンチマークマニピュレーション2024/2/1
環境の色・テクスチャ・照明・カメラ位置など14種類の摂動に対するロボットマニピュレーションの汎化性能を評価するシミュレーションベンチマークを提案し、最先端モデルの成功率が30〜50%低下することを示した。