Yi Ru Wang
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MolmoAct2: 実世界展開のための行動推論モデルVLA2026/5/1
実世界展開に適した完全オープンな行動推論モデルMolmoAct2を提案し、空間推論に特化したVLMバックボーン、新しいデータセット、オープンな行動トーカナイザ、適応的推論機構などを導入して性能と効率を向上させた。
- RoboPlayground: 構造化物理ドメインによるロボット評価の民主化評価フレームワーク2026/4/1
ロボット操作ポリシーの評価を、固定ベンチマークではなく自然言語でタスクを定義できる構造化物理ドメイン上で行うフレームワークを提案し、ユーザビリティと一般化評価の有効性を示した。
- MolmoAct: 空間で推論できる行動推論モデルVLA2025/8/1
知覚・計画・制御を3段階で統合し、深度を考慮した知覚トークンから編集可能な軌道計画を生成して低レベル行動を予測するロボット基盤モデルを提案。シミュレーションと実世界で高い性能を示し、1万件超の軌道データセットも公開した。
- RoboEval:ロボットマニピュレーションのための構造化・スケーラブルな評価フレームワークマニピュレーション2025/7/1
ロボットマニピュレーションの評価を二値的成功から拡張し、効率・協調・安全性などの行動指標と段階的進捗・失敗局所化を含む構造化ベンチマークを提案。8つの両手タスクと3000以上の実演を提供。
- SAM2Act:視覚基盤モデルと記憶アーキテクチャを統合したロボットマニピュレーションマニピュレーション2025/1/1
視覚基盤モデルを活用したマルチビューロボット方策SAM2Actを提案し、RLBenchで86.8%の成功率を達成。さらに記憶バンクを備えたSAM2Act+と記憶依存タスク評価用ベンチマークMemoryBenchを導入し、94.3%の成功率を実現した。
- AHA: ロボットマニピュレーションの失敗を検出・推論する視覚言語モデルVLA2024/10/1
ロボット操作の失敗を自然言語で検出・説明するオープンソースVLM「AHA」を提案し、シミュレーションで生成した大規模失敗データセットで学習させ、実世界や未見タスクへの汎化性能を示した。
- Manipulate-Anything:視覚言語モデルによる実世界ロボット操作の自動化マニピュレーション2024/6/1
視覚言語モデルを活用し、特権的な状態情報や手設計スキルなしで実世界の任意の静的物体を操作する軌道を自動生成する手法を提案し、既存手法を上回る性能とロバストな模倣学習を実現した。
- NEWTON: Are Large Language Models Capable of Physical Reasoning?2023/10/1
- AR2-D2:Training a Robot Without a Robot2023/6/1
- MVTrans: Multi-View Perception of Transparent Objects2023/2/1
- Seeing Glass: Joint Point Cloud and Depth Completion for Transparent Objects2021/10/1