Bangguo Li
収録論文 4本 ・ フィジカルAI/ロボット学習
VLAマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GEM: 生成的監視が身体化知能を強化するVLA2026/5/27
視覚言語モデルの事前学習に深度マップ生成タスクを統合し、身体化環境での空間・物理理解を向上させるGEMを提案。大規模データセットGEM-4Mを公開し、シミュレーションと実世界で高い性能を実証した。
- RDT2:UMIデータのスケーリング限界を探り、ゼロショットのクロスエンボディメント汎化を実現VLA2026/2/1
7BパラメータのVLMを基盤とし、1万時間超のUMIデータと3段階学習で、未知の物体・シーン・指示・ロボット機体にゼロショットで汎化するロボット基盤モデルを構築した。
- データ効率の良い身体性マニピュレーションのための原子スキルライブラリ構築法マニピュレーション2025/1/1
VLPでタスクをサブタスクに分解し、原子スキルとして抽象化・VLA微調整することで、動的に拡張可能な原子スキルライブラリを構築し、データ効率と新タスク適応性を高める手法を提案。
- RDT-1B:双腕マニピュレーションのための拡散基盤モデルマニピュレーション2024/10/1
双腕ロボット操作のための12億パラメータの拡散ベース基盤モデルRDTを提案し、統一行動空間と大規模マルチロボットデータで事前学習することで、未知物体へのゼロショット汎化や言語指示追従、少数デモからの新スキル学習を実現した。