日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2608.15875v1

GigaBrain-0.7:三系統アーキテクチャによる創発的能力へのスケーリング

GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

シェア:XThreadsFacebookLINEはてブBluesky

視覚言語行動モデルのスケーリングとアーキテクチャ改善により、多様なロボットへの汎化を大幅に向上させた基盤モデルを提案。

詳しい要約

1. どんなもの?

GigaBrain-0.7は、多様なロボットのembodimentにわたる汎化を大幅に改善したembodied foundation modelである。理解・予測・行動を統合するthree-system architectureを採用し、37,000時間以上の異種embodiedデータで事前学習を行う。さらに、vision-language understandingとmulti-embodiment action generationを同時に最適化するone-stage alignment trainingを導入している。

2. 先行研究と比べてどこがすごい?

先行研究のGigaBrain-0 seriesやπ0.5などのstate-of-the-artモデルと比較して、foundation zero-shot capabilities、language-conditioned instruction following、post-training task success ratesで大幅な改善を達成している。特に、in-house Maker H01 platformと主流のロボットembodimentで、家庭および産業シナリオにおけるタスク適応性と完了能力の強さを示している。

3. 技術・手法の肝は?

技術の肝は、three-system architecture(理解・予測・行動を統合)と、37,000時間以上の異種データでの大規模事前学習、そしてone-stage alignment training(vision-language understandingとmulti-embodiment action generationを同時に最適化)にある。これにより、多様なembodimentへの汎化を実現している。

4. どうやって有効だと検証した?

有効性は、GigaBrain-0 seriesやπ0.5などの先行モデルとの比較実験により検証された。具体的には、foundation zero-shot capabilities、language-conditioned instruction following、post-training task success ratesの指標で評価し、in-house Maker H01 platformと主流のロボットembodimentでタスク適応性と完了能力を確認した。

5. 議論はある?

要旨からは、議論の詳細は不明である。ただし、大規模なデータとモデルスケーリングの有効性が示唆される一方で、計算コストや実世界展開の課題などが考えられるが、要旨には明記されていない。

6. 次に読むべき論文は?

要旨で参照されている先行研究として、GigaBrain-0 seriesとπ0.5が挙げられる。また、関連する分野の定番として、Vision-Language-Action (VLA) modelsやembodied foundation modelsに関する論文が考えられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi, Dengke Shang, Dingqian Zhang, Guan Huang, Guangqiang Wang, Guangqing Ding, Guo Li, Hangcong Li, Hengyu Zhong, Hongtao Lu, Jianbo Qin, Jiming Mao, Jing Zhu, Jindi Lv, Jingzhi Cui, Junjie Xie, Junyi Bao, Kai Liu, Lei Yuan, Limin Long, Lv Feng, Mingming Yu, Peng Li, Pengfei Yi, Qi Li, Qianli Zhang, Qingfang Li, Qitang Hu, Rui Zhang, Shaoyan Sun, Shibo Sun, Shiying Duan, Tenghui Chen, Tianze Liu, Weijie Ke, Wenyao Xue, Xiaofeng Wang, Xiaoyu Tian, Xinyu Liu, Xinze Chen, Yang Wang, Yankai Wang, Yejun Zeng, Yifan Li, Yifei Nie, Yilong Li, Yilong Liu, Yongchao Feng, Yumeng Wang, Yun Ye, Zhichao Liu, Ziheng He, Zonghai Yang, Zheng Zhu

分類: cs.RO

原文アブストラクト

Vision-language-action (VLA) models have become a dominant paradigm for generalist embodied agents, demonstrating strong complex and long-horizon task completion in structured settings. Yet it remains an open question whether current VLA systems can benefit from more effective architectural design, scale to substantially larger and more heterogeneous data regimes, and achieve broader generalization across tasks and embodiments. To this end, we present GigaBrain-0.7, an embodied foundation model with substantially improved generalization across diverse robot embodiments. Specifically, GigaBrain-0.7 unifies understanding, prediction, and action through a three-system architecture, scales pretraining to over 37,000 hours of heterogeneous embodied data, and introduces one-stage alignment training that jointly optimizes vision-language understanding and multi-embodiment action generation. Compared with the preceding GigaBrain-0 series and prior state-of-the-art models including $π_{0.5}$, GigaBrain-0.7 achieves substantial improvements in foundation zero-shot capabilities, language-conditioned instruction following, and post-training task success rates. In particular, on our in-house Maker H01 platform and mainstream robot embodiments, GigaBrain-0.7 demonstrates strong task adaptability and completion ability across both home and industrial scenarios. All training code and pretrained model weights will be released.