何が起きたか

2026年8月16日にarXivに公開された論文で、GigaBrain-0.7が発表された。これは、多様なロボット形態への汎化を向上させた具現化基盤モデルであり、理解・予測・行動を3システム構成で統合する。事前学習には37,000時間以上の異種データを使用し、視覚言語理解と多形態行動生成を同時に最適化する一段階アライメント訓練を導入した。同社は、先行のGigaBrain-0シリーズやπ0.5などの最先端モデルと比較して、ゼロショット能力、言語条件付き指示追従、事後訓練タスク成功率で大幅な改善を達成したとしている。

詳細

GigaBrain-0.7は、視覚言語行動(VLA)モデルのパラダイムに基づくが、より効果的なアーキテクチャ設計、大規模で異種のデータレジームへのスケーリング、タスクや形態を超えた広範な汎化を目指している。論文では、現在のVLAシステムがこれらの点で未解決の課題を持つと指摘し、GigaBrain-0.7がその解決策を提示する。 同モデルは、自社のMaker H01プラットフォームや主流のロボット形態で、家庭および産業シナリオの両方で強いタスク適応性と完了能力を示したと報告されている。また、すべてのトレーニングコードと事前学習済みモデルの重みは公開される予定である。

Key Facts

GigaBrain-0.7は、3システム構成で理解・予測・行動を統合する具現化基盤モデルである。[1]
事前学習には37,000時間以上の異種データを使用している。[1]
一段階アライメント訓練を導入し、視覚言語理解と多形態行動生成を同時に最適化する。[1]
先行のGigaBrain-0シリーズやπ0.5と比較して、ゼロショット能力、指示追従、タスク成功率で大幅な改善を達成したとしている。[1]
自社のMaker H01プラットフォームおよび主流のロボット形態で、家庭・産業シナリオの両方で強いタスク適応性を示した。[1]
すべてのトレーニングコードと事前学習済みモデルの重みは公開予定である。[1]

なぜ重要か

GigaBrain-0.7は、VLAモデルのスケーリングとアーキテクチャ設計の可能性を示し、ロボット基盤モデルの汎化性能向上に寄与する。公開予定のコードと重みは、研究コミュニティでの再現と発展を促進する。