何が起きたか

arXivに2026年8月17日付で公開された論文(識別番号2608.16590v1)において、研究チームは閉ループ型身体化ハーネス「Zetta」を発表した。Zettaは、基本方針を凍結したまま、コードベースのランタイム批評家と回復スキルをオンラインで進化させる。同ハーネスは、アクション周波数ガバナンス、ロールアウトレベルの批評家回復提案、検証ゲート付きスキル更新を提供する3つのタイムスケール分離ループを備える。Zettaは、異種実行リソースからエージェントロジックを分離するロールアウトインフラストラクチャ「Z-Infra」と組み合わせることで、LIBERO-Proで90.8%、RoboCasaで93.6%の成功率を達成し、推論速度は11.1倍に高速化した。

詳細

既存の身体化エージェントのハーネスは、ロールアウト中に固定スキルに従い、エピソード完了後にのみ反映する開ループ方式が主流であり、物理実行中の閉ループ学習は実現されていなかった。物理的相互作用では、ロボットと環境の状態変化を高速に追跡する必要があるが、今日の大規模エージェントモデルの周波数を超えるため、事後反映では実行を制御できないと論文は指摘する。 Zettaは、この問題に対処するため、3つのタイムスケール分離ループを導入する。これにより、アクション周波数ガバナンス、ロールアウトレベルの批評家回復提案、検証ゲート付きスキル更新を実現する。また、Z-Infraはエージェントロジックと異種実行リソースを分離するロールアウトインフラストラクチャであり、Zettaの効率的な実行を支える。 実験では、現在のロールアウト予算の下で、LIBERO-ProとRoboCasaにおいて最先端の成功率を達成した。成功率は自己探索経験とともにスケールし、学習されたスキルはゼロショットで転移し、ロボットの「Aha Moments」が出現したと報告されている。

Key Facts

Zettaは、基本方針を凍結したまま、コードベースのランタイム批評家と回復スキルをオンラインで進化させる閉ループ型身体化ハーネスである。[1]
Zettaは、アクション周波数ガバナンス、ロールアウトレベルの批評家回復提案、検証ゲート付きスキル更新を提供する3つのタイムスケール分離ループを備える。[1]
Zettaは、ロールアウトインフラストラクチャ「Z-Infra」と組み合わせて使用される。Z-Infraはエージェントロジックと異種実行リソースを分離する。[1]
Zettaは、LIBERO-Proで90.8%の成功率を達成した。[1]
Zettaは、RoboCasaで93.6%の成功率を達成した。[1]
Zettaは、11.1倍の推論速度向上を達成した。[1]
成功率は自己探索経験とともにスケールし、学習されたスキルはゼロショットで転移する。[1]
ロボットの「Aha Moments」が出現したと報告されている。[1]
論文はarXivに2026年8月17日付で公開された(識別番号2608.16590v1)。[1]

なぜ重要か

Zettaは、物理実行中の閉ループ学習を可能にする点で、身体化エージェントの信頼性向上に寄与する可能性がある。既存の開ループ方式の限界を克服し、自己進化によるスケーリング経路を開くことが示唆される。