日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
具現化エージェント/自己進化arXiv:2608.16590v1

Zetta ζ: 自己進化する物理知能のための効率的な閉ループ具現化ハーネス

Zetta $ζ$: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence

シェア:XThreadsFacebookLINEはてブBluesky

ロボットの実行中にコードベースの批評家と回復スキルをオンラインで進化させる閉ループハーネスを提案し、LIBERO-ProとRoboCasaで高い成功率と高速化を達成した。

詳しい要約

1. どんなもの?

Zettaは、物理実行中に閉ループで自己進化するembodied harnessを提案する。既存のエージェント型システムはオープンループで、ロールアウト中は固定スキルに従い、エピソード完了後にのみ反省する。Zettaは、ベースポリシーを凍結したまま、コードベースのランタイム批評家と回復スキルをオンラインで進化させる。3つの異なるタイムスケールのループにより、アクション周波数ガバナンス、ロールアウトレベルの批評家-回復提案、検証ゲート付きスキル更新を提供する。また、エージェントロジックと異種実行リソースを分離するロールアウトインフラZ-Infraを備える。

2. 先行研究と比べてどこがすごい?

先行研究のharnessはオープンループで、実行中の状態変化に追従できず、エピソード後の反省のみで制御できない。Zettaは、物理インタラクションに必要な高速なロボット-環境状態追跡を、大規模エージェントモデルの推論周波数を超えて実現するため、閉ループで実行中に批評家とスキルを進化させる点が新しい。また、ベースポリシーを凍結しつつスキルを更新することで、安定性と進化を両立している。

3. 技術・手法の肝は?

手法の核は、3つのタイムスケール分離ループである。第1ループはアクション周波数で実行をガバナンスし、第2ループはロールアウトレベルで批評家と回復スキルを提案し、第3ループは検証ゲートを通過したスキルのみを更新する。これにより、大規模モデルの遅さを補いつつ、実行中に適応する。また、Z-Infraはエージェントロジックと実行リソースを分離し、スケーラブルなロールアウトを可能にする。

4. どうやって有効だと検証した?

LIBERO-ProとRoboCasaベンチマークで評価し、現在のロールアウト予算内でそれぞれ90.8%と93.6%の成功率を達成し、最先端を更新した。また、推論速度が11.1倍高速化された。自己探索経験によって成功率がスケールし、学習したスキルはゼロショットで転移し、ロボットの「Aha Moment」が出現したことを報告している。

5. 議論はある?

要旨からは、閉ループ自己進化が物理知能のスケーリング経路を開くという主張があるが、具体的な限界や議論は不明。例えば、ベースポリシー凍結の制約や、スキル更新の検証基準、実世界でのロバスト性などは要旨に明記されていない。また、成功率の数値は特定の予算下でのものであり、汎用性には議論の余地がある。

6. 次に読むべき論文は?

要旨で参照されているベンチマークはLIBERO-ProとRoboCasaであり、これらに関連する論文が次に読むべき候補である。また、関連手法として、エージェント型ポリシーやオープンループharnessの研究が挙げられる。具体的には、LIBEROベンチマークの元論文やRoboCasaの元論文、およびembodied agentの閉ループ学習に関する最近の研究が該当する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu Chen, Xiangyu Li, Yikai Zheng, Yaoyu Guo, Weijun Wang, Kun Li, Hao Wu, Yunxin Liu, Ting Cao

分類: cs.RO

原文アブストラクト

Embodied agents are increasingly used to close the gap left by end-to-end policy models. Yet the agentic path has not realized closed-loop learning in physical execution: existing harnesses remain largely open-loop, following fixed skills during rollout and reflecting only after an episode completes. Such post-hoc reflection cannot govern execution as it unfolds, because physical interaction requires decisions to track rapidly changing robot-environment states at a frequency beyond today's large agentic models. We present Zetta, a closed-loop embodied harness that evolves code-based runtime critics and recovery skills online while keeping the base policy frozen. Through three timescale-separated loops, Zetta provides action-frequency governance, rollout-level critic-recovery proposal, and validation-gated skill updates. Together with Z-Infra, a rollout infrastructure decoupling agent logic from heterogeneous execution resources, Zetta achieves state-of-the-art success on LIBERO-Pro and RoboCasa under our current rollout budget, reaching 90.8% and 93.6%, with an 11.1x inference speedup; success continues to scale with self-exploration experience; learned skills transfer zero-shot, and clear robotic "Aha Moments" emerge. These results show that closed-loop harness self-evolution opens a scaling path for reliable physical intelligence.