日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
評価基盤arXiv:2608.09892v1

XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステム

XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment

シェア:XThreadsFacebookLINEはてブBluesky

ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減する。

詳しい要約

1. どんなもの?

XPolicyLabは、ロボットポリシーの評価とデプロイを統一するための標準仕様とオープンエコシステムを提供する。共通のobservation、action、trajectoryスキーマと、observation更新、action予測、バッチ実行、エピソードリセットのための最小限のアダプタインターフェースを定義し、依存関係を分離したclient/serverアーキテクチャにより、ポリシー推論と環境実行を分離する。これにより、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減する。42のロボットポリシーを統合し、インストール、デバッグ、サービス提供、評価のワークフローを標準化する。

2. 先行研究と比べてどこがすごい?

従来のロボットポリシー評価・デプロイは、モデル固有のソフトウェア依存関係、データ表現、ランタイムインターフェースにより断片化されており、N個のポリシーとM個の環境を接続するにはO(NM)の個別統合が必要だった。XPolicyLabは、共通スキーマと最小限のアダプタインターフェースを定義し、依存関係を分離したアーキテクチャを採用することで、統合コストをO(N+M)に削減する点が革新的。また、42のポリシーを統合し、モデル固有のコードのばらつきを桁違いに減らし、環境側のループを固定参照の数行に収めることで、異種性をポリシー側に閉じ込めることを実証している。

3. 技術・手法の肝は?

技術の肝は、共通のobservation、action、trajectoryスキーマと、最小限のアダプタインターフェース(observation更新、action予測、バッチ実行、エピソードリセット)の定義。さらに、依存関係を分離したclient/serverアーキテクチャにより、ポリシー推論と環境実行を分離し、各側がネイティブなソフトウェアスタックを保持し、ローカルまたはリモートで実行可能にする。これにより、ポリシー側の異種性をアダプタ内に閉じ込め、環境側のループを統一する。

4. どうやって有効だと検証した?

有効性は、42のロボットポリシーを統合し、モデル固有のコードのばらつきが桁違いに大きい一方で、環境側のループが固定参照の数行に収まることを確認した。また、管理された研究では、標準に準拠することで代表的なポリシーの統合工数が5時間以上から2時間に削減され、パッケージ化されたエージェントスキルによりさらに30分に短縮された。さらに、同じアダプタがRoboTwin、RoboDojoシミュレーション、標準化された実ロボット評価を単一のインターフェースで提供することを示した。

5. 議論はある?

要旨からは、議論の余地や限界についての明示的な言及はない。ただし、統合工数の削減効果は示されているが、実際のポリシー性能や汎用性への影響については言及されていない。また、42のポリシーがどの程度多様であるか、標準がすべてのポリシーに適用可能かどうかは不明。さらに、client/serverアーキテクチャの通信オーバーヘッドや、リモート実行時のレイテンシーなどの実用上の課題については要旨からは不明。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、RoboTwinとRoboDojoが挙げられる。また、ロボットポリシー評価の標準化に関連する分野として、robotic policy evaluationやbenchmarkingに関する研究が考えられる。具体的には、RoboTwinやRoboDojoの論文、またはロボット学習のベンチマークに関する論文(例:RoboBench、RLBenchなど)が次に読むべき候補となる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: XPolicyLab Community, Tianxing Chen, Yue Chen, Tian Nian, Zijian Cai, Guangyu Chen, Wenwei Lin, Qiwei Liang, Peicheng Xiang, Kailun Su, Zixuan Li, Junyuan Tang, Yan Qin, Qiangyu Chen, Shaolong Zhu, Xiang Li, Jiahao Zhang, Weijie Wan, Baijun Chen, Honghao Su, Kehe Ye, Shujia Liu, Kaixuan Wang, Haotian Liang, Yunze Liu, Mingleyang Li, Yuran Wang, Boyu Chen, Hongzhe Bi, Shuhe Huang, Hengkai Tan, Jisong Cai, Yao Mu, Jun Guo, Xiaofeng Wang, Zheng Zhu, Weijie Ke, Hengtao Li, Yuhang Tang, Xiaofan Li, Ganlin Yang, Zhangzheng Tu, Shuai Yang, Wenxuan Song, Pengxiang Ding, Kaidong Zhang, Yu Sun, Junliang Guo, Tong Zhang, Yixing Chen, Rongxu Cui, Zongzheng Zhang, Haoxiang Ma, Junhao Cai, Haoyu Zhang, Senqiao Yang, Jinhui Ye, Pengguang Chen, Shu Liu, Xiu Su, Wenhan Fang, Wenhao Li, Yichao Cao, Chengyao Wang, Qiang Chen, Ping Luo, Wenbo Ding

分類: cs.RO

原文アブストラクト

Robot policy evaluation and deployment remain fragmented by model-specific software dependencies, data representations, and runtime interfaces, so that connecting N policies to M evaluation environments requires O(NM) separate integrations. We present XPolicyLab, a unified standard and open ecosystem that reduces this cost to O(N+M). XPolicyLab specifies common observation, action, and trajectory schemas together with a minimal adapter interface for observation updates, action prediction, batched execution, and episode reset, while a dependency-isolated client/server architecture separates policy inference from environment execution, so that each side retains its native software stack and may run locally or remotely. The ecosystem integrates 42 robot policies and standardizes their installation, debugging, serving, and evaluation workflows. Across these adapters, model-specific code varies by an order of magnitude while the environment-facing loop stays within a few lines of a fixed reference, confirming that the contract confines heterogeneity to the policy side. In a controlled study, conforming to the standard reduces the integration effort of a representative policy from over five hours to two hours, and packaged agent skills reduce it further to thirty minutes. The same adapters serve RoboTwin, RoboDojo simulation, and standardized real-robot evaluation through one interface. XPolicyLab is released as shared infrastructure for reproducible policy comparison and standardized deployment across simulation and physical platforms. Project website: https://xpolicylab.github.io/.