何が起きたか

arXivに2026-10-01付で掲載された論文「OpenRUA: Robot-Use Agents Are Zero-Shot Visuomotor Policies」は、ROS 2に端末アクセスを与えるだけの「zero-abstraction harness」により、既製のコーディングエージェントをロボット操作に使えると主張した。著者らは、認識をファイルI/O、操作をコーディングとして再定義し、Claude Code with Claude Opus 5でCaP-Bench 99.0%、LIBERO-PRO 87.0%を報告している。

詳細

論文は、既存研究がロボット利用のために複雑なカスタムハーネスや専用ワークフロー、独自インターフェースを組み立ててきたのに対し、OpenRUAはROS 2のドキュメントと基本ツールだけを与える最小構成を採ると説明する。workspace-as-harness設計の下で、エージェント自身に作業の整理を任せ、agentic workflow のオーケストレーションは行わないとしている。 また、論文は挙動の分析として、認識では96.80%のエピソードで生の感覚入力を処理してメートル単位の計測を導くプログラムを自発的に書いたとし、操作では95.87%のエピソードでグリッパー制御などのモーション制御クライアントを、50.13%のエピソードでセンサーのフィードバックに応じて動きを調整する閉ループ制御プログラムを自発的に構築したと述べている。コードはGitHubで公開するとしている。

Key Facts

論文名は「OpenRUA: Robot-Use Agents Are Zero-Shot Visuomotor Policies」である。[1]
掲載日は2026-10-01で、媒体はarXivである。[1]
OpenRUAはROS 2への端末アクセスだけを与える「zero-abstraction harness」を提案している。[1]
Claude Code powered by Claude Opus 5でCaP-Bench 99.0%、LIBERO-PRO 87.0%の成功率を報告している。[1]
認識で96.80%、操作で95.87%、閉ループ制御で50.13%の自発的なプログラム生成を報告している。[1]

本紙の見方

OpenRUAの新規性は、ロボット操作のために専用の抽象化層や定型ワークフローを積み上げるのではなく、ROS 2のネイティブなソフトウェア interface へ端末アクセスだけを与え、既製のコーディングエージェントに作業の組み立てを委ねた点にある。一方で、認識をファイルI/O、操作をコーディングとして扱う発想自体は、ソフトウェア実行系をロボット制御に持ち込む延長線上にある。したがって、この論文は「新しいロボット本体」よりも「既存のエージェントをどう接続するか」という接続層の設計変更を前面に出したものと読める。 本紙の過去報道は与えられていないため、ここでは一般的な接続だけ述べる。論文が強調するのは、専用プリミティブを追加しなくても、認識や操作の一部をエージェントが自発的にプログラム化できたという点である。これは、ロボット向けAIの評価軸が、単一タスクの学習済みポリシーだけでなく、既存ソフトウェア環境への適応力や、必要な制御クライアントをその場で書けるかどうかへ広がることを示す材料になりうる。 業界構造への含意は、ロボット制御の中心が「事前に作り込んだ専用ミドルウェア」から「標準インターフェースに接続したコード生成」に近づくかどうかにある。ただし、論文が示したのはCaP-BenchとLIBERO-PROという特定ベンチマーク上の結果であり、実機の安全制約、失敗時の回復、長時間運用、ROS 2以外の環境での再現性は別問題である。したがって次に確認すべきなのは、どの程度のタスクで同じ成功率を保てるか、閉ループ制御の50.13%が実機でどこまで耐えるか、そして外部ハーネスを減らした分の安全性と保守性をどう担保するかである。

なぜ重要か

ROS 2という既存のロボット基盤に、専用の抽象化層なしでコード生成エージェントをつなぐ発想は、ロボット側に大きな追加実装を持ち込まずに済む可能性がある。論文が示した99.0%と87.0%の成功率、および認識・操作での自発的なプログラム生成比率は、従来のタスク別設計とは異なる接続方式が評価対象になりうることを示している。