何が起きたか
arXivは2026年9月27日、実体操作向けのベンチマーク「CodeActionBench」を公開した。25の操作課題を通じて、一般目的のマルチモーダルモデルが視覚理解と推論を実行可能なコードに落とし込み、Code-as-Policyとして操作を組み立てられるかを評価する内容である。評価は、タスク特化の追加学習、デモンストレーション、外部の専用認識・把持モジュール、事前に与えた場面状態、定義済みの操作ポリシーを使わない条件で行う。
詳細
ベンチマークでは、エージェントが視覚証拠を選び、課題に必要な3次元推定を行い、操作対象を構成し、方策を反復的に実行・修正する。共有ロボットAPIはRGB観測、較正済みの幾何操作、ロボットからのフィードバック、範囲を限定した動作を提供し、課題ごとの判断は評価対象のエージェントに委ねる。固定されたタスク設定、リソース予算、非公開の物理結果検証器により、モデルや実行環境の比較を制御している。 評価は9構成、675試行で実施され、成功率は2.7%から73.3%の範囲だった。最も良い構成はGPT-6 AstraとCodex CLIで、3回の試行のうち25課題中22課題を少なくとも1回は解いた。
Key Facts
| arXivが2026年9月27日に「CodeActionBench」を公開した。 | [1] |
| CodeActionBenchは25の操作課題で構成される。 | [1] |
| 評価ではタスク特化の追加学習、デモンストレーション、外部の専用認識・把持モジュール、事前に与えた場面状態、定義済みの操作ポリシーを使わない。 | [1] |
| 評価は9構成・675試行で行われ、成功率は2.7%から73.3%だった。 | [1] |
| 最良構成はGPT-6 AstraとCodex CLIで、3回の試行のうち25課題中22課題を少なくとも1回は解いた。 | [1] |
本紙の見方
CodeActionBenchの新しさは、一般目的のマルチモーダルモデルを「認識モデル」ではなく、コードとして方策を生成し、実機操作を反復修正まで含めて評価する点にある。一方で、ベンチマーク自体は25課題という限定された枠組みであり、ロボットの身体制御を現場の完全なタスク遂行に置き換えるものではない。つまり、ここで見ているのは完成品の操作性能というより、視覚推論から実行コードへの変換能力である。 技術的に重要なのは、共有APIがRGB観測、較正済み幾何操作、ロボットフィードバック、範囲を限定した動作だけを渡し、外部の専用認識・把持モジュールや事前の場面状態を封じている点である。これにより、モデルがどこで失敗するかを切り分けやすくしている。9構成・675試行で成功率が2.7%から73.3%まで開いたことは、モデル名だけでなく実行ハーネスの違いが結果を大きく左右することを示す。特にGPT-6 AstraとCodex CLIが25課題中22課題を少なくとも1回解いた一方で、軌跡解析では空間整列、物体保持、完了判断に難点が残ったとされる。 本紙の見方としては、今回のポイントは「できる/できない」の単純な判定ではなく、どの工程で崩れるかを再現可能な形で測っている点にある。実体操作では、視覚理解、3D推定、手先の動作、成功判定が連結しており、どれか一つの改善だけでは全体性能が上がらない可能性がある。したがって、次に確認すべき論点は、25課題の内訳、各課題での失敗パターンの再現性、リソース予算の具体値、そして別モデルや別ハーネスでの順位変動である。さらに、成功率の幅が大きい以上、比較の再現条件をどこまで固定できるかが、研究の実用的な意味を左右するとみられる。
なぜ重要か
arXivの論文は、実機操作をコード生成と反復実行の問題として測る枠組みを提示した。ロボットや実世界操作の研究では、単なる認識精度ではなく、視覚入力から行動コードへの変換と失敗時の修正能力が課題になるためである。