何が起きたか
arXivに2026-09-24付で掲載された論文は、Claude Code(Opus 5)とCodex(GPT-5.6 Sol、GPT-6 Astra)を用いたコーディングエージェントが、一般化タスク・モーションプランニング(generalized TAMP)で手作業のプランナーを上回ったと報告した。論文は28のシミュレーション環境で980本の生成プログラムを評価し、各プログラムを100件の保留インスタンスで試した。全体では98,000エピソードを検証している。
詳細
論文は、task and motion planning(TAMP)が、完全観測やobject-centric statesがあっても、離散的な意思決定が幾何・運動学・動力学の制約と強く結びつくため難しいと説明する。その上で、タスク記述とシミュレータへのアクセスを与え、固定のsynthesis budget内でプログラムを作成し、生成後はそのプログラムを凍結して未見インスタンスで評価する枠組みを取った。 結果として、16環境で比較可能だった範囲では、3つのエージェント構成はいずれも、手作業で設計されたプランナー、one-shot generation、LLMベースのgeneralized planning baselineを平均成功率で上回った。論文は成功率を「56% to 95% versus 47%」と示し、物体数が増えるほど、エージェントのプログラムはプランナーより高い成功率を維持しつつ、1インスタンス当たりの計算量を平均で1桁少なく使ったとしている。
Key Facts
| arXiv論文『Coding Agents for Generalized Task and Motion Planning Problems』が2026-09-24に掲載された。 | [1] |
| 評価対象はKinDERとPDDLStreamの28のシミュレーション環境で、980本の生成プログラムを各100件の保留インスタンスで試し、計98,000エピソードを評価した。 | [1] |
| 論文はClaude Code(Opus 5)とCodex(GPT-5.6 Sol、GPT-6 Astra)を用いた。 | [1] |
| 16環境で比較可能だった範囲では、3つのエージェント構成が手作業のプランナー、one-shot generation、LLMベースの一般化プランニング基準を平均成功率で上回った。 | [1] |
| 論文は、物体数が増えるほど、エージェントのプログラムがプランナーより高い成功率を保ち、平均で1桁少ない計算量で動作したとしている。 | [1] |
本紙の見方
この論文の新しさは、一般化TAMPを人手で設計した専用プランナーの改良問題としてではなく、コード生成型エージェントに「プログラムを書かせて固定し、未見インスタンスで試す」問題として切り出した点にある。TAMPはもともと離散判断と幾何・動力学制約の同時処理が難所であり、論文はそこに対して、環境との相互作用を通じて物理モデルを較正し、境界条件を試し、方針を修正するというエージェントの振る舞いを確認している。単なる推論性能の比較ではなく、実行可能な計画コードの合成能力を測っている点が焦点だとみられる。 一方で、結果は汎用エージェントがあれば既存のロボット計画の全工程を置き換えられることを示したものではない。評価は28のシミュレーション環境、980本の生成プログラム、98,000エピソードという大規模な実験だが、比較可能だったのは16環境に限られ、成功率も「56% to 95% versus 47%」と環境差が大きい。したがって、どの環境でどの程度安定するか、また固定されたsynthesis budget内で性能がどこまで伸びるかが次の論点になる。 本紙の過去報道はないため、連続性の観点ではこの論文単体の位置づけを読む必要がある。構造的には、入力のタスク記述とシミュレータ、処理としてのコード合成、出力としての実行可能な計画、さらに未見インスタンスでの評価という連鎖が示されている。これはロボット本体の制御よりも、計画生成の自動化に近い層でのボトルネックを扱うもので、今後はプランナー代替としての計算効率、環境依存性、そして物理モデルをどこまで一般化できるかが検証対象になるとみられる。論文が公開したコードとプロンプトにより再現性は高まるが、実環境への移植、対象環境数を増やしたときの性能維持、どの失敗モードが残るかは本文だけではまだ十分に見えない。
なぜ重要か
論文が示したのは、一般化TAMPでコード生成型エージェントが手作業のプランナーを平均成功率で上回り、しかも平均で1桁少ない計算量で動いた点である。ロボット計画の自動化において、専用実装を積み上げる方式の限界をどこまで補えるかが論点になる。
日本への影響
日本のロボット研究や製造現場で関心が高いのは、個別工程ごとの専用プランナーをどこまでコード生成で置き換えられるかだとみられる。もっとも、この論文が対象にしたのはシミュレーション環境であり、実機導入や安全性評価は示していないため、日本での適用可否は別途の検証が必要である。