日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
操作arXiv:2608.18227

エージェント型ロボティクスによる「Push-T」操作タスクの再考

Revisiting the "Push-T" Robot Manipulation Task with Agentic Robotics

シェア:XThreadsFacebookLINEはてブBluesky

LLMコーディングエージェントがデモデータなしでPush-Tタスクを解くアルゴリズムを生成し、拡散ポリシーより少ないステップで100%成功率を達成した。

詳しい要約

1. どんなもの?

Push-Tは、人間のデモンストレーションから操作ポリシーを学習するための象徴的なベンチマークである。本論文では、LLMコーディングエージェント(Claude Code with Fable 5)がデモデータなしでアルゴリズム的解決策を生成するAgentic Roboticsの文脈でPush-Tタスクを再検討する。エージェントは2D gymシミュレーションをオンラインで見つけ、シミュレーション実験でプッシュ力学を学習し、反復最適化により100%の成功率を達成した。さらに、自己生成カリキュラムでTから全アルファベット(Push-AからPush-Z)への拡張、FrankaとUR5アームの3Dクロスエンボディメントシミュレーションのコード生成も行った。

2. 先行研究と比べてどこがすごい?

従来のPush-Tは、人間のデモンストレーションから模倣学習(特に拡散ポリシー)を用いて視覚運動ポリシーを学習するのが一般的である。本研究は、デモデータを一切使わず、LLMコーディングエージェントがコードを生成して解決する点で革新的である。また、エージェントは最良の拡散ポリシー(200の人間デモで訓練)よりも46%少ないステップで100%の成功率を達成し、データ効率と性能の両面で優れている。さらに、アルファベット全体や異なるロボットアームへの一般化も示しており、従来の単一タスク学習を超える。

3. 技術・手法の肝は?

手法の核心は、LLMコーディングエージェント(Claude Code with Fable 5)をプロンプトして、デモデータなしでアルゴリズム的解決策を生成させることである。エージェントはオンラインで2D gymシミュレーションを見つけ、シミュレーション実験を通じてプッシュ力学を学習し、反復的にコードを最適化する。さらに、自己生成カリキュラムを用いてタスクを拡張し、3Dクロスエンボディメントシミュレーションのコードを生成する。

4. どうやって有効だと検証した?

Push-Tタスクで成功率100%を達成し、最良の拡散ポリシー(200の人間デモで訓練)と比較して46%少ないステップで成功した。また、Tから全アルファベット(Push-AからPush-Z)への拡張、FrankaとUR5アームの3Dクロスエンボディメントシミュレーションでの有効性を示した。ビデオ、ポリシー、詳細はオンラインで公開予定。

5. 議論はある?

要旨からは、エージェントがシミュレーションをオンラインで見つけたことや、コード生成の一般化可能性について議論がある可能性が示唆されるが、具体的な議論は不明。また、実世界での検証や、デモデータを使わないことの限界についての議論は要旨に含まれていない。

6. 次に読むべき論文は?

要旨で参照されているのは、拡散ポリシー(diffusion policy)と模倣学習(imitation learning)である。次に読むべき論文としては、拡散ポリシーの元論文(Diffusion Policy: Visuomotor Policy Learning via Action Diffusion)や、Agentic Robotics関連の研究(LLMエージェントによるコード生成)が挙げられる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Shuangyu Xie, Kaiyuan Chen, Ken Goldberg

分類: cs.RO

原文アブストラクト

Push-T is an iconic benchmark for learning manipulation policies from human demonstrations. The robot must use a single point of contact to push a T-shaped block into a target pose. In this short paper, we revisit the Push-T task in the context of emerging advances in Agentic Robotics where an LLM coding agent -- Claude Code with Fable 5 -- is prompted to create an algorithmic solution that does not require any demonstration data. We study how effective the agentic coding loop can solve the Push-T task, and compare the resulting code as policy with the visuomotor imitation learning policy. Results suggest that the agent found the 2D gym simulation online, and used sim experiments to learn push mechanics, iteratively optimizing to achieve 100% success rate using 46% fewer steps than the best diffusion policy trained with 200 human demonstrations. The coding agent also solve extensions from T to the full alphabet (Push-A to Push-Z) using a self generated curriculum and generated simulation code for the Franka and UR5 robot arms in 3D cross-embodiment simulations with visual feedback. Videos, policies and details will be posted online.

関連論文