何が起きたか
arXivに掲載された論文「Embodied Turing Machines: Stateful Code for Robot Recursive Self-Improvement」は、カメラ画像と固有受容感覚からロボット・環境・課題の状態をコードで計測・追跡し、意思決定をすべてコードで行う「Code-Only-as-Policy(COAP)」を提案した。論文は、VLMやVLAを制御ループに入れず、同一のコードを複数エピソードや複数課題で再利用する設計を示している。RoboDojoの42件の両腕タスクでは、テスト時にモデルを使わずに70.24%の成功率を達成したとした。
詳細
論文はCOAPの利点を3点に整理している。第一に状態をコードとして明示的に保存できること、第二にコードが失敗からの回復や高速・低コストな実行を可能にすること、第三に新しい課題が共有ライブラリを再利用・継承・拡張でき、能力を積み上げられることである。著者らは、この性質がrecursive self-improvement(RSI)の媒体になり得ると位置づけ、コーディングエージェントが閉ループでライブラリを発展させる構図を提案している。
Key Facts
| 論文タイトルは「Embodied Turing Machines: Stateful Code for Robot Recursive Self-Improvement」である。 | [1] |
| 提案手法は「Code-Only-as-Policy(COAP)」で、カメラ画像と固有受容感覚から状態をコードで追跡し、意思決定をコードで行う。 | [1] |
| COAPはVLMやVLAを制御ループに入れず、同一コードを複数エピソード・複数課題で共有できる。 | [1] |
| RoboDojoの42件の両腕タスクで、テスト時にモデルを使わず成功率70.24%を達成したと論文は述べている。 | [1] |
| 論文はCOAPの上限が、状態推定の正確さとコードロジックの堅牢性に依存するとしている。 | [1] |
本紙の見方
この論文の新規性は、ロボット制御を「モデル中心」ではなく「状態を表すコード中心」に置き換えた点にある。VLAやVLMを使う従来型の枠組みでは、推論はモデルの内部に残るが、COAPはロボット、環境、課題の状態をコードで保持し、そのコードだけで意思決定する設計である。したがって焦点は、性能の高さそのものよりも、状態をどこまで明示化できるかに移る。RoboDojoの42件で70.24%という結果は、この設計が少なくとも限定された両腕タスク群で成立しうることを示す材料だが、一般化の範囲を直ちに示すものではない。 本紙の過去報道は与えられていないため、ここでは公開された本文だけから読むと、COAPは「エピソード横断で同じライブラリを使う」という点で、単発のタスク解決よりも再利用性を重視している。recursive self-improvementという題名が示す通り、論点はロボットが新しい行動を学ぶことではなく、コードベース自体が積み上がることで能力が拡張されるかにある。これは、学習済みモデルの再学習サイクルとは別に、実行可能なロジックの蓄積を中核に置く発想である。ここで重要なのは、COAPがVLAやAgent Harnessの代替を完全に主張しているのではなく、論文自身が「効率的なデータエンジン」としても機能しうると位置づけている点だ。 業界構造への含意としては、ロボットの性能競争がモデル規模だけでなく、状態表現の設計とコード資産の蓄積に移る可能性がある。もし状態を十分に正確に切り出せるなら、推論コストやオンライン実行コストを抑えつつ、課題ごとのロジックをライブラリとして継承できるからである。一方で、この方式が成立する条件は、論文が明示する通り状態推定の精度とコードの堅牢性に強く依存する。したがって次に確認すべき論点は、42課題以外での再現性、モデル不使用の範囲、タスク追加時にどの程度コードが再利用されたか、そして失敗復帰の挙動がどこまで安定しているかである。
なぜ重要か
論文は、ロボットの意思決定をモデル呼び出しではなくコードで完結させる設計を示しており、計算コストや実行制御をどこまで単純化できるかが論点になる。RoboDojoの42件で70.24%という数値が示されたことで、少なくとも限定された両腕タスクでは「状態をコード化する」アプローチの実行可能性が示唆された。
日本への影響
日本のロボット研究や実装で重視される実機制御では、モデルの推論だけでなく、状態推定・例外処理・再利用可能な制御コードの設計が競争力の差になり得る。論文が示すCOAPの条件は、センサー入力から状態を正確に切り出せるかどうかにあり、実機の制御ロジックやソフトウェア資産を持つ国内勢には接続しやすい一方、状態表現の精度が低い場合は優位が出にくい。