何が起きたか
SUNは2026-08-31に、マルチステージ操作向けの「SUN: Agentic Robot Policy Learning with Persistent Task Programs」を公開した。提案の中心は、グラウンデッドな関係を、最適制御の目的関数、満足判定、学習報酬にそろえてコンパイルする「Semantically UNified (SUN) Programs」である。これを使う実行ハーネス「Kuafu」は、foundation modelをタスクレベルのエージェントとして動かし、シーン準備、検証、残差RL、データ生成を束ねる。
詳細
著者らによると、Kuafuはプログラムのフィードバックで候補プログラムを修正し、訓練診断で相対的な報酬重みを調整する設計である。受理されたタスク意味論をツール呼び出しの間も保持することを狙うとしている。 評価では、9つのマルチステージ操作課題で平均82.03%の成功率を達成した。学習済みコントローラは人手テレオペレーションの10.57倍の速度でデモンストレーションを生成し、そのデータは最強ベースライン比で視覚ポリシーの成功率を23.6ポイント改善した。学習した方策はFrankaとKinovaの物理ロボットにゼロショットで転移した。
Key Facts
| SUNは、グラウンデッドな関係を制御目的・満足判定・報酬に整合させる「Semantically UNified (SUN) Programs」を提案した。 | [1] |
| Kuafuは、foundation modelをタスクレベルのエージェントとして使い、シーン準備、検証、残差RL、データ生成を統括する。 | [1] |
| 9つのマルチステージ操作課題で平均82.03%の成功率を示した。 | [1] |
| 学習済みコントローラは、人手テレオペレーションの10.57倍の速度でデモを生成した。 | [1] |
| そのデータにより、視覚ポリシーの成功率は最強ベースライン比で23.6ポイント改善した。 | [1] |
本紙の見方
今回のポイントは、単にロボット方策を学習したことではなく、タスク記述を保ったまま制御・判定・報酬を同一のプログラム表現に落とし込み、それをデータ生成までつなげた点にある。従来の「制御」と「学習」を並べるだけではなく、SUN Programsで両者の意味論をそろえ、Kuafuがその上で計画、検証、残差学習、データ生産を回す構成であるため、論文の主役は方策そのものよりも、方策を作る前段の実行基盤にあると読める。 公開情報だけを見ると、この成果は単発の模倣学習や強化学習の性能比較というより、複数段階の操作をまたいでタスク意味を保つための中間表現を提示した点が新しい。9課題で平均82.03%という数字、10.57倍のデータ生成速度、23.6ポイントの改善は、いずれも学習性能だけでなく、データ収集のボトルネックをどこまで圧縮できるかを示す指標になっている。 業界構造の観点では、焦点はモデル性能よりも、実機データをどう安く、どう整合的に作るかに移る。Kuafuがシーン準備、検証、残差RL、データ生成を束ねるなら、必要になるのは単体モデルの精度だけではなく、タスク定義の整形式、フィードバックでの修復能力、診断に基づく報酬重み付けの調整である。これは、マルチステージ操作で失敗しやすい箇所を人手で埋めるのか、プログラム側で閉じるのかという設計論に直結する。 未確定の論点は、この方法が課題数を増やしたときに維持できるか、どの程度のタスク定義が必要か、またFrankaとKinova以外の機体や新しい環境へどこまで同じSUN Programsを流用できるかである。論文はゼロショット転移を示したが、実運用での失敗モード、データ品質の閾値、報酬重み調整の安定性まではまだ検証が要る。
なぜ重要か
著者らの結果が示すのは、マルチステージ操作で人手テレオペレーションに依存していたデータ生成を、10.57倍の速度で回せる可能性がある点である。実機に対してFrankaとKinovaへゼロショット転移したとされるため、ロボットごとに個別最適化する負担をどこまで減らせるかが焦点になる。