何が起きたか

arXivに2026-09-29付で掲載された論文「Encore: Few-Shot Agentic Discovery of Manipulation Strategies」は、ロボット操作において少数の実演を証拠として読み取り、コードを書くエージェントに戦略を探索させる手法「ENCORE」を示した。論文では、同手法がLIBERO-PROで同一言語モデル条件の従来エージェント型手法を96.3%対89.3%で上回ったとしている。さらに、RoboDojoではデモなしで成功するプログラムがなく、実機の両腕ロボットでは各5デモから2種類の操作を学習したと報告した。

詳細

ENCOREでは、決定的なビルダーが各デモを多視点キーフレーム、グリッパーイベント、フレーム列、完全な軌跡の束に圧縮し、コーディングエージェントは固定された知覚・行動APIに対してポリシープログラムを書く。論文によると、エージェントは少数の開発ロールアウトで反復的に修正し、その後は成功信号を見せない封印された評価の前にプログラムを固定する。

Key Facts

論文「Encore: Few-Shot Agentic Discovery of Manipulation Strategies」がarXivに掲載された。[1]
ENCOREは、少数の実演を訓練データではなく読むべき証拠として扱う。[1]
LIBERO-PROでは、デモありの条件で最初のプログラムが摂動タスクの半数に成功し、デモなしでは1タスクに成功した。[1]
凍結後のプログラムは、同じ言語モデルを用いた最強の既存エージェント型手法を96.3%対89.3%で上回った。[1]
実機の両腕ロボットで、ENCOREは5デモずつでcube handoverとcup inversionを学習した。[1]

本紙の見方

ENCOREの新しさは、ロボット操作を「タスク記述から直接解く」のでなく、少数デモを証拠パックに変換し、それを読んでコードを反復生成する流れに置いた点にある。多視点キーフレーム、グリッパーイベント、フレーム列、完全軌跡という入力の切り分けは、言語で曖昧に書かれがちな「どうつかむか」「どの順で接触するか」を外部化する設計である。一方で、固定API上でポリシーを書くという枠組み自体は既存のエージェント的手法の延長にあるため、完全な新概念というより、証拠の与え方と評価手順を厳密化した実装寄りの提案とみるのが妥当である。 本紙の過去報道はないため比較はできないが、論文内の構成からは、学習データを大規模に集めるより、少数デモをどの表現で渡すかが性能差を生む可能性が示されている。LIBERO-PROで96.3%という数字は、同一言語モデル条件での比較であり、言語モデル単体の能力差ではなく、プログラムの探索・固定・封印評価の手順が効いていることを示唆する。RoboDojoで「目標が書かれていない指示」ではデモなし成功がゼロだった点は、曖昧な自然言語だけでは操作戦略の復元が難しいことを裏づける。実機で両腕ロボットに適用できたことは、シミュレーション上の認識・制御の分離だけではなく、物理接触を含むタスクでも少数デモが機能しうることを示す材料である。 業界構造としては、この手法はロボットそのものの性能より、デモの収集・圧縮・評価というデータ処理層を競争軸に置く。多視点キーフレームやグリッパーイベントの束ね方が変われば、同じ実演でも学習可能性が変わるため、今後の焦点は「何本のデモで足りるか」より「どの形式に落とすとプログラム探索が安定するか」に移る可能性がある。加えて、成功信号を見せない封印評価は、過学習や評価漏れを避ける設計として重要だが、現場導入ではこの手順をどこまで再現できるかが問われる。未確定の論点としては、対象タスクの広がり、実機での再現性、デモ本数を増減した場合の性能変化、そして固定API以外のロボットスタックへの適用可能性が残る。

なぜ重要か

論文は、少数の実演を訓練データではなく「証拠」として扱う設計が、LIBERO-PROや実機両腕ロボットで機能しうることを示した。これは、デモ収集コストを抑えつつ操作戦略を作る必要があるロボット開発で、学習データの量だけでなく表現と評価の手順が重要になることを示唆する。

日本への影響

日本のロボット開発では、実機デモの収集と評価をどう標準化するかが論点になりうる。論文が示したのは、5デモ程度でも特定タスクを学べる可能性であり、少量デモを再利用できる圧縮・記録・検証の仕組みを持つ事業者ほど適応しやすい構造だとみられる。