何が起きたか
arXivに2026-08-17付で掲載された論文「Teach and Grow: An Agent-Centered Architecture for General Robot Learning」は、追加の勾配更新やファインチューニング、強化学習を行わずに新しい操作タスクを取り込むTeach-and-Grow Learning(TGL)を提案した。論文は、事前学習済み重みを固定したまま、少数の成功デモから再利用可能なロボット技能を作る設計としている。実装ではOpenAI GPT-6 Astraを多モーダル推論に、Codexをロボット用ツール接続に使った。
詳細
TGLは、デモ間で共通するサブゴールを特定し、それを閉ループのSkill Blocksとして表現し、現在のシーンに接地させる構成である。物理フィードバックが次の行動と回復を導き、検証済みの行動はPersistent Skill Libraryに入り、Experience Memoryが条件と修復を記録する。論文は、4つのLIBEROスイートで平均99.9%の成功率、7つのLIBERO-Plus擾乱カテゴリで92.4%の成功率を示したとしている。
Key Facts
| Teach and Grow: An Agent-Centered Architecture for General Robot Learning が arXiv に2026-08-17付で掲載された | [1] |
| Teach-and-Grow Learning(TGL)は、追加の勾配更新、ファインチューニング、強化学習を行わない訓練不要のアーキテクチャである | [1] |
| 実装は OpenAI GPT-6 Astra を多モーダル推論に、Codex をロボットツール接続に用いた | [1] |
| 4つの LIBERO スイートで平均99.9%の成功率を示した | [1] |
| 7つの LIBERO-Plus 擾乱カテゴリで92.4%の成功率を示した | [1] |
本紙の見方
今回の論文の新しさは、ロボットの新技能獲得を「再学習の高速化」ではなく「重み固定のまま経験を蓄積する仕組み」として設計している点にある。従来のVLAやworld-actionモデルは、未知タスクへの適応で追加データ収集と政策最適化を繰り返す前提だったのに対し、TGLはデモから抽出したSkill BlockとSkill Library、Experience Memoryを中核に据え、学習更新なしで技能を増やすとしている。つまり、入力された実演をそのまま模倣させるのではなく、再利用できる中間表現へ変換してから保存する構造である。 この構造は、Teach and Grow: An Agent-Centered Architecture for General Robot Learning で示された「教学が前提ではなく加速器である」という主張を、実装レベルで支えている。論文はGPT-6 AstraとCodexを使って多モーダル推論とツール接続を分担させており、知覚・推論・ロボット操作の結合を大規模言語モデル側で担う設計が見える。ただし、性能指標はLIBERO系ベンチマーク上のもので、実機の多様な作業環境で同じ挙動が再現されるかは別問題である。したがって、今回の焦点はモデルの汎用性そのものより、どの程度のデモ数でSkill Blockが安定して蓄積されるかに移る。 産業構造への含意としては、ロボット学習のボトルネックが単純なモデル更新ではなく、技能をどう保存し、どう検索し、どう回復させるかに寄っていく可能性がある。Skill LibraryとExperience Memoryが機能するなら、個別工程ごとに再訓練する負担は下がるが、同時にどの条件を「修復可能な失敗」として記録するかが重要になる。未確定の論点は、実機での汎用性、Skill Blockの粒度、デモ数に対する性能変化、そしてGPT-6 AstraとCodex以外の基盤モデルに置き換えた際の再現性である。
なぜ重要か
論文が主張するのは、ロボットの新技能獲得を追加学習ではなくデモの再利用で進められる可能性である。成功率の根拠として4つのLIBEROスイートで99.9%、7つのLIBERO-Plus擾乱カテゴリで92.4%を示しており、少数の実演から技能を蓄積する設計がベンチマーク上で機能したことが分かる。
日本への影響
日本の製造・物流現場では、個別タスクごとに再学習を要する方式より、デモをSkill Block化して蓄積する方式のほうが、現場変更への追随設計として論点になり得る。もっとも、この論文が示した数値はLIBERO系ベンチマークに限られるため、日本の実環境にそのまま当てはめることはできない。