何が起きたか

2026年6月6日、arXivにプレプリント論文「CLASP: Language-Driven Robot Skill Selection and Composition using Task-Parameterized Learning」が公開された。この論文は、自然言語コマンドからロボットがタスクを理解・実行するためのモジュール型アーキテクチャを提案している。

詳細

CLASPは、タスクパラメータ化されたカーネル化運動プリミティブ(TP-KMPs)と事前学習済みの視覚言語モデル(VLM)を組み合わせたアーキテクチャである。学習段階では、2〜5回のキネスティックデモンストレーションからスキルを獲得し、VLMが各スキルのパラメータと前提条件を記述したスキルスキーマを生成する。実行段階では、VLMがコマンドを解釈してスキルを選択し、パラメータの結合を推論し、共分散重み付き合成によって新しい行動を生成する。既存のスキルや合成では不十分な場合は、能力のギャップを特定して追加のデモンストレーションを要求する。微調整は不要とされる。

Key Facts

CLASPは、タスクパラメータ化されたカーネル化運動プリミティブ(TP-KMPs)と事前学習済みの視覚言語モデル(VLM)を組み合わせたモジュール型アーキテクチャである。出典一覧
学習段階では、2〜5回のキネスティックデモンストレーションからスキルを獲得し、VLMがスキルスキーマを生成する。出典一覧
実行段階では、VLMがコマンドを解釈してスキルを選択し、パラメータ結合を推論し、共分散重み付き合成で新しい行動を生成する。出典一覧
既存のスキルや合成で不十分な場合、システムは能力ギャップを特定し、対象を絞ったデモンストレーションを要求する。出典一覧
7自由度マニピュレータでの検証で、スキル選択・合成・能動学習を要するシナリオにおいて73.3%〜100%の成功率を達成した。出典一覧

本紙の見方

本論文の新規性は、データ効率の高いタスクパラメータ化模倣学習と、自然言語接地を提供するVLMをモジュール型で統合した点にある。従来のVLAやVLMは大量のデータを必要とする一方、タスクパラメータ化模倣学習は言語接地が欠けていた。CLASPはこのギャップを、VLMによるスキルスキーマ生成と実行時の解釈で埋める。微調整を不要とし、2〜5回のデモンストレーションで学習できる点は、実環境での適用可能性を高める。ただし、検証は7自由度マニピュレータに限定され、成功率もシナリオによってばらつきがある。また、VLMの解釈に依存するため、複雑な言語指示や未学習のスキルへの対応は未知数である。業界への含意としては、ロボットのプログラミングを自然言語で行える可能性を示し、特に中小企業や非専門家によるロボット導入の障壁を下げる可能性がある。一方で、VLMの誤解釈やスキル合成の安全性検証が今後の課題となる。次に確認すべきは、より多様なタスクや実環境での性能、VLMの解釈精度、スキル合成の安全性である。

なぜ重要か

CLASPは、ロボットのスキル獲得と実行を自然言語で直感的に制御する可能性を示す。データ効率の高さは、実世界での迅速な適応を可能にし、ロボットの柔軟な活用につながる。ただし、実用化にはVLMの信頼性と安全性の検証が不可欠であり、今後の研究動向が注目される。