何が起きたか

2026年6月6日、arXivにプレプリント論文「CLASP: Language-Driven Robot Skill Selection and Composition using Task-Parameterized Learning」が公開された。この論文は、自然言語コマンドからロボットがタスクを理解・実行するためのモジュール型アーキテクチャを提案している。

詳細

CLASPは、タスクパラメータ化されたカーネル化運動プリミティブ(TP-KMPs)と事前学習済みの視覚言語モデル(VLM)を組み合わせたアーキテクチャである。学習段階では、2〜5回のキネスティックデモンストレーションからスキルを獲得し、VLMが各スキルのパラメータと前提条件を記述したスキルスキーマを生成する。実行段階では、VLMがコマンドを解釈してスキルを選択し、パラメータの結合を推論し、共分散重み付き合成によって新しい行動を生成する。既存のスキルや合成では不十分な場合は、能力のギャップを特定して追加のデモンストレーションを要求する。微調整は不要とされる。

Key Facts

CLASPは、タスクパラメータ化されたカーネル化運動プリミティブ(TP-KMPs)と事前学習済みの視覚言語モデル(VLM)を組み合わせたモジュール型アーキテクチャである。[1]
学習段階では、2〜5回のキネスティックデモンストレーションからスキルを獲得し、VLMがスキルスキーマを生成する。[1]
実行段階では、VLMがコマンドを解釈してスキルを選択し、パラメータ結合を推論し、共分散重み付き合成で新しい行動を生成する。[1]
既存のスキルや合成で不十分な場合、システムは能力ギャップを特定し、対象を絞ったデモンストレーションを要求する。[1]
7自由度マニピュレータでの検証で、スキル選択・合成・能動学習を要するシナリオにおいて73.3%〜100%の成功率を達成した。[1]

なぜ重要か

CLASPは、ロボットのスキル獲得と実行を自然言語で直感的に制御する可能性を示す。データ効率の高さは、実世界での迅速な適応を可能にし、ロボットの柔軟な活用につながる。ただし、実用化にはVLMの信頼性と安全性の検証が不可欠であり、今後の研究動向が注目される。