何が起きたか

2026年8月18日にarXivで公開された論文「MANIGUARD: A Benchmark and Data Suite for Specification-Grounded Safety Evaluation and Improvement of Robotic Manipulation」において、研究チームはロボット操作の安全性評価・改善のためのフレームワーク「ManiGuard」を発表した。ManiGuardは、ManiGuard-Benchタスクスイートと、安全性注釈付き軌道生成パイプラインで構成される。ManiGuard-Benchは、6つの接触を伴う家庭タスク群を、スキル×制約の分類法に沿って200の固定基本タスクに整理し、安全性はタスク成功とは独立に指定される。各タスクは、1つの分布内摂動と4つの単軸分布外摂動(合計1,000の固定シナリオ)で評価される。さらに、自動動作計画ジェネレータと人間の遠隔操作を組み合わせたパイプラインにより、基本タスクあたり40件、合計8,000件の安全性注釈付きデモがリリースされた。

詳細

ManiGuardの評価では、物理的なFrankaプラットフォームとシミュレーションの両方で、学習された分類器やLLM判定ではなく、物理に基づく述語上のLTL_fに基づくオートマトンモニタが各ロールアウトを実行時チェックする。これにより、安全性仕様を固定したまま、分布内および4つの単軸分布外摂動(合計1,000の固定シナリオ)で各タスクを評価する。 ベンチマークでは、ゼロショットおよびファインチューニングされたVLA(視覚言語行動モデル)を23,000以上のロールアウトで評価した。その結果、(i) 成功ロールアウトの6〜21%が仕様に違反するなど、安全性はタスク成功とは独立に評価する必要があること、(ii) スイートでのファインチューニングにより、安全なタスク完了率がほぼゼロから7.5〜29.8%に向上し、関与かつ安全な行動が16〜40%から51〜72%に向上したこと、(iii) しかし、デモの規模を拡大しても埋まらないギャップが残り、関与したロールアウトの21〜42%が依然として違反し、6つのタスク群のうち2つはすべてのポリシーで安全成功率が2%未満であり、これらの失敗は分布シフトやハードウェア上でも持続することが示された。

Key Facts

ManiGuardは、仕様に基づくロボット操作の安全性評価・改善フレームワークであり、ManiGuard-Benchタスクスイートと安全性注釈付き軌道生成パイプラインで構成される。[1]
ManiGuard-Benchは、6つの接触を伴う家庭タスク群を200の固定基本タスクに整理し、スキル×制約の分類法に沿って構成される。[1]
各タスクは、1つの分布内摂動と4つの単軸分布外摂動で評価され、合計1,000の固定シナリオが生成される。[1]
各ロールアウトは、物理に基づく述語上のLTL_fに基づくオートマトンモニタによって実行時チェックされる。[1]
評価はシミュレーションと物理的なFrankaプラットフォームの両方で実施される。[1]
パイプラインは自動動作計画ジェネレータと人間の遠隔操作を組み合わせ、同じモニタで注釈付けされ、安全性を考慮したファインチューニングを直接サポートする。[1]
8,000件の安全性注釈付きデモがリリースされ、基本タスクあたり40件が提供される。[1]
ゼロショットおよびファインチューニングされたVLAを23,000以上のロールアウトで評価した。[1]
成功ロールアウトの6〜21%が安全仕様に違反することが判明した。[1]
ファインチューニングにより、安全なタスク完了率がほぼゼロから7.5〜29.8%に向上し、関与かつ安全な行動が16〜40%から51〜72%に向上した。[1]

なぜ重要か

ManiGuardは、ロボット操作における基礎モデルポリシーの安全性評価を、タスク成功から独立して行う枠組みを提供する。公開されたベンチマークとデータセットは、安全性を考慮したファインチューニングを可能にし、ロボット操作の安全性研究の進展に寄与する。