何が起きたか
2024年11月28日、arxiv.orgに掲載された論文で、研究チームはVLAモデルの汎化を改善する「GRAPE」を提案した。GRAPEは軌跡レベルの嗜好アライメントを用い、成功・失敗の両方から報酬を学習する。実験では、既知タスクで51.79%、未見タスクで58.20%の成功率向上を達成した。
詳細
GRAPEは、VLAモデルを軌跡レベルでアライメントし、成功と失敗の両方の試行から報酬を暗黙的にモデル化する。複雑な操作タスクを独立した段階に分解し、大規模視覚言語モデルが提案するキーポイントを用いて、カスタマイズされた時空間制約を通じて嗜好モデリングを自動的に導く。これらの制約は柔軟で、安全性、効率性、タスク成功などの異なる目的に合わせて調整できる。実験は実世界とシミュレーションの両方で行われ、安全性と効率性の目的に合わせた場合、衝突率を37.44%、ロールアウトのステップ長を11.15%削減した。コード、モデル、データは公開されている。
Key Facts
| GRAPEはVLAモデルの汎化を改善する手法で、軌跡レベルの嗜好アライメントを用いる。 | [1] |
| 実世界とシミュレーションの実験で、既知タスクの成功率を51.79%、未見タスクを58.20%向上させた。 | [1] |
| 安全性と効率性の目的に合わせた場合、衝突率を37.44%、ロールアウトのステップ長を11.15%削減した。 | [1] |
| GRAPEは複雑な操作タスクを独立した段階に分解し、大規模視覚言語モデルが提案するキーポイントを用いて時空間制約を設定する。 | [1] |
| コード、モデル、データはhttps://grape-vla.github.io/で公開されている。 | [1] |
なぜ重要か
GRAPEは、ロボット政策の汎化性能を大幅に向上させる可能性を示した。これにより、ロボットが多様なタスクや環境に適応する能力が高まり、実用化への道が開かれる。また、失敗事例を活用する手法は、データ効率の改善にもつながり、ロボット学習のコスト削減に寄与するだろう。