何が起きたか

研究者らは、ロボット操作における汎用ポリシーの性能向上を目的としたStageWAMを発表した。StageWAMは、MotusベースのWorld Action Model (WAM) にStage-JEPAを追加し、現在の観測とタスク指示から次の段階の潜在目標を予測する。50のRoboTwin 2.0タスクで評価し、成功率90.25%、実行ステップ数を最強ベースライン比で5.97%削減した。

詳細

既存の汎用ロボットポリシーは、多様なタスクにわたってマルチモーダルな観測と言語によるタスク指示を行動にマッピングする。しかし、既存手法は通常、未来を固定長の短いビデオ・行動チャンクとして表現する。この短期的な未来は、行動実行のための局所的なシーン進化を捉えるが、タスクが現在の段階から次の段階へどのように進行すべきかを明示する段階レベルの未来は記述しない。 そこで研究者らは、ロボット操作における2つの補完的な未来を区別した。局所的なシーン進化を捉える短期的な物理的未来と、タスクの進行を表す段階レベルの意味的未来である。提案手法StageWAMは、MotusベースのWorld Action Model (WAM) に、目標条件付きJoint-Embedding Predictive Architecture (JEPA) 予測器であるStage-JEPAを統合する。Stage-JEPAは、現在の観測とタスク指示が与えられると、凍結されたV-JEPA2エンコーダを使用して現在状態の表現を抽出し、次に推論される段階の潜在目標を予測する。 評価は、クリーン環境とランダム化環境の両方を含む50のRoboTwin 2.0タスクで実施された。StageWAMは全体の成功率90.25%を達成し、成功したロールアウトにおける平均実行ステップ数を最強ベースラインと比較して5.97%削減した。

Key Facts

StageWAMは、MotusベースのWorld Action Model (WAM) にStage-JEPAを統合した手法である。[1]
Stage-JEPAは、目標条件付きJoint-Embedding Predictive Architecture (JEPA) 予測器である。[1]
Stage-JEPAは、凍結されたV-JEPA2エンコーダを使用して現在状態の表現を抽出する。[1]
StageWAMは、50のRoboTwin 2.0タスクで評価された。[1]
StageWAMは、クリーン環境とランダム化環境の両方で評価された。[1]
StageWAMは、全体の成功率90.25%を達成した。[1]
StageWAMは、成功したロールアウトにおける平均実行ステップ数を最強ベースラインと比較して5.97%削減した。[1]
既存手法は通常、未来を固定長の短いビデオ・行動チャンクとして表現する。[1]

なぜ重要か

本手法は、ロボット操作における段階レベルの意味的未来を明示的に予測することで、タスク進行の理解を向上させる。これにより、成功率の向上と実行効率の改善が示され、汎用ロボットポリシーの発展に寄与する可能性がある。