何が起きたか

研究者らは、Vision-Language-Action(VLA)モデルの分布外(OOD)汎化を改善するフレームワーク「StellaVLA」を発表した。StellaVLAは、テスト時に単一の取得デモに条件付けすることで、追加のデータ収集やファインチューニングなしに適応する。自動オフラインパイプラインにより、各生の軌跡を構造化デモ(タスク計画、サブゴール記述、言語化された3D動作など)に変換し、ゼロ人力注釈コストで実現する。

詳細

StellaVLAの核心は、専門家が行ったことを模倣するのではなく、その理由を伝えることにある。自動オフラインパイプラインは、各生の軌跡を構造化デモ(例:タスク計画、サブゴール記述、言語化された3D動作)に変換し、ゼロ人力注釈コストで実現する。この構造化デモをインコンテキストガイダンスとして提供することで、ポリシーはピクセル軌跡を模倣するのではなくタスクについて推論でき、実ロボット、人間の手、XRデモなど異なる embodiment 間で転移可能になる。 並行デュアルトレーニング設計により、トレーニング中にこの推論を内在化し、推論時にはアクションエキスパートのみを使用するため、リアルタイムの高周波制御を維持し、追加のレイテンシを発生させない。VLA-Arenaリーダーボード(2026年8月1日時点)で、StellaVLAは総合スコア0.63で1位を獲得し、強力な先行モデル(π0.5とLingBot-VLA)の0.44と0.22を上回った。さらに、LIBEROで平均成功率98.8%、LIBERO-Plusで成功率85.1%を達成した。 実ロボットベンチマークでは、StellaVLAが人間/ロボットデモと人間からロボットへのXRデモの両方をインコンテキスト構造化デモとして使用し、VLAモデルがOODタスクに適応できることを実証した。

Key Facts

StellaVLAは、テスト時に単一の取得デモに条件付けすることでOOD状況に適応するVLAフレームワークである。[0]
自動オフラインパイプラインにより、各生の軌跡を構造化デモ(タスク計画、サブゴール記述、言語化された3D動作など)に変換し、ゼロ人力注釈コストで実現する。[0]
構造化デモは、実ロボット、人間の手、XRデモなど異なる embodiment 間で転移可能である。[0]
並行デュアルトレーニング設計により、トレーニング中に推論を内在化し、推論時にはアクションエキスパートのみを使用する。[0]
VLA-Arenaリーダーボード(2026年8月1日時点)で、StellaVLAは総合スコア0.63で1位を獲得した。[0]
先行モデルπ0.5とLingBot-VLAの総合スコアはそれぞれ0.44と0.22である。[0]
LIBEROで平均成功率98.8%、LIBERO-Plusで成功率85.1%を達成した。[0]
実ロボットベンチマークで、人間/ロボットデモと人間からロボットへのXRデモの両方をインコンテキスト構造化デモとして使用できることを実証した。[0]

なぜ重要か

StellaVLAは、追加のデータ収集やファインチューニングを必要とせずに、テスト時に単一のデモでVLAモデルを適応させる新しいアプローチを提供する。これにより、実世界の多様な状況でのロボットの汎化能力が向上し、VLAモデルの実用性が高まる可能性がある。