何が起きたか
研究チームは2026年8月29日、arXivで「SMILE: Smooth Motion for Improved Long-Horizon VLA Execution」を公開した。SMILEは、VLAモデルのアクション表現をBスプライン係数に変更するだけで、モデルの骨格や規模を変えずに長い固定区間の実行を可能にする。SMILEをSmolVLA、Evo1、VPP、DAWNに適用し、LIBERO、CALVIN、実世界実験で精度と推論効率を向上させた。
詳細
SMILEは、生のチャンクに含まれるジッターや外れ値を低減するため、Bスプライン係数を予測し、それを滑らかなアクション列にデコードする。アーキテクチャを変更せず、アクション表現のみを変更するため、各ベースラインのバックボーンとモデル規模を維持したまま、より長い固定区間を扱える。具体的な成果として、SMILE-Evo1はLIBEROで98.0%の成功率と1.1倍の高速化を達成。SMILE-VPPはCALVINで平均長4.42と1.5倍の高速化を達成した。実行区間を10に揃えた場合、SMILE-SmolVLAは非境界加速度を78.6%、速度符号変化率を42.3%削減した。実世界のxArm実験では、成功率の向上、落下回数の減少、接触回数の減少が確認された。
Key Facts
| SMILEはBスプライン係数を予測し、滑らかなアクション列をデコードする手法である。 | [1] |
| SMILE-Evo1はLIBEROで98.0%の成功率と1.1倍の高速化を達成した。 | [1] |
| SMILE-VPPはCALVINで平均長4.42と1.5倍の高速化を達成した。 | [1] |
| 実行区間10でSMILE-SmolVLAは非境界加速度を78.6%、速度符号変化率を42.3%削減した。 | [1] |
| 実世界のxArm実験で成功率向上、落下回数減少、接触回数減少が確認された。 | [1] |
本紙の見方
SMILEの核心は、VLAモデルのアクション表現をBスプライン係数に置き換えるという、アーキテクチャ非依存のインターフェースにある。これにより、モデルの骨格や規模を変えずに、長い固定区間の実行を可能にし、精度と推論効率を同時に改善する。この手法は、VLAモデルの実用化における重要な課題である「長区間実行時の精度劣化」と「推論コスト」のトレードオフに、表現の変更という軽量な方法で対処する点で新規性が高い。 本手法は、ロボットの動作生成における「滑らかさ」を、単なる後処理ではなく、モデルの予測対象として組み込む点で、従来のアプローチとは一線を画す。Bスプライン係数の予測は、生のアクション列を直接予測するよりも、時間的連続性を暗黙に学習しやすく、結果としてジッターや外れ値を低減する。これは、ロボットの実世界展開において、安全性やタスク成功率に直結する要素であり、単なるベンチマーク上の数値向上以上の意味を持つ。 業界構造への含意として、SMILEはモデル非依存であるため、既存のVLAモデル(SmolVLA、Evo1、VPP、DAWNなど)に容易に適用できる。これは、特定のモデルに最適化された手法ではなく、VLAモデル全体の性能を底上げする可能性を示唆する。特に、実世界のxArm実験で成功率向上が確認されたことは、シミュレーションから実機への転移可能性を示しており、ロボットの汎用性向上に寄与する。 一方で、未確定の論点も残る。SMILEはBスプライン係数の次数やノット配置などのハイパーパラメータに依存するが、その最適化についての詳細は公開されていない。また、LIBEROやCALVIN以外の多様なタスクや、より複雑な実環境での性能は未検証である。さらに、SMILEを適用した際のモデルサイズや推論コストの詳細な比較(例:FLOPs)は示されておらず、実用上のスケーラビリティについては今後の検証が待たれる。
なぜ重要か
SMILEは、VLAモデルの長区間実行における精度と効率のトレードオフを、アクション表現の変更という軽量な方法で解決する可能性を示した。これは、ロボットの実世界展開において、より長いタスクを高い成功率で実行するための一歩となる。また、モデル非依存であるため、今後のVLA研究の標準的な手法として採用される可能性がある。