日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLA/動作生成arXiv:2608.29432v1

SMILE: 長期的VLA実行のための滑らかな動作生成

SMILE: Smooth Motion for Improved Long-Horizon VLA Execution

シェア:XThreadsFacebookLINEはてブBluesky

VLAモデルの長期的な動作実行精度を向上させるため、Bスプライン係数を予測して滑らかな動作列を生成する手法SMILEを提案。複数のベースラインに適用し、精度と推論効率を改善。

詳しい要約

1. どんなもの?

SMILEは、Vision-Language-Action (VLA)モデルの長期的な動作実行を改善するための、アーキテクチャを変更しないインターフェース。B-spline係数を予測し、それを滑らかなアクションシーケンスにデコードすることで、生のチャンクに含まれるジッタや外れ値を低減し、より長い固定ホライズンを可能にする。

2. 先行研究と比べてどこがすごい?

従来のVLAモデルは、推論コスト削減のために複数アクションを一度に実行するが、ホライズンが長くなると精度が低下する。SMILEはアクション表現のみを変更し、バックボーンやモデル規模を維持したまま、長いホライズンでの精度と推論効率を向上させる点が新しい。

3. 技術・手法の肝は?

SMILEは、アクションシーケンスをB-spline係数で表現し、それをデコードして滑らかなアクション列を生成する。アーキテクチャは変更せず、予測ヘッドの出力をB-spline係数に置き換えるだけなので、既存のVLAモデルに容易に適用できる。

4. どうやって有効だと検証した?

SmolVLA、Evo1、VPP、DAWNの4つのベースラインにSMILEを適用し、LIBERO、CALVIN、実世界のxArm実験で評価。SMILE-Evo1はLIBEROで98.0%の成功率と1.1倍の高速化、SMILE-VPPはCALVINで平均長4.42と1.5倍の高速化を達成。SMILE-SmolVLAはホライズン10で非境界加速度を78.6%、速度符号変化率を42.3%削減。実世界では成功率向上、落下・接触回数の減少を確認。

5. 議論はある?

要旨からは、SMILEの適用範囲や限界(例えば、B-spline表現が全てのタスクに適するかどうか)についての議論は不明。また、長いホライズンでの精度向上のメカニズムや、他のアクション表現との比較についての詳細も要旨には含まれていない。

6. 次に読むべき論文は?

要旨で参照されているベースラインであるSmolVLA、Evo1、VPP、DAWNの各論文。また、B-splineやアクション表現に関する関連研究として、Action Chunking with Transformers (ACT)やDiffusion Policyなどが考えられるが、要旨に明記されていないため、一般名で挙げる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jongwoo Park, E-Ro Nguyen, Kanchana Ranasinghe, Cristina Mata, Xiang Li, Michael S Ryoo

分類: cs.RO

原文アブストラクト

Vision-Language-Action (VLA) models reduce inference cost by executing multiple actions per call, but longer horizons often degrade accuracy because raw chunks contain jitter and outliers. We introduce SMILE, an architecture-preserving interface that predicts B-spline coefficients and decodes them into smooth action sequences. SMILE changes only the action representation, enabling longer fixed horizons while retaining each baseline's backbone and model scale. We apply SMILE to SmolVLA, Evo1, VPP, and DAWN, improving accuracy and amortized inference efficiency across LIBERO, CALVIN, and real-world experiments. SMILE-Evo1 reaches 98.0% with a 1.1x speedup on LIBERO, while SMILE-VPP reaches an average length of 4.42 with a 1.5x speedup on CALVIN. At a matched execution horizon of 10, SMILE-SmolVLA reduces non-boundary acceleration by 78.6% and velocity sign-change rate by 42.3%. Real-world xArm tests show higher success, fewer drops, and fewer contacts. These results establish smooth coefficient-space generation as a route to accurate, efficient long-horizon VLA execution. Project page: jongwoopark7978.github.io/smilevla