何が起きたか
arXiv掲載の論文「Vela: Scaling Vision-Language-Action Models with Adaptive Action Curve Parametrization」は、視覚言語行動モデルの未来動作を固定レートの行動チャンクではなく連続軌道として表現する枠組みを発表した。論文は2026-10-04に掲載され、固定出力予算のまま動作ごとに時間分解能を変えられる点を特徴としている。著者らはLIBERO-X、EBench、卵ケーキ調理、ポテト細断の各課題で評価し、シミュレーションと実機の両方で有望な結果を得たとしている。
詳細
Velaは、近傍の行動が高相関であるにもかかわらず固定長の出力単位に割り当てていた従来表現の非効率を問題にし、スプラインベースの行動表現を採用する。さらに、動作に応じて時間的な支持範囲を変える設計と、異なる身体形態に共通の行動インターフェースを組み合わせ、固定の出力予算の制約下で時間分解能を適応させるとしている。 論文では、大規模な複数身体形態のロボットデータで事前学習し、LIBERO-X、EBenchに加えて実世界の長期タスクであるegg-cake cookingとpotato shreddingで評価したと述べる。プロジェクトページも公開されているが、本文が示すのはモデル構造、学習データ、評価課題の範囲までであり、学習データの件数やパラメータ数は示されていない。
Key Facts
| 「Vela: Scaling Vision-Language-Action Models with Adaptive Action Curve Parametrization」は、視覚言語行動モデルの未来動作を連続軌道として表現する手法を提案している。 | [1] |
| Velaはスプラインベースの行動表現、動作依存の時間的支持範囲、異種身体形態に共通の行動インターフェースを組み合わせる。 | [1] |
| 著者らはVelaを大規模な複数身体形態のロボットデータで事前学習したとしている。 | [1] |
| 評価先としてLIBERO-X、EBench、実機課題のegg-cake cookingとpotato shreddingが挙げられている。 | [1] |
| 論文の掲載日は2026-10-04である。 | [1] |
本紙の見方
Velaの新しさは、視覚言語行動モデルの出力を固定長の行動チャンクではなく連続軌道として扱い、しかも動作に応じて時間分解能を変えられる点にある。固定出力予算のまま局所精度と長期到達性の両立を狙う設計であり、単なるモデル拡大ではなく表現方法そのものを変えている。ここが、既存のVLAモデルの延長でありながら、出力単位の考え方を組み替えるという意味で一段深い変更だとみられる。 本紙の過去報道は与えられていないため、連続性や比較対象を外部の文脈で補うことはできない。ただし、論文本文からは、複数身体形態のデータで事前学習し、LIBERO-XやEBench、さらに実機の卵ケーキ調理とポテト細断にまで通していることが読み取れる。つまり、Velaはシミュレーション内のベンチマークに閉じず、接触を伴う実世界タスクへ軸足を伸ばした構成である。この点は、行動表現の滑らかさが単なる見栄えではなく、長期タスクでの破綻回避や接触局面の扱いに関わる論点だと受け取れる。 業界構造への含意としては、ロボット基盤モデルの競争軸が「何を見て何を言うか」から「どの時間粒度でどう動くか」へ移りつつある可能性がある。連続軌道と共通インターフェースを採るなら、異なる機体やタスク間での再利用性が焦点になる一方、学習データの質と分布が性能を強く左右するとみられる。また、接触を含む長期タスクで有効かどうかは、シミュレーション評価だけでは見えにくく、実機での安定性、失敗時の回復、データ収集の手間が次の検証点になる。論文ではパラメータ数、学習データの規模、実機評価の詳細な成功率は示されていないため、そこが今後の確認事項である。
なぜ重要か
Velaが示すのは、ロボット基盤モデルの性能が固定長アクションの積み上げだけでなく、動作をどの粒度で表せるかにも左右されるという点である。論文が複数身体形態のロボットデータと実機の長期課題を使っているため、実世界導入ではデータの幅と接触局面の扱いが重要になる。
日本への影響
日本では、接触を伴う実機タスクや多様な機体での再利用を重視するロボット開発にとって、連続軌道型の行動表現は設計上の比較対象になりうる。ただし、本件の論文だけでは日本企業・日本機関との直接の関係は示されていない。