何が起きたか
arxiv.orgは2026年10月7日、論文「Juno: Taming Predictive Latents for Vision-Language-Action Models」を公開した。Junoは、行動条件付きJEPAを使い、視覚言語行動(VLA)モデルのための制御整合な表現バックボーン、予測教師、適応可能なダイナミクスモデルを一体化したフレームワークである。著者らは、事前学習時の実体に合った軌跡、方策学習時の未来潜在状態の蒸留、デプロイ時の観測遷移を使った適応を組み合わせ、SimplerEnvと実機での成功率改善を示した。
詳細
事前学習では、実体に対応した軌跡で学習し、dynamic CLS lossを用いて、運動重み付きのパッチダイナミクスをコンパクトなグローバル状態へ移した。方策学習では、現在フレームのJEPAパッチをVLAの知覚に融合し、変換パラメータを分離した reasoning branch により未来潜在状態を蒸留して行動生成に使った。 デプロイ時には、失敗ロールアウトを含む全ての観測遷移でワールドモデルを適応させ、適応後の教師を固定し、検証済みの実行に対してLoRA adaptersと学習可能なaction headで方策を再整合した。論文は、外部の expert corrections や task rewards を使わないと説明している。評価では、SimplerEnv上で平均成功率がQwen3GR00Tの60.9%から68.5%に上昇し、テスト時適応では72.7%に達した。実機では、背景・高さ・物体の変化下でも70%〜75%の成功率を保ち、ベース方策は0%に崩れたとしている。
Key Facts
| 論文名は「Juno: Taming Predictive Latents for Vision-Language-Action Models」である。 | [1] |
| 掲載日は2026-10-07で、媒体はarxiv.orgである。 | [1] |
| Junoは、行動条件付きJEPAを中核に、制御整合な表現バックボーン、予測教師、適応可能なダイナミクスモデルを統合する。 | [1] |
| SimplerEnvでの平均成功率は60.9%から68.5%に上昇し、テスト時適応では72.7%に達した。 | [1] |
| 実機では、背景・高さ・物体の変化下で70%〜75%の成功率を示した。 | [1] |
本紙の見方
Junoの新しさは、JEPAを単なる表現学習の器としてではなく、事前学習・方策学習・デプロイの3段階をまたぐ共通基盤として扱った点にある。特に、失敗ロールアウトを含む観測遷移まで使ってワールドモデルを適応し、その後に教師を固定して方策を再整合する構成は、予測潜在表現を「学習時だけ有効な表現」にとどめず、実行時の制御に接続しようとする設計である。 この論文の焦点は、3つの失敗モードを同時に解くことにある。第一に、実体に合わない制御との不一致を、実体に対応した軌跡での事前学習とdynamic CLS lossで抑えようとしている。第二に、方策学習への干渉を、現在フレームのパッチ融合と、変換パラメータを分けた reasoning branch で切り分けている。第三に、分布ずれ下での教師の不安定化を、デプロイ時に観測遷移全体で適応した後、適応済み教師を固定する流れで抑える設計である。これらは、同じモデルを「表現器」「教師」「ダイナミクスモデル」に兼用させる一方で、役割ごとの干渉を抑える試みと読める。 本紙の関連記事はないため、過去報道との接続はないが、結果として示された数値は構成の意味を補強する。SimplerEnvでの60.9%から68.5%、さらに72.7%への改善は、単純な学習増強ではなく、適応と再整合の工程を入れたことの効果を示す。実機で背景・高さ・物体変化に対して70%〜75%を維持した点は、シミュレーション内の成功率だけでは見えない頑健性が論点であることを示している。 次に確認すべきなのは、どの実体設定・どのタスク群・どの程度の失敗ロールアウトまで性能が保たれるかである。加えて、LoRA adapters と action head の更新範囲、適応に必要な観測量、そしてベース方策が0%に崩れた条件の詳細が明らかになると、この枠組みがどの環境変化まで耐えるかをより厳密に評価できる。
なぜ重要か
論文が示すのは、VLAモデルの性能改善が事前学習の精度だけでなく、デプロイ段階での適応と再整合に左右される可能性がある点である。著者らは、expert corrections や task rewards を使わずに成功率を引き上げたとしており、実運用での追加注釈コストを抑えたい開発者にとって重要な条件になる。 また、背景・高さ・物体の変化下で実機成功率を維持したという結果は、固定的な方策よりも、観測遷移を取り込む世界モデル側の更新が効く場面があることを示す。どの変化で有効かはまだ限定的だが、制御と表現を一体化しつつ、適応後の教師を固定する構成は、実機導入時の評価軸をシミュレーション精度から運用時の頑健性へ移す契機になる。