何が起きたか

Astronex-World 1.0は2026-09-17、オープンな制御可能動画ワールドモデル基盤として公表された。テキストプロンプト、または初期観測画像を入力に、フレーム整列したカメラ軌跡、連続動作、身体性識別子に従って将来の視覚状態を予測し、ロールアウト中の指定位置にテキストイベントも挿入できる。因果モデルは832×480解像度で24fpsの動画を生成し、全5段階の学習は2基のNVIDIA L20 48GB GPUで実行され、因果モデルは1基でリアルタイム配信できる。

詳細

モデル群は、全体文脈生成向けの双方向モデルと、block-causal attentionとcross-block KV cachingを備えた持続生成向けの因果モデルで構成される。いずれも Wan2.2-TI2V-5B を事前学習基盤としており、PRoPE がカメラのintrinsicsとextrinsicsを注入する。さらに64次元の動作ストリームがTransformerの各層を調整し、5段階の学習では双方向のカメラ・動作制御、バックボーンのblock-causal生成化、少ステップ学生への蒸留、混合ドメイン動態の復元、非対称DMD/DMD2分布マッチングを順に行う。 性能面では、WBench Naviで73.5、WBench Fullで70.0を記録した。Fullでは、この5Bモデルは13.6BのLongCat-Videoと14BのHeliosを上回り、22BのLTX-2.3には1点以内まで迫り、同じ5B基盤からNVIDIA A100 GPU上で後学習されたYUME 1.5を上回ったとしている。

Key Facts

Astronex-World 1.0は2026-09-17に公表された。[1]
テキストプロンプトまたは初期観測画像から、未来の視覚状態を予測するオープンな制御可能動画ワールドモデル基盤である。[1]
双方向モデルと因果モデルの2系統を持つ。[1]
因果モデルは832×480、24fpsで動画を生成する。[1]
全5段階の学習は2基のNVIDIA L20 48GB GPUで実行され、因果モデルは1基でリアルタイム配信する。[1]

本紙の見方

Astronex-World 1.0の新しさは、単なる動画生成ではなく、カメラ軌跡、連続動作、身体性識別子、途中挿入イベントを一つの枠組みで扱う点にある。一方で、基盤が Wan2.2-TI2V-5B であること、そして双方向モデルと因果モデルを分けて設計していることから、既存の動画基盤を対話型ワールドモデルへ拡張する路線の延長でもある。5段階の学習手順も、制御の付与、因果化、蒸留、混合ドメイン復元、分布マッチングという既知の技術要素を積み上げた構成であり、方法論そのものは急進的というより段階的である。 本紙の関連記事はないため、過去報道との連続性をここで補うことはできない。ただ、公開された仕様だけでも、評価軸が静止画像や短尺動画の品質ではなく、時間方向の整合性と制御応答に置かれていることは明らかである。WBench Navi 73.5、WBench Full 70.0という結果は、特にFullで13.6BのLongCat-Video、14BのHelios、22BのLTX-2.3との比較が付されており、モデル規模だけで優劣が決まらないことを示唆する。ここでは、64次元の動作ストリームやPRoPEによるカメラ内外部パラメータの注入が、単純な生成品質よりも、物理空間の整合性や操作応答に効いている可能性があるとみられる。 業界構造の観点では、このモデルは入力のテキスト・画像、処理系のカメラ幾何と動作条件、出力のリアルタイム動画という流れを一本化している。すると焦点は、映像生成の見栄えよりも、ロボットや自動運転に転用できる制御インターフェースと持続生成の安定性に移る。reserved action input and output interfaces を備える点も、後段の身体化応用を意識した設計と読めるが、実際にどの程度再学習や転用が容易かは別問題である。特に、少ステップ学生の性能、混合ドメインでの劣化耐性、イベント挿入時の一貫性は、論文の記述だけでは運用上の強さを判定しきれない。 次に確認すべきなのは、WBench以外での外部評価、実運用時の遅延と安定稼働、そしてembodied intelligenceやautonomous driving向けの後学習がどの程度少量データで成立するかである。5B基盤で上位の比較値を示したとはいえ、データの構成、学習コスト、失敗時のモード崩れ、入力した動作指令がどこまで忠実に反映されるかは、論文の要点として残る未確定点だとみられる。

なぜ重要か

公開された仕様によれば、この基盤は動画生成を超えて、カメラ幾何と動作指令を結びつけた制御系として設計されている。ロボットや自動運転への後学習を想定するなら、重要なのは画質よりも、入力の動作と出力映像の整合性、そしてリアルタイム性である。

日本への影響

日本企業や研究機関にとっては、映像生成モデルそのものよりも、64次元の動作ストリームやカメラ内外部パラメータを扱う制御型の学習設計が参照点になる可能性がある。とくに、実世界データを使うロボティクスや自動運転の文脈では、生成品質だけでなく、長時間の因果生成とイベント挿入の安定性が比較対象になりうる。