何が起きたか

2026年7月21日にarXivに公開された論文で、ABot-World-0が発表された。これは、リアルタイムで長期的な閉ループインタラクションを実現するアクション条件付きビデオワールドモデルであり、単一のNVIDIA RTX 5090デスクトップGPU上で720Pビデオを最大16FPSでストリーミング生成する。アクションから初回フレームまでの遅延は1.2秒、ピークVRAMは約19GiB。

詳細

ABot-World-0は、AAAゲーム、シミュレーションエンジン、インターネット動画を横断するマルチソースデータ基盤を活用し、制御可能なワールドダイナミクスを学習する。データ収集にはWorldExplorerが用いられ、トレーニングフィードバックに基づくエージェント駆動の収集を実行。統一パイプラインでは14の決定的品質チェック、VLMベースの評価、同期されたアクションとテキストのアノテーションを適用する。 モデルは、双方向アクション条件付きティーチャーを因果的スチューデントへ段階的に蒸留し、ティーチャーフォーシングとODE蒸留を採用。LongForcingを導入し、長いスチューデントの自己ロールアウトを拡張ホライズンのティーチャーと整合させ、累積分布シフトと自己回帰ドリフトを軽減する。生のキーボードアクションがシーン探索と三人称キャラクターインタラクションの統一制御インターフェースを提供し、参照キャラクターメモリが三人称ロールアウト中のアイデンティティ一貫性を維持する。 デプロイメントでは、軽量VAEデコーダ、効率的なアテンション、メモリ認識スケジューリング、低ビットDiT推論を備えたストリーミング推論スタックを共同設計。最適化された低ビット構成で、単一のNVIDIA RTX 5090上で720Pビデオを最大16FPSでストリーミングする。実験では、WorldRoamBenchと拡張インタラクティブロールアウトで競争力のある制御性と一貫性のある長期的ワールド進化を示した。

Key Facts

ABot-World-0は、アクション条件付きビデオワールドモデルであり、リアルタイムで長期的な閉ループインタラクションを実現する。[1]
マルチソースデータ基盤は、AAAゲーム、シミュレーションエンジン、インターネット動画をカバーする。[1]
WorldExplorerは、トレーニングフィードバックに基づくエージェント駆動のデータ収集を実行する。[1]
統一パイプラインは、14の決定的品質チェック、VLMベースの評価、同期されたアクションとテキストのアノテーションを適用する。[1]
双方向アクション条件付きティーチャーを因果的スチューデントへ蒸留し、ティーチャーフォーシングとODE蒸留を使用する。[1]
LongForcingは、長いスチューデントの自己ロールアウトを拡張ホライズンのティーチャーと整合させ、分布シフトと自己回帰ドリフトを軽減する。[1]
生のキーボードアクションが、シーン探索と三人称キャラクターインタラクションの統一制御インターフェースを提供する。[1]
参照キャラクターメモリは、三人称ロールアウト中のアイデンティティ一貫性を維持する。[1]
ストリーミング推論スタックは、軽量VAEデコーダ、効率的なアテンション、メモリ認識スケジューリング、低ビットDiT推論を備える。[1]
最適化された低ビット構成で、ABot-World-0は単一のNVIDIA RTX 5090デスクトップGPU上で720Pビデオを最大16FPSでストリーミングし、1.2秒のアクションから初回フレームまでの遅延、約19GiBのピークVRAMを達成する。[1]
実験はWorldRoamBenchと拡張インタラクティブロールアウトで実施され、競争力のある制御性と一貫性のある長期的ワールド進化を示した。[1]

なぜ重要か

ABot-World-0は、単一のデスクトップGPUでリアルタイムの長期的インタラクションを可能にする点で、ビデオワールドモデルの実用性を大きく前進させる。低遅延と低VRAM消費は、エッジデバイスでの展開可能性を示唆し、ゲームやシミュレーション分野での応用が期待される。