何が起きたか
研究チームは2024年6月27日、Minecraft環境でのオープンワールド指示追従エージェントを実現するVision-Language-Action (VLA) モデル「OmniJARVIS」を発表した。従来手法がテキスト目標を別のコントローラに渡すか、直接制御コマンドを生成するのに対し、OmniJARVISはマルチモーダル相互作用データの統一的トークン化により、強力な推論と効率的な意思決定を両立する。
詳細
OmniJARVISは、行動軌跡τ = {o_0, a_0, ...}を離散トークン化する行動エンコーダを自己教師あり学習で獲得し、そのトークンに基づく模倣学習ポリシーデコーダを備える。これらの行動トークンを事前学習済みマルチモーダル言語モデルの語彙に追加し、タスク指示・記憶・思考・観察・テキスト応答・行動軌跡などの長期マルチモーダル相互作用を統一的トークン列にパッキングして自己回帰トランスフォーマーでモデル化する。これにより、チェーン・オブ・ソートの生成による推論、計画、質問応答、行動トークン生成による行動が可能となる。Minecraftの原子・プログラム・オープンエンドタスクの包括的コレクションで優れた性能を示し、相互作用データ形成・統一的トークン化・スケーリング可能性に関する設計原則を分析した。データセット・モデル・コードはhttps://craftjarvis.org/OmniJARVISで公開予定。
Key Facts
| OmniJARVISは、Minecraftのオープンワールド環境で指示追従エージェントを実現するVLAモデルである。 | 出典一覧 |
| 行動軌跡を離散トークン化する行動エンコーダを自己教師あり学習で獲得し、模倣学習ポリシーデコーダを備える。 | 出典一覧 |
| 行動トークンを事前学習済みマルチモーダル言語モデルの語彙に追加し、タスク指示・記憶・思考・観察・テキスト応答・行動軌跡を統一的トークン列として自己回帰トランスフォーマーでモデル化する。 | 出典一覧 |
| Minecraftの原子・プログラム・オープンエンドタスクの包括的コレクションで優れた性能を示した。 | 出典一覧 |
| データセット・モデル・コードはhttps://craftjarvis.org/OmniJARVISで公開予定。 | 出典一覧 |
本紙の見方
本論文の新規性は、行動軌跡を離散トークン化して言語モデルの語彙に統合する点にある。従来のVLAモデルは、テキスト目標を別のコントローラに渡すか、直接制御コマンドを生成する方式が一般的であり、推論と行動の間の橋渡しが課題だった。OmniJARVISは行動トークンを言語モデルの一部として扱うことで、チェーン・オブ・ソートによる推論と行動生成を同一モデル内で実現し、オープンワールド環境での指示追従性能を高めたとみられる。 本紙の過去報道との接続は、関連記事が提供されていないため言及しない。 業界構造への含意として、VLAモデルの設計において、行動表現のトークン化が重要な設計軸となる可能性が示唆される。特に、ゲーム環境やロボット制御など、長期的なタスク遂行が求められる領域では、言語と行動の統一的な表現がスケーリングの鍵になると考えられる。また、自己教師あり学習による行動エンコーダの獲得は、ラベル付きデータへの依存を減らす点で、データ効率の向上に寄与する可能性がある。 未確定の論点としては、実環境でのロボット制御への適用可能性や、行動トークンの粒度がタスクの複雑さにどう影響するかが挙げられる。また、公開予定のデータセットとモデルの規模、学習データの構成が性能に与える影響も確認が必要である。
なぜ重要か
OmniJARVISは、言語と行動を統一的に扱うVLAモデルの新たな設計指針を示すものであり、オープンワールド環境での指示追従エージェントの実現に向けた一歩となる。行動トークンの導入は、推論と行動のシームレスな連携を可能にし、今後のロボット制御やゲームAIなどの分野に影響を与える可能性がある。