何が起きたか

研究チームは2025年10月21日、身体化対話フレームワーク「VITA-E」をarXivで発表した。VITA-Eは、視覚・聴覚・発話・行動を同時に処理し、ユーザーの割り込みにほぼリアルタイムで応答できるという。

詳細

VITA-Eは、二つのVLAインスタンスを「Active Model」と「Standby Model」として並列動作させるデュアルモデル構成を採用する。これにより、環境の観察、ユーザーの音声聴取、音声応答、行動実行を並行して行い、人間のようなマルチタスクを模倣する。また、「model-as-controller」パラダイムを提案し、VLMを微調整してシステムレベルのコマンドとなる特殊トークンを生成させる。物理ヒューマノイドプラットフォームでの実験では、緊急停止や音声割り込みで極めて高い成功率を達成し、音声と行動の並行実行にも成功したとしている。

Key Facts

VITA-Eは、二つのVLAインスタンスをActive ModelとStandby Modelとして並列動作させるデュアルモデル構成を採用している。[1]
VITA-Eは「model-as-controller」パラダイムを提案し、VLMを微調整してシステムレベルのコマンドとなる特殊トークンを生成させる。[1]
物理ヒューマノイドプラットフォームでの実験で、緊急停止と音声割り込みで極めて高い成功率を達成し、音声と行動の並行実行にも成功したとしている。[1]

なぜ重要か

VITA-Eは、身体化AIが人間と自然に対話しながら協働するための基盤技術を示した。並行処理と割り込み対応は、実用化に不可欠な安全性と応答性を高めるものであり、今後の身体化AIの設計に影響を与える可能性がある。