何が起きたか
研究チームは2025年10月21日、身体化対話フレームワーク「VITA-E」をarXivで発表した。VITA-Eは、視覚・聴覚・発話・行動を同時に処理し、ユーザーの割り込みにほぼリアルタイムで応答できるという。
詳細
VITA-Eは、二つのVLAインスタンスを「Active Model」と「Standby Model」として並列動作させるデュアルモデル構成を採用する。これにより、環境の観察、ユーザーの音声聴取、音声応答、行動実行を並行して行い、人間のようなマルチタスクを模倣する。また、「model-as-controller」パラダイムを提案し、VLMを微調整してシステムレベルのコマンドとなる特殊トークンを生成させる。物理ヒューマノイドプラットフォームでの実験では、緊急停止や音声割り込みで極めて高い成功率を達成し、音声と行動の並行実行にも成功したとしている。
Key Facts
| VITA-Eは、二つのVLAインスタンスをActive ModelとStandby Modelとして並列動作させるデュアルモデル構成を採用している。 | [1] |
| VITA-Eは「model-as-controller」パラダイムを提案し、VLMを微調整してシステムレベルのコマンドとなる特殊トークンを生成させる。 | [1] |
| 物理ヒューマノイドプラットフォームでの実験で、緊急停止と音声割り込みで極めて高い成功率を達成し、音声と行動の並行実行にも成功したとしている。 | [1] |
なぜ重要か
VITA-Eは、身体化AIが人間と自然に対話しながら協働するための基盤技術を示した。並行処理と割り込み対応は、実用化に不可欠な安全性と応答性を高めるものであり、今後の身体化AIの設計に影響を与える可能性がある。