何が起きたか

arXivに2025年9月28日付で掲載された論文(ID: 2509.23655v1)において、研究チームはOat-VLA(Object-Agent-centric Tokenization for VLAs)を提案した。Oat-VLAは、Vision-Language-Action(VLA)モデルの視覚入力のトークン化方式に着目し、物体中心表現学習の知見に基づいて、シーン内の物体とエージェント自身の視覚情報への帰納的バイアスを導入する。これにより、視覚トークンの数を数個にまで削減しながらも性能を維持できるとしている。

詳細

VLAモデルは、大規模に事前学習されたVision-Language-Model(VLM)をロボットの行動出力に転用することで、ロボット操作の学習をスケールさせる重要なアプローチである。しかし、VLMをロボット領域に適応させる際、視覚入力のトークン化方式に起因する高い計算コストが課題となっていた。Oat-VLAはこの問題に対処するため、物体中心表現学習の洞察を活用し、シーン内の物体とエージェント自身の視覚情報に焦点を当てたトークン化を実現する。 研究チームは、Oat-VLAがOpenVLAと比較して、LIBEROスイートで少なくとも2倍速く収束し、多様な実世界のピックアンドプレイスタスクでOpenVLAを上回る性能を示したと報告している。

Key Facts

Oat-VLAは、物体とエージェント中心のトークン化手法である。[1]
Oat-VLAは視覚トークンの数を数個に削減できる。[1]
Oat-VLAはOpenVLAと比較してLIBEROスイートで少なくとも2倍速く収束する。[1]
Oat-VLAは多様な実世界のピックアンドプレイスタスクでOpenVLAを上回る性能を示した。[1]
論文はarXivに2025年9月28日付で掲載された(ID: 2509.23655v1)。[1]

なぜ重要か

VLAモデルの計算コスト削減は、ロボット操作の学習をより効率的にし、実世界での応用を促進する可能性がある。Oat-VLAは、視覚トークン数を大幅に削減しながら性能を維持できることを示しており、VLAモデルの効率的な学習手法として注目される。