何が起きたか

Physical Intelligenceは、同社のウェブサイトで研究ページ『Knowledge Insulation』を公開した。この研究では、視覚言語モデル(VLM)を基盤とした視覚言語行動モデル(VLA)において、連続的な行動出力を追加する方法について論じている。同社は、第1世代のVLA(RT-2やOpenVLA)が行動をトークン化された数値として出力していたのに対し、第2世代のVLA(π0から始まる)では、拡散やフローマッチングなどの連続生成モデリング技術を用いて、行動エキスパートや行動ヘッドと呼ばれる新しいニューラルモジュールを追加したと説明している。

Key Facts

Physical Intelligenceは、研究ページ『Knowledge Insulation』を公開した。[0]
同社は、VLMをVLAに拡張する際に、連続的な行動出力を追加する必要があると説明している。[0]
第1世代のVLA(RT-2、OpenVLA)は、行動をトークン化された数値として出力していた。[0]
同社は、トークン化された数値表現は高周波・精密・流暢な動作には不向きであると述べている。[0]
第2世代のVLAはπ0から始まり、拡散やフローマッチングなどの連続生成モデリング技術を用いて行動エキスパートや行動ヘッドを追加した。[0]

なぜ重要か

この研究は、VLAモデルの発展における重要な技術的課題、すなわち事前学習済みのVLMの能力を保ちながら連続的な行動出力を統合する方法に焦点を当てている。第2世代のアプローチは、より複雑な操作スキル(例: 洗濯物をたたむ、ベッドを整える)の実現に寄与する可能性がある。