何が起きたか
2026年6月17日、arXivプレプリント(ID: 2606.19297v1)として、VLAモデルの知識保持を評価する新手法「Act2Answer」が発表された。この手法は、VLM知識ベンチマークをVLA評価に適応させ、エージェントが行動(物体配置)で回答することで、制御の交絡を減らした成功率を測定する。
詳細
Act2Answerは、各質問を短いテーブルトップのエピソードに変換し、エージェントが候補回答の中から選択するために単一の物体配置行動を行う。これにより、行動に基づく成功率を算出する。さらに、層別の意図プロービング(layerwise intent probing)を用いて、VLMバックボーンと行動ヘッドのどこに回答関連情報が存在するかを特定する。大規模研究では、7つのVLAモデルと9つのVLMベースラインを比較し、VLAは単純な概念では堅実な性能を示す一方、よりリッチな意味カテゴリではソースVLMと比較して大きなギャップが見られること、VQAの共訓練が知識保持と関連すること、回答関連シグナルが中間層でピークに達し上層で減衰することが示された。
Key Facts
| Act2Answerは、VLM知識ベンチマークをVLA評価に適応させ、エージェントが行動で回答するプロトコルである。 | [1] |
| 7つのVLAモデルと9つのVLMベースラインを比較した大規模研究が実施された。 | [1] |
| VLAは単純な概念では堅実な性能を示すが、リッチな意味カテゴリではソースVLMと比較して大きなギャップが見られた。 | [1] |
| VQAの共訓練は知識保持と関連することが示された。 | [1] |
| 回答関連シグナルは中間層でピークに達し、上層で減衰することが観察された。 | [1] |
なぜ重要か
VLAモデルの実用化が進む中、知識保持の評価手法が確立されれば、モデル選定や訓練方法の改善に直結する。Act2Answerは、制御性能と知識を分離して評価する新たな基準を提供し、ロボット学習の信頼性向上に寄与する可能性がある。