何が起きたか
研究チームは、11自由度のToyota HSR向けにVLAモデルをファインチューニングし、総MSEが最小のチェックポイントが実機性能で最良とは限らないことを示した。60回の実機試行(モデルあたり20回)で、π0.5 80k(成功率4.0/4)が、ファインチューニングした2モデル(エキスパートオンリー3k: 3.75/4、HSR-SmolVLA: 3.5/4)を有意に上回った。エキスパートオンリー3kは総MSEが最も低かったが、実機性能は劣っていた。
詳細
研究チームは、SmolVLA(450M、アクションエキスパートのみ)を11自由度のToyota HSR向けにファインチューニングし、より強力な事前学習ベースラインであるπ0.5(3.3B)と比較した。グループ別分析により、SmolVLAでは移動ベースの収束が最も遅く、全体の性能を制限していることが判明した。また、π0.5のエキスパートオンリーファインチューニング(バックボーン凍結、アクションヘッドのみ訓練)では、総MSEがベースラインを下回ったが、アーム精度は低下した。60回の実機試行(モデルあたり20回)で、π0.5 80k(4.0/4)は、ファインチューニングした2モデル(エキスパートオンリー3k: 3.75/4、HSR-SmolVLA: 3.5/4)を有意に上回った(Mann-Whitney p ≤ 0.010)。この分離は、総MSEやベースグループ誤差ではなく、オフラインのアームグループ誤差と最も整合的であると報告されている。
Key Facts
| 研究チームは、11自由度のToyota HSR向けにVLAモデルをファインチューニングし、総MSEが最小のチェックポイントが実機性能で最良とは限らないことを示した。 | [1] |
| 60回の実機試行(モデルあたり20回)で、π0.5 80k(成功率4.0/4)が、ファインチューニングした2モデル(エキスパートオンリー3k: 3.75/4、HSR-SmolVLA: 3.5/4)を有意に上回った(Mann-Whitney p ≤ 0.010)。 | [1] |
| エキスパートオンリー3kは総MSEが最も低かったが、実機性能は劣っていた。 | [1] |
| 研究チームは、グループ別誤差が総MSEよりもチェックポイント選択に信頼できる指標であると結論づけた。 | [1] |
なぜ重要か
この研究は、VLAモデルの評価方法に一石を投じるものであり、ロボット学習の実用化に向けた重要な知見を提供する。開発者が総MSEのみに頼らず、グループ別誤差を考慮することで、実機での成功率を向上させられる可能性がある。今後のロボット学習モデルの開発において、評価指標の設計がより慎重に行われるべきであることを示唆している。