何が起きたか

研究チームは、0.9BパラメータのVLAモデルCoTinyVLAを発表した。Qwen3.5-0.8Bをバックボーンとし、LIBERO-PlusベンチマークでSpatial 90.8%、Object 87.3%、Goal 86.6%、Long 80.7%を達成し、最強の7Bベースラインを全4スイートで上回った。

詳細

CoTinyVLAは、3つの主要コンポーネントで構成される。1つ目は、16履歴フレームのデュアルビュー時間入力で、テキストのカメラ・時間マーカーを付与する。2つ目は、35B教師モデルからの階層的CoT蒸留で、エピソードレベルのPlanとチャンクレベルのThinkスパンを生成する。3つ目は、パラフレーズ拡張で、40の基本コマンドを800のバリエーションに拡張する。アブレーションでは、各コンポーネントが摂動軸ごとに分離可能であることが示された。また、画像予算を一致させた場合、2つのカメラ間と時間軸でのフレーム分割が単独で8.6ポイントの差を生む。閉ループ推論時のGPUメモリ割り当ては2.25GiBで、エピソードPlanを空または矛盾したスパンに置き換えると成功率が40〜45ポイント低下する。

Key Facts

CoTinyVLAは0.9BパラメータのVLAモデルで、Qwen3.5-0.8Bバックボーンを採用する。[1]
LIBERO-Plusベンチマークで、Spatial 90.8%、Object 87.3%、Goal 86.6%、Long 80.7%を達成し、最強の7Bベースラインを全4スイートで上回った。[1]
35B教師モデルからの階層的CoT蒸留と、40コマンドを800バリエーションに拡張するパラフレーズ拡張を採用する。[1]
閉ループ推論時のGPUメモリ割り当ては2.25GiB。[1]
エピソードPlanを空または矛盾したスパンに置き換えると、成功率が40〜45ポイント低下する。[1]

本紙の見方

今回の発表は、ロボット基盤モデルの小型化という流れの中で、新たな一歩を示すものだ。従来、LIBERO-Plusのようなロバスト性ベンチマークでは、3B〜7B規模の大規模バックボーンが性能の中心を担ってきた。CoTinyVLAは0.9Bというサブビリオン規模でありながら、構造化された監視(階層的CoT蒸留とパラフレーズ拡張)によって、より大きなモデルを凌駕する結果を出した。これは、モデルサイズの拡大に頼らない性能向上の可能性を示しており、組み込みロボットなど計算資源が限られた環境への応用が期待される。 本紙の過去報道との接続は、関連記事が提供されていないため直接の言及は避けるが、ロボット基盤モデルの分野では、蒸留やデータ拡張による効率化が注目を集めている。CoTinyVLAの手法は、教師モデルからの知識転移とデータ多様性の確保を組み合わせた点で、既存の蒸留研究の延長線上にあるとみられる。一方で、階層的なCoT構造を導入し、エピソードレベルのPlanとチャンクレベルのThinkを分離した点は、タスクの計画と実行を明確に分離する新しい試みであり、従来のエンドツーエンドのVLAモデルとは一線を画す。 業界構造への含意としては、小型モデルの性能向上が、ロボットのエッジ推論を現実的にする可能性がある。2.25GiBのGPUメモリで動作するという事実は、クラウド依存を減らし、オンデバイスでのリアルタイム制御を可能にする。これにより、ロボットのコスト削減や応答性向上が期待される。また、LIBERO-PlusのRobot Initial Statesのような困難な摂動軸で、CoTinyVLAが73.6%を達成したことは、ロバスト性の向上が特定の摂動に偏らず、全体的に改善されていることを示す。 未確定の論点としては、実ロボットへの適用時の性能が挙げられる。LIBERO-Plusはシミュレーションベンチマークであり、実環境でのノイズや物理的制約が加わった場合の性能は未知数だ。また、蒸留に用いた35B教師モデルの詳細や、学習データの規模、計算コストも公開されていない。さらに、パラフレーズ拡張が800バリエーションに留まる点で、より多様な指示への汎化がどこまで可能かも検証が必要である。次に確認すべきは、実機での検証結果と、モデルの学習に要した計算資源、そして他のベンチマークでの性能比較だろう。

なぜ重要か

CoTinyVLAの成果は、ロボット基盤モデルの小型化が性能と両立可能であることを示し、組み込みロボットやエッジデバイスへの応用を現実的にする。これにより、ロボットの導入コストと消費電力の削減が進み、より広範な現場での活用が期待される。