何が起きたか

研究チームは2025年3月27日、arXivプレプリントサーバーに論文「CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models」を公開した。この論文では、視覚言語行動モデル(VLA)に明示的な視覚的思考連鎖(CoT)推論を導入する手法を提案している。提案されたCoT-VLAは7Bパラメータのモデルで、実世界の操作タスクで従来の最先端VLAモデルを17%、シミュレーションベンチマークで6%上回る性能を達成したと報告されている。

詳細

既存のVLAは、事前学習済みの視覚言語モデルと多様なロボットデモを活用して汎用的な感覚運動制御を学習するが、主に直接的な入出力マッピングに焦点を当てており、複雑な操作タスクに重要な中間推論ステップを欠いている。その結果、既存のVLAには時間的計画や推論能力が不足している。 CoT-VLAは、将来の画像フレームを自己回帰的に視覚目標として予測し、その後、これらの目標を達成するための短い行動シーケンスを生成することで、明示的な視覚的思考連鎖推論をVLAに組み込む。このモデルは視覚トークンと行動トークンの両方を理解・生成できるとされる。実験結果によると、CoT-VLAは実世界の操作タスクで最先端のVLAモデルを17%、シミュレーションベンチマークで6%上回る性能を達成した。プロジェクトのウェブサイトはhttps://cot-vla.github.io/で公開されている。

Key Facts

論文「CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models」がarXivに2025年3月27日付で公開された。[1]
CoT-VLAは7Bパラメータの視覚言語行動モデルである。[1]
CoT-VLAは実世界の操作タスクで最先端のVLAモデルを17%上回った。[1]
CoT-VLAはシミュレーションベンチマークで最先端のVLAモデルを6%上回った。[1]
CoT-VLAは将来の画像フレームを自己回帰的に視覚目標として予測し、その後に短い行動シーケンスを生成する。[1]
既存のVLAは直接的な入出力マッピングに焦点を当てており、中間推論ステップを欠いている。[1]
CoT-VLAは視覚トークンと行動トークンの両方を理解・生成できる。[1]
プロジェクトのウェブサイトはhttps://cot-vla.github.io/で公開されている。[1]

なぜ重要か

この研究は、VLAに明示的な推論ステップを導入することで、複雑な操作タスクにおける時間的計画能力を向上させる可能性を示している。実世界での性能向上は、ロボットの汎用操作能力の進展に寄与すると期待される。