何が起きたか
OpenBMBは2025年10月31日、CoT推論がVLAモデルに有効となる条件を特定し、それに基づく新モデルDeepThinkVLAを発表した。同モデルはLIBEROで97.0%の成功率、LIBERO-Plusで79.0%のロバスト性、RoboTwin 2.0で59.3%の成功率を達成し、最強のベースラインを21.7ポイント上回った。
詳細
研究チームは、CoTがVLAで有効となる2つの必要条件を特定した。(1)復号整合性: CoTと行動を単一の自己回帰デコーダで生成すると性能が4.2ポイント低下するため、言語には因果注意、行動の並列復号には双方向注意を用いるハイブリッド注意デコーダを採用。(2)因果整合性: CoTをタスク成功に因果的に結びつけるため、スパースなタスク成功報酬で推論と行動の連鎖を整列させる2段階のSFT-RLパイプラインを採用。これにより、教師付きCoTのみでは行動実行に敏感なダイナミクスシフト下で性能が32.0ポイント低下し、推論なしのベースライン(31.6ポイント低下)とほぼ同等になることを示した。
Key Facts
| OpenBMBはDeepThinkVLAを発表し、コードをGitHubで公開した。 | 出典一覧 |
| CoTと行動を単一の自己回帰デコーダで生成すると性能が4.2ポイント低下する。 | 出典一覧 |
| 教師付きCoTのみでは、行動実行に敏感なダイナミクスシフト下で性能が32.0ポイント低下し、推論なしのベースライン(31.6ポイント低下)とほぼ同等。 | 出典一覧 |
| DeepThinkVLAはLIBEROで97.0%の成功率、LIBERO-Plusで79.0%のロバスト性(π0-FASTは61.6%)、RoboTwin 2.0で59.3%の成功率を達成。 | 出典一覧 |
| 実ロボット実験により、CoTデータ構築とハイブリッドアーキテクチャの物理的適用可能性の予備的証拠が得られた。 | 出典一覧 |
本紙の見方
今回の発表は、CoT推論がVLAモデルに有効となる条件を初めて体系的に診断した点で新規性がある。従来のCoT-VLAシステムは限定的で一貫性のない改善しか報告されておらず、その原因が不明だった。本研究は、復号整合性と因果整合性の2つの必要条件を特定し、それぞれを満たすアーキテクチャと学習パイプラインを提案した。特に、単一の自己回帰デコーダでCoTと行動を生成することが積極的に有害であること、教師付きCoTが因果整合性を欠くと推論なしと同等になることを定量的に示した点は重要である。 業界構造への含意として、VLAモデルの設計指針に影響を与える可能性がある。多くの既存モデルは単一の自己回帰デコーダを採用しており、今回の結果はその設計がCoT利用時に性能を損なうことを示唆する。また、CoTの学習方法についても、単なる教師付き学習ではなく、タスク成功報酬による強化学習が不可欠であることを示しており、今後のVLA開発の方向性に影響を与えるとみられる。 未確定の論点としては、実ロボット実験が「予備的証拠」に留まっており、実環境での汎用性やスケーラビリティは未検証である。また、LIBEROやRoboTwinなどのベンチマークでの成功が、実世界の多様なタスクでどの程度一般化するかは不明である。さらに、CoTの生成コストや推論遅延が実用化に与える影響も検討が必要である。
なぜ重要か
本研究成果は、VLAモデルにおけるCoT推論の有効性を左右する設計原則を明確にした点で、ロボット学習分野の基盤に貢献する。開発者は今後、CoTを組み込む際に復号機構と学習目標の整合性を考慮する必要があり、これによりロボットのタスク成功率とロバスト性の向上が期待される。