何が起きたか
OpenBMBは2025年10月31日、CoT推論がVLAモデルに有効となる条件を特定し、それに基づく新モデルDeepThinkVLAを発表した。同モデルはLIBEROで97.0%の成功率、LIBERO-Plusで79.0%のロバスト性、RoboTwin 2.0で59.3%の成功率を達成し、最強のベースラインを21.7ポイント上回った。
詳細
研究チームは、CoTがVLAで有効となる2つの必要条件を特定した。(1)復号整合性: CoTと行動を単一の自己回帰デコーダで生成すると性能が4.2ポイント低下するため、言語には因果注意、行動の並列復号には双方向注意を用いるハイブリッド注意デコーダを採用。(2)因果整合性: CoTをタスク成功に因果的に結びつけるため、スパースなタスク成功報酬で推論と行動の連鎖を整列させる2段階のSFT-RLパイプラインを採用。これにより、教師付きCoTのみでは行動実行に敏感なダイナミクスシフト下で性能が32.0ポイント低下し、推論なしのベースライン(31.6ポイント低下)とほぼ同等になることを示した。
Key Facts
| OpenBMBはDeepThinkVLAを発表し、コードをGitHubで公開した。 | [1] |
| CoTと行動を単一の自己回帰デコーダで生成すると性能が4.2ポイント低下する。 | [1] |
| 教師付きCoTのみでは、行動実行に敏感なダイナミクスシフト下で性能が32.0ポイント低下し、推論なしのベースライン(31.6ポイント低下)とほぼ同等。 | [1] |
| DeepThinkVLAはLIBEROで97.0%の成功率、LIBERO-Plusで79.0%のロバスト性(π0-FASTは61.6%)、RoboTwin 2.0で59.3%の成功率を達成。 | [1] |
| 実ロボット実験により、CoTデータ構築とハイブリッドアーキテクチャの物理的適用可能性の予備的証拠が得られた。 | [1] |
なぜ重要か
本研究成果は、VLAモデルにおけるCoT推論の有効性を左右する設計原則を明確にした点で、ロボット学習分野の基盤に貢献する。開発者は今後、CoTを組み込む際に復号機構と学習目標の整合性を考慮する必要があり、これによりロボットのタスク成功率とロバスト性の向上が期待される。