何が起きたか

2026年8月7日、arxiv.orgにプレプリント「Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence」が公開された。同論文は、身体性エージェントの推論コアとして機能する視覚言語モデルCapek 0.5を提案し、2Bおよび35B-A3Bスケールで実装したと報告している。

詳細

Capek 0.5は、実行中心の能力分類法に基づいて設計された身体性視覚言語モデルである。訓練はデータセットやタスク単位ではなく、実行中の機能的役割に応じて能力をグループ化し、空間推論、時間理解、行動ガイダンス、状態検証の4つの能力ファミリーを定義する。各能力は、共有バックボーンから検証可能な報酬を用いた強化学習によって専門家モデルとして獲得され、その後、重み空間マージングとルーティングポリシー蒸留により単一の推論時モデルに統合される。評価では、状態検証用の新しいベンチマークCapek-StateBenchを含む包括的なベンチマークスイート、専門家から統合モデルへの能力保持の制御研究、シミュレーション環境でのクローズドループ評価の3つの観点から実施された。

Key Facts

Capek 0.5は、実行中心の能力分類法に基づく身体性視覚言語モデルであり、空間推論、時間理解、行動ガイダンス、状態検証の4つの能力ファミリーを定義している。[1]
各能力は、共有バックボーンから検証可能な報酬を用いた強化学習によって専門家モデルとして獲得され、その後、重み空間マージングとルーティングポリシー蒸留により単一の推論時モデルに統合される。[1]
Capek 0.5は2Bおよび35B-A3Bスケールで実装された。[1]
評価は、Capek-StateBenchを含むベンチマークスイート、能力保持の制御研究、シミュレーション環境でのクローズドループ評価の3つの観点から実施された。[1]
Capek 0.5は、初期化と比較してマッチしたベンチマーク行の大部分で改善し、4つの専門能力を単一チェックポイントに保持し、クローズドループの身体性タスク実行に転移したと報告されている。[1]

本紙の見方

今回の発表は、身体性AIの分野で、視覚言語モデル(VLM)の訓練方法に新たな枠組みを提示するものだ。従来のVLMは、データセットやタスクごとに個別の目的関数で訓練されることが多かったが、Capek 0.5は実行プロセス全体を中心に据え、能力を機能的な役割で分類する点が新しい。具体的には、空間推論、時間理解、行動ガイダンス、状態検証という4つの能力ファミリーを定義し、それぞれを専門家モデルとして強化学習で獲得した後、重み空間マージングとルーティングポリシー蒸留で統合する。このアプローチは、ロボットの実行が反復的であり、各アクションがシーンを変化させるという特性に着目したもので、既存の手法が個別のタスクに最適化されるのに対し、実行全体を考慮した設計となっている。 本紙の過去報道との接続は、関連記事が提供されていないため直接の言及はできないが、身体性AIの分野では、VLMをロボットの推論コアとして活用する動きが加速している。Capek 0.5は、その中でも訓練の組織化に焦点を当てた点で独自性がある。特に、能力の獲得と統合を分離し、専門家モデルをマージする手法は、モデルのスケーラビリティと柔軟性を高める可能性がある。 業界構造への含意としては、このような実行中心の能力分類は、ロボットのタスク実行におけるモジュール性を高め、開発プロセスを効率化する可能性がある。また、状態検証を独立した能力として扱うことで、ロボットの安全性や信頼性の向上に寄与するかもしれない。一方で、強化学習と蒸留の組み合わせは計算コストが高く、実用化にはさらなる最適化が必要とみられる。 未確定の論点としては、Capek 0.5の実環境での性能がシミュレーションとどの程度一致するか、また、2Bスケールと35B-A3Bスケールの間での能力保持の差が実用上どのような影響を与えるかが焦点になる。さらに、提案された能力分類が他のタスクや環境にどの程度一般化するかも検証が必要だ。

なぜ重要か

Capek 0.5は、身体性AIにおけるVLMの訓練方法に新たな視点を提供する。実行中心の能力分類と専門家モデルの統合は、ロボットの複雑なタスク実行をより効率的に学習させる可能性があり、今後の身体性AI研究の方向性に影響を与えるとみられる。