何が起きたか

StarVLAは2026年8月27日、ロボット向け視覚言語行動モデル「VLAct-Qwen3VL4B-OFT-RoboDojo」をHugging Faceで公開した。モデルはベースモデル「StarVLA/Qwen3-VL-4B-Instruct-Action」を基に、RoboDojoデータセットでファインチューニングされている。

詳細

モデルカードによると、ベースモデルは「StarVLA/Qwen3-VL-4B-Instruct-Action」で、ファインチューニングも同モデルに対して実施。アーキテクチャはDiffusion Policyを採用。ライセンスはApache-2.0。リージョンは米国。

Key Facts

StarVLAは2026年8月27日、VLAct-Qwen3VL4B-OFT-RoboDojoをHugging Faceで公開した。[1]
ベースモデルはStarVLA/Qwen3-VL-4B-Instruct-Action。[1]
ファインチューニングもStarVLA/Qwen3-VL-4B-Instruct-Actionに対して実施。[1]
Diffusion Policyを採用。[1]
ライセンスはApache-2.0。[1]

本紙の見方

今回の公開は、ロボット向け視覚言語行動モデル(VLA)の分野で、特定のデータセット(RoboDojo)に特化したファインチューニングモデルを提供する動きの一環とみられる。本紙が2026年8月27日に報じた「VLAct-Qwen3VL4B」の事前学習モデル公開に続くもので、同一シリーズの派生モデルとして位置づけられる。事前学習モデルが複数のロボット形態に対応する汎用性を重視したのに対し、今回のモデルはRoboDojoデータセットに特化することで、特定タスクへの適応を図ったとみられる。 RoboDojoはロボット操作学習のためのデータセット群であり、これを用いたファインチューニングは、実世界の多様な操作タスクへの性能向上を意図したものと考えられる。Diffusion Policyの採用は、行動生成の安定性やマルチモーダルな分布の表現に利点があるとされ、VLAモデルでは一般的な手法となりつつある。 業界構造への含意として、VLAモデルの公開が進むことで、ロボットメーカーや研究機関は基盤モデルを自前で開発するコストを削減し、特定タスクへの適応に注力できるようになる。一方で、データセットの質と多様性がモデルの性能を左右するため、データセットの整備競争が激化する可能性がある。 未確定の論点としては、RoboDojoデータセットの具体的な内容(タスク数、ロボット形態、収集環境など)や、ファインチューニングによる性能向上の具体的な数値が公開されていない点が挙げられる。また、このモデルが実際にどのロボットプラットフォームで検証されたかも不明である。

なぜ重要か

VLAモデルの公開が続くことで、ロボットの操作学習の参入障壁が低下し、特定タスク向けのカスタマイズが容易になる。今回のモデルは、データセット特化型のファインチューニングの事例として、今後のモデル開発の方向性を示すものと言える。