何が起きたか

arXivは2026-09-11、論文「DATAFARM: Distribution-Aligned Task and Motion Planning for Fine-Tuning Vision-Language-Action Models」を公開した。論文は、ロボット基盤モデルの学習で高品質データの収集が難しいことを前提に、Task and Motion Planning(TAMP)で生成する軌跡を事前学習分布に合わせる手法を示した。著者らは、計画器が成功させた軌跡でも、そのままではVLAモデルの微調整に十分効かない場合があるとし、分布のずれを埋める設計をDATAFARMと名付けた。

詳細

DATAFARMは、ロボットの関節構成、動作スタイル、時間的な実行プロファイルを事前学習データに合わせてTAMP軌跡を生成する。評価は、TAMPで実行可能な3つの卓上操作タスクと、TAMPの能力を超える布たたみタスクで行った。 結果として、DATAFARMの平均成功率は56.7%で、raw TAMPの8.3%を大きく上回り、人手遠隔操作の61.7%に近づいた。さらに、微調整分布の外にあるDeformable Object Manipulationでは、微調整後モデルの成功率は85%で、事前学習済みモデルの90%に対して高い水準を保った。

Key Facts

論文名は「DATAFARM: Distribution-Aligned Task and Motion Planning for Fine-Tuning Vision-Language-Action Models」である。[1]
掲載日は2026-09-11である。[1]
DATAFARMは、TAMP軌跡を事前学習分布に合わせる手法である。[1]
評価では3つの卓上操作タスクと1つの布たたみタスクを用いた。[1]
平均成功率は56.7%で、raw TAMPの8.3%、人手遠隔操作の61.7%と比較された。[1]

本紙の見方

DATAFARMの新規性は、TAMPで「解ける」軌跡を集めるだけではなく、それをVLAモデルの事前学習分布に合わせてから微調整用データとして使う点にある。ロボットデータの不足は従来からの論点だが、この論文は単純な軌跡生成ではなく、関節構成、動作スタイル、実行時間の形を寄せることを中核に置いた。つまり、入力としての計画生成、処理としての分布整合、出力としての微調整データという連結構造を明示した研究である。 raw TAMPが8.3%にとどまり、DATAFARMが56.7%まで改善した一方で、人手遠隔操作の61.7%にはまだ届いていないため、焦点は単純な生成能力ではなく、どの程度事前学習分布に近づければ微調整が安定するかに移る。ここで重要なのは、TAMPの適用範囲外である布たたみでも、微調整後モデルが85%を維持した点であり、分布整合が未学習タスクへの汎化をどこまで損なわずに済むかを示唆する。 業界構造への含意としては、ロボット基盤モデルの改善余地が、センサーやアクチュエータの新規開発だけでなく、データ生成の設計にあることを示している。特に、計画器が作るデモとVLAの事前学習データの間にあるずれをどう埋めるかは、学習パイプライン全体の設計問題になる。今後の確認点は、3つの卓上操作タスクと布たたみ以外の作業で再現するか、関節構成・動作スタイル・時間プロファイルのどの要素が寄与したか、そして人手遠隔操作に対する差をさらに縮められるかである。

なぜ重要か

ロボット基盤モデルの学習では、高品質データの収集が難しいと論文は指摘している。DATAFARMは、TAMPを単なる自動デモ生成ではなく、VLAの事前学習分布に合わせたデータ整形の手段として使うため、データ不足のボトルネックに対して別の解き方を示す。