何が起きたか

arXivは2026-09-28付で、RoboFL: Federated Expert Assembly for World Action Modelsを公開した。論文は、物理インタラクションデータの不足と分散を前提に、世界行動モデルを連合学習で更新する枠組みを提案している。中核は、MoSAIC(Mixture of Slotted Adapters)を用い、各クライアントで学習したLoRAアダプタをサーバー側MoEの専門枝として直接組み込む設計である。

詳細

RoboFLでは、サーバー側ルーターが事前知識を持つ枝に対してトークン割り当てを学習し、ルーティングと専門家パラメータを同時に調整する。さらに、Foresight-to-Action Routing Distillation(FARD)でモデルの3つの経路のルーティングをそろえ、Path-Consensus Expert Aggregation(PCEA)で専門家更新を圧縮したグローバルアダプタに変換し、個別配布する。 実験はRoboTwin 2.0、RLBench、実機のFrankaロボット腕で行われた。論文によると、RoboFLはFrankaロボット腕で集中型のPEFT InternVLA-A1を12.23%上回り、MoEベースの連合VLAベースライン比で1ラウンド当たりのクライアント通信を最大86.81%削減した。

Key Facts

RoboFLは、世界行動モデル向けの連合学習手法としてMoSAIC(Mixture of Slotted Adapters)を実装している。[1]
各クライアントで学習したLoRAアダプタを、サーバー側MoEの専門枝として直接組み込む設計である。[1]
Foresight-to-Action Routing Distillation(FARD)とPath-Consensus Expert Aggregation(PCEA)を用いる。[1]
実験対象はRoboTwin 2.0、RLBench、実機のFrankaロボット腕である。[1]
Frankaロボット腕では、集中型PEFT InternVLA-A1を12.23%上回り、通信量を最大86.81%削減した。[1]

本紙の見方

RoboFLの新しさは、連合学習を単なるパラメータ平均化として扱わず、LoRAアダプタをサーバー側MoEの専門枝として再解釈した点にある。これは、物理相互作用データが少なく、機関ごとに分断され、タスクも異なるという前提に対して、更新の衝突を避けながら専門性を残す方向の設計である。他方で、MoE化そのものやPEFTの利用自体は既定路線の延長でもあり、論文の焦点は「何を学習するか」より「どう集約するか」に移っている。 本紙の過去報道との接続はないが、論文内の構成からは、RoboFLが世界行動モデルの学習をデータ収集の拡大ではなく、既存クライアントの局所適応を束ねる方向で進めていることが読み取れる。FARDは三つの経路のルーティング整合を取る仕組みであり、PCEAは専門家更新を圧縮したグローバルアダプタに変えて再配布する仕組みである。つまり、学習済みの知識をそのまま集めるのではなく、ルーティング情報とアダプタ更新を分離して再編成する点が、この手法の核とみられる。 業界構造への含意としては、ロボットの世界行動モデルでボトルネックになりやすいのが、元データの不足だけでなく、更新の受け渡しコストと専門性の維持だという点が具体化した。最大86.81%の通信削減が示すのは、分散環境での反復更新を前提にした設計の重要性である。一方で、実機で確認されたのはFrankaロボット腕であり、異なるロボット本体や操作空間にそのまま一般化できるかは未確定である。今後は、クライアント数、タスク異質性、学習ラウンドを増やしたときに、PCEAがどこまで専門性と安定性を保てるかが焦点になる。

なぜ重要か

論文が示した12.23%の性能改善と最大86.81%の通信削減は、分散した実世界データをそのまま集めにくいロボット学習で、更新方式そのものが性能と運用負荷を左右しうることを示す。発表元のarXiv論文によれば、対象はRoboTwin 2.0、RLBench、Frankaロボット腕であり、少なくとも実機を含む評価系で検証されている。