何が起きたか

arXivに2026-09-29付で掲載された論文で、ヒューマノイド向けのBehavior Foundation Models(BFM)における共有潜在行動空間の蒸留手法「CrossBFM」が発表された。論文は、従来のForward-Backward表現では1体あたり数百GPU時間を要し、別のロボットを学習すると機体ごとに別の潜在空間が生じる点を問題視した。CrossBFMは、ロボット固有パラメータを持たない統一エンコーダで複数の訓練機体を同時に扱い、1GPU時間未満で蒸留し、その後の制御学習を追加10GPU時間で完了させる構成を提案した。

詳細

論文では、retargetingによってフレーム単位のクロスエンボディメント対応を与えたうえで、latent-conditioned trackersが蒸留された潜在表現をwhole-body controlへ変換すると説明している。実験対象は3体の蒸留済みヒューマノイドで、3つのプロンプト方式すべてが移植可能だったと報告した。 具体的には、motion trackingではlatent-conditioned policyがjoint-conditioned counterpartに対して関節誤差で0.025 radのみ悪化し、姿勢間のsmooth goal reachingでは転倒なし、reward optimizationでは41個のreward promptsすべてで最適化できたとしている。追加実験として、運動コーパスの4分の1のみでエンコーダを学習してもtracking performanceの5%低下にとどまり、学習済みロボット群の一部で学習し未見の1体で評価した場合でも、既知ロボットのtracking performanceの最大89%を回復したと述べている。

Key Facts

arXiv掲載日: 2026-09-29[1]
論文名: CrossBFM: Distilling a Shared Latent Behavior Space Across Humanoid Embodiments[1]
Forward-Backward representationsは1体のロボットで数百GPU時間を要するとしている[1]
CrossBFMはロボット固有パラメータのない統一エンコーダで、1GPU時間未満で蒸留するとしている[1]
latent-conditioned trackersの学習は追加10GPU時間で行うとしている[1]

本紙の見方

この論文の新しさは、ヒューマノイドの行動表現を機体ごとに閉じた潜在空間として扱うのではなく、複数の胴体形状をまたいで再利用できる資産として定義し直した点にある。Forward-Backward表現が高コストで、しかも2体目を学習すると別の空間が生まれるという問題に対し、CrossBFMはロボット固有パラメータを置かない統一エンコーダとretargetingを組み合わせ、蒸留と制御学習を分離した。ここでは、学習の主戦場が「個体ごとの政策学習」から「共有可能な潜在表現の抽出」へ移っている。 本紙の見方では、数百GPU時間対1GPU時間未満という差は単なる高速化ではなく、異なるヒューマノイド間で知識を移すための前処理コストを大きく下げる設計変更である。さらに、追加10GPU時間でwhole-body controlに接続する構成は、潜在表現そのものと実機制御の責務を分けた点に特徴がある。3体の蒸留済みヒューマノイドで3つのprompting modeが転移したとする結果は、少なくとも論文設定では、表現の共有化が姿勢到達・軌道追従・報酬最適化をまたいで機能することを示す。 一方で、論文は三つのヒューマノイドと41個のreward prompts、0.025 rad、5%低下、89%回復といった指標を示すが、これらがどの程度一般の機体差に耐えるかは別問題である。特に、未見ロボットでの89%回復は「形態的に近い」ロボットでの結果であり、形状差が大きい機体で同じ転移が成り立つかは未確定だ。今後は、対象機体の幅、retargetingの前提条件、実機での学習安定性、そしてGPU時間削減がデータ収集量や安全性にどう影響するかを確認する必要がある。

なぜ重要か

この論文は、ヒューマノイドの制御学習でボトルネックになりやすいGPU時間を、機体ごとの学習から共有潜在表現の蒸留へ移す設計を示している。著者らの実験では、3体のヒューマノイドで転移が確認され、1GPU時間未満の蒸留と追加10GPU時間の制御学習が可能としているため、複数機体を扱う研究開発の手順に影響しうる。

日本への影響

日本のヒューマノイド研究や実機制御では、機体ごとに学習をやり直す前提をどこまで崩せるかが焦点になる。とくに、形態の近い複数機体で0.025 radの誤差差や41個のreward promptsへの対応が示された点は、同系統のハードウェアを持つ研究現場にとって、学習資産の共通化を検討する材料になる。