何が起きたか
arXivは2026-10-05、論文「I-BFM: Reward-Conditioned Robust Humanoid Interaction via Unsupervised Reinforcement Learning」を公開した。論文は、単一の人型ポリシーで多様な全身制御を行う既存のbehavioral foundation modelsを、人型ロボットと物体の物理的相互作用へ拡張する試みだとしている。 著者らは、タスク固有の方策や参照追従に依存せず、人型・物体・接触の結合ダイナミクスを共有表現として学習する手法を示した。実機ではUnitree G1を用い、外乱や失敗後の回復、タスク連鎖を特定タスク向け再学習なしで確認したとしている。
詳細
論文は、forward-backward representationsとunsupervised reinforcement learningを用いて、結合ダイナミクスの共有表現を学習する枠組みを採る。下流タスクの報酬が与えられると、同じ方策をlatent commandで直接条件付けし、タスク特化の方策最適化をせずに閉ループの相互作用を実行できるとしている。 また、短期のinteraction targetsと長期のgoal targetsの両方で学習し、carry、push、kickに加えて、goal reaching、motion tracking、stylistic control、long-horizon task chainingを扱うとする。Carryではnominal success 94.3%を示し、ロボットが倒れた後でも89.3%の成功率を維持した一方、planning-based baselineは1.3%だったと報告した。
Key Facts
| arXivは2026-10-05に論文「I-BFM: Reward-Conditioned Robust Humanoid Interaction via Unsupervised Reinforcement Learning」を公開した。 | [1] |
| 論文は、I-BFMを「人型ロボットと物体の相互作用」のための最初のbehavioral foundation modelだとしている。 | [1] |
| 手法はforward-backward representationsとunsupervised reinforcement learningを用い、タスク特化の方策最適化なしに閉ループ相互作用を行うとしている。 | [1] |
| CarryタスクでI-BFMはnominal success 94.3%を示し、robot falls後でも89.3%の成功率を保ったとしている。 | [1] |
| 実機実験はUnitree G1で行われ、外乱からの迅速な回復とタスク連鎖を示したとしている。 | [1] |
本紙の見方
この論文の新しさは、単一の人型ポリシーで全身制御を扱うBFMの発想を、そのまま人型ロボットと物体の接触を伴う相互作用へ押し広げた点にある。既存の全身制御研究でも汎化は論点だったが、ここで前面に出ているのは姿勢制御や移動ではなく、carry、push、kickのような相互作用を含む閉ループ制御である。しかも、タスク特化の方策や参照追従を前提にせず、同一方策をlatent commandで条件付ける設計を採っているため、制御の単位が「個別技能」から「共有表現+報酬条件付け」に移っていると読める。 本紙の関連記事である松延動力、智元機器人、宇樹科技が相次ぎ具身智能モデルを公表は、具身智能モデルの公表が相次いだことを伝えていた。今回のI-BFMは、その流れの中でも、物体との相互作用を明示的に扱い、しかもUnitree G1で実機検証まで付けた点で一段具体性が高い。ただし、モデルの位置づけは論文内の主張に基づくもので、商用化や製品実装を示すものではない。あくまで研究段階で、外乱後の回復やタスク連鎖がどこまで一般化するかは、実機条件を変えた再現性確認が必要だ。 業界構造でみると、焦点は「ロボット本体の性能」だけではなく、実世界の接触データと長時間のタスク列をどう学習基盤に載せるかに移っている。Carryで94.3%、倒壊後でも89.3%という数値は、単発成功率よりも失敗後復帰を評価軸に置くべきことを示唆する。一方で、論文はUnitree G1での実験を示すが、どの程度の環境条件、物体種、外乱強度で再現したかは本文の要約だけでは限定的である。次に確認すべき論点は、実機条件の範囲、タスクごとの成功率の内訳、長時間チェーンでの崩れ方、そして他機種への移植性である。
なぜ重要か
論文がUnitree G1での実機実験を示したことで、人型ロボットの評価軸が「歩く・運ぶ」に加えて、物体との接触を伴う相互作用へ広がる可能性がある。発表元は、特定タスク向け再学習なしで外乱後の回復やタスク連鎖が可能だとしており、研究開発では実機データの取り方と失敗後復帰の設計が重要になるとみられる。
日本への影響
Unitree G1が実機検証に使われた点は、日本勢にとっても、ロボット本体の機械性能だけでなく、接触を伴う学習データと評価設計が競争軸になることを示す。とくに、物体操作やタスク連鎖の実証を重ねるには、センサー、制御、学習基盤を一体で組む必要があり、部材・制御技術・実機試験環境の整備が論点になりうる。