何が起きたか
arxiv.orgは2026-10-01、ヒューマノイドの全身追跡向けに、事前学習済みトラッカーを制約フィルタに合わせて再調整する手法「CoFiT」を発表した。論文は、制約場面の比較で、TWIST2ではフィルタ単独訓練比の違反時間を91%削減し、SONICでは21%削減したとしている。Unitree G1の実機では、TWIST2で違反時間を83%減らし、全試行をオペレーター介入なしで完了したと報告した。
詳細
論文は、現行のヒューマノイド制御では、計画器、遠隔操作系、またはモーション生成器が参照を与え、強化学習ポリシーが動力学的に実現可能な全身制御でそれを追跡する構成が一般的だと説明する。そのうえで、制御バリア関数(CBF)などの実行時安全フィルタが、トラッカー出力への介入を通じて新しい制約を課す手段になり得ると位置づけた。 CoFiTは、追跡ポリシーと安全フィルタを独立に扱うと、実行される行動と誘導される状態分布の両方にずれが生じるという問題意識から設計された。論文では、こうしたずれの根本要因として、動力学・目的・情報の不一致を切り分けるケーススタディを行い、その知見を微調整方法に反映したとしている。
Key Facts
| arxiv.orgは2026-10-01に論文「Filter-Aware Fine-Tuning for Safe Humanoid Whole-Body Tracking」を公開した。 | [1] |
| 論文は、制約場面においてCoFiTがTWIST2で違反時間を91%削減し、SONICで21%削減したとしている。 | [1] |
| Unitree G1の実機では、CoFiTがTWIST2で違反時間を83%削減し、全試行をオペレーター介入なしで完了したとしている。 | [1] |
| 論文は、基準手法では試行の50%でオペレーター停止が必要だったとしている。 | [1] |
| 論文は、追跡ポリシーと安全フィルタの独立設計が行動と状態分布の不一致を生むと説明している。 | [1] |
本紙の見方
この論文の新規性は、ヒューマノイドの全身追跡を「安全フィルタを後付けする問題」ではなく、追跡器そのものをフィルタとの相互作用まで含めて再調整する問題として扱った点にある。CBFのような実行時安全機構は、すでに広く知られた発想だが、CoFiTはその介入を前提にした学習側の調整を提案しており、既定路線の延長ではあっても、設計の置き方を一段深くしたと読める。 本紙の関連記事である松延動力、智元機器人、宇樹科技が相次ぎ具身智能モデルを公表や人形ロボット関連特許、中国比率が60.8%に上昇は、モデル開発や知財の厚みが中国勢に集中している状況を示していた。これに対し今回の論文は、モデルの性能競争そのものではなく、実機運用での安全制約と学習済みポリシーの整合を論点に置く。研究の焦点が「動けるか」から「制約下でどれだけ破綻なく動けるか」へ移っていることを示す材料である。 業界構造の面では、重要なのは安全フィルタ、学習済みトラッカー、実機ハードの三層が分離されたままでは性能評価が安定しない点だ。論文は、フィルタ介入が実行アクションだけでなく状態分布も変えると指摘しており、今後はポリシー学習の段階で安全機構との接続条件を織り込めるかが焦点になるとみられる。実機でUnitree G1を使っていることから、ソフトウェア手法でも最終的には特定ハード上での挙動検証が不可欠であることがうかがえる。 未確定の論点は、CoFiTがどの程度の制約条件やタスク群に一般化するか、学習コストや推論時の追加負荷がどれほどか、他機種で同様の改善が再現するかである。論文はTWIST2とSONIC、Unitree G1の結果を示すが、量産機への展開条件や安全認証との接続までは書いていない。
なぜ重要か
ヒューマノイドを不整地や制約の多い環境で使う場合、追跡性能だけでなく安全フィルタとの整合が運用条件になることを、この論文は示している。Unitree G1でオペレーター介入なしの試行完了が示されたことは、制約下での動作安定性を重視する開発に直接関係する。