何が起きたか

arXivは2026年9月22日、Unitree G1を使う訓練不要の手法「Sample, Simulate, Select: Physics-in-the-Loop Text-to-Motion for Humanoids Without Training」を公表した。論文は、凍結したtext-to-motionモデルから各プロンプトにつきN個の動作を生成し、逆運動学でG1に再ターゲットした上で、事前学習済みSONIC tracking policyと剛体ダイナミクス下でシミュレーションし、最も実行しやすかった候補を残す枠組みである。200件のHumanML3Dテストプロンプトでは、N=8で直立実行率が83.5%から89.5%に、hardware-gate passは33から85に改善したとしている。

詳細

完全なテスト分割4,184プロンプトでは、直立実行率は80.5%から89.5%に上昇した。論文は、落下をよく予測するキネマティック検証器のAUROCが0.90でも、この改善の4分の1しか回収できないとし、候補のランキングは母集団の落下判定より難しいとしている。 また、骨盤を下げるプロンプトは選別では補えず、ロボットに再ターゲットしたデータで学習した生成器はそれを実行できたと述べる。さらに、retargeterをGMRと比較した抄制実験では、any-of-8の上限が両者合わせて95.0%に上がったとしている。実機G1では、ゲート選択された177本のクリップをすべて実行し、全件が立位で完了、hardware tracking errorはシミュレーションと高い相関を示した(r=0.94)。

Key Facts

arXivが2026年9月22日に「Sample, Simulate, Select: Physics-in-the-Loop Text-to-Motion for Humanoids Without Training」を公開した[1]
手法はUnitree G1を対象に、凍結したtext-to-motionモデル、逆運動学、SONIC tracking policy、剛体ダイナミクスのシミュレーションを組み合わせる[1]
200件のHumanML3Dテストプロンプト、N=8で直立実行率が83.5%から89.5%に上昇した[1]
hardware-gate passは33から85に増えた[1]
実機G1ではゲート選択された177本のクリップがすべて立位で完了し、hardware tracking errorはシミュレーションとr=0.94だった[1]

本紙の見方

この論文の新しさは、動作生成器そのものを学習で置き換えるのではなく、既存のtext-to-motionモデルと実行系を接続し、シミュレーションを検証器として前段に置いた点にある。S^3は、候補生成→G1への再ターゲット→剛体ダイナミクス下の実行→選別という順で動き、学習済みの生成器と制御器の間にあるギャップを、追加学習ではなくサンプリングと選抜でどこまで埋められるかを測っている。ここでの主役は生成モデル単体ではなく、Unitree G1の実行可能性を判定する物理ループである。 本紙の関連記事である宇樹科技、Dex5-Sを発表は、同社のハードウェア側の更新を扱っていたが、今回の論文はその上で動く動作生成・実行の問題に踏み込んでいる。つまり、同じUnitreeでも、前者がロボット本体の機構更新なら、今回はその本体を前提にした「何をどう動かすか」の選別問題である。ハードウェアの性能向上だけでは埋まりにくいのは、実行時に不整合な候補を落とす判断であり、論文はその部分をシミュレーションに寄せている。 業界構造でみると、影響が出るのはモデル開発、制御、検証基盤の接点である。200プロンプトではN=8、全4,184プロンプト、実機177クリップといった数字が示す通り、この手法は大規模学習よりも、候補数を増やして実行可能なものだけ残す運用に向く。一方で、AUROC 0.90のキネマティック検証器が改善を十分に代替できなかった点は、静的な予測だけでは足りず、ロボットの力学を含む評価系が必要だと示す。どの程度の候補数で計算負荷と成功率が釣り合うか、実機での再現性がどこまで広がるかが次の確認点になる。 未確定なのは、この手法が他のヒューマノイドや別の動作分布にどこまで一般化するか、また実運用での候補生成数Nと計算コストの均衡である。論文はG1での結果を示したが、他機種で同じ選別精度が出るかどうかは本文だけでは判断できない。

なぜ重要か

arXivの論文は、Unitree G1での実機検証まで含めて、訓練なしのまま動作候補を物理で選別する可能性を示した。発表元によれば、200件のテストプロンプトと実機177クリップの結果があり、少なくともG1では「生成」より「選別」によって成功率を押し上げる余地がある。