何が起きたか
2026年8月3日、arXivに投稿された論文で、差動シミュレーションを用いた四足歩行学習のオープンソースフレームワーク「Open-DiffLoco」が発表された。同フレームワークはUnitree Go2四足ロボットに実機展開可能な歩行ポリシーを訓練でき、訓練時間は約20〜60分、VRAM使用量は6 GB未満とされる。
詳細
Open-DiffLocoは、MuJoCo XLA (MJX)上でShort-Horizon Actor-Critic (SHAC)アルゴリズムを実装し、実機に転送可能な proprioceptive ポリシーを訓練する。ポリシーは特権的な観測(ベース線速度など)を除去し、参照軌跡に依存しない。報酬関数は大幅に簡素化され、複雑な補助報酬なしで歩行パターンを発見できる。実機展開では、全方向の速度指令を追従し、ルート平均二乗誤差は0.2 m/s未満、速度は1 m/s以上を達成。不整地や外乱(横方向の押し)に対しても頑健とされる。また、SHACの拡張として、批評家のヤコビアンを監視するJacobian-Augmented Value Estimation (JAVE)を提案している。
Key Facts
| Open-DiffLocoは、差動シミュレーションを用いた展開可能な四足歩行ポリシーを訓練するオープンソースフレームワークである。 | [1] |
| 訓練は単一のNVIDIA GeForce RTX 5080 GPUで6 GB未満のVRAMを使用し、約20〜60分で完了する。 | [1] |
| 実機展開ではUnitree Go2四足ロボットを使用し、速度追従のルート平均二乗誤差は0.2 m/s未満、速度は1 m/s以上を達成した。 | [1] |
| ポリシーは特権的な観測(ベース線速度)を除去し、参照軌跡に依存しない。 | [1] |
| SHACの拡張としてJacobian-Augmented Value Estimation (JAVE)を提案している。 | [1] |
なぜ重要か
このフレームワークは、ロボットの歩行制御開発を民主化し、開発コストと時間を大幅に削減する可能性がある。特に、Unitree Go2のような市販ロボットで実証されたことで、実用化への道筋が示された。今後のロボット産業では、こうした学習基盤のオープンソース化が競争力を左右する要素となるだろう。