何が起きたか

Skild AIは2026年9月22日、旗艦ロボティクス基盤モデルS1に自己対戦学習を適用する新しい事後学習手法を発表した。NVIDIA Isaac Sim上で140年以上にわたる仮想サッカー学習を行い、転倒からドリブル、ボール保持、タックルまで到達したと説明している。実世界では人間または別のロボットと対戦できるとしている。

詳細

同社によると、S1はインコンテキストの実演から新しい作業を学ぶ基盤モデルで、今回の手法では人間のデモンストレーションを使わず、自己対戦のみで最適化したという。学習ではまず、速度や方向を変えたドリブル、キックなどのドリルを個別の報酬で訓練し、その後、直近の自分自身と対戦しながらゴールを狙う方針で改善を進めたとしている。

Key Facts

Skild AIは2026年9月22日、フィジカルAIモデル向けの自己対戦学習を発表した。[1]
旗艦ロボティクス基盤モデルはS1である。[1]
学習はNVIDIA Isaac Sim上で140年以上にわたって行われた。[1]
同社は人間のデモンストレーションを使わずに自己対戦で学習させたとしている。[1]
実世界では人間または別のロボットと対戦できるとしている。[1]

本紙の見方

今回の発表で新しいのは、フィジカルAIの事後学習を「自己対戦」で回す設計を前面に出した点である。ロボティクスでは人手デモに依存する学習が多いが、Skild AIはS1を直近の自分自身と競わせ、報酬をゴール成功に絞ることで、転倒回避、ドリブル、ボール保持、タックルまでを連鎖的に獲得したと示した。これは、単一技能の最適化ではなく、相手が強くなるほど難度が上がる学習ループを作る試みだと読める。 本紙の関連記事であるIntrinsic、開発基盤の一部を公開Qualcomm、PickNik Roboticsの買収で合意が示すのは、ロボット開発の主戦場がハード単体から、開発基盤、操作フレームワーク、学習の回し方へ移っていることだ。今回のSkild AIの焦点も、モデル性能そのものだけでなく、実演データをどこまで減らせるか、シミュレーションから実機へどの程度移せるかにある。既存のROS 2や操作フレームワークを補完するというより、上位の学習層で再学習を回す構図である。 業界構造への含意としては、データの集め方が変わる点が大きい。人間の手本を積み上げる方法では、作業ごとにデータ収集が必要になるが、自己対戦が機能すれば、サッカーのような多エージェント課題から、社会的ナビゲーションや協調操作へ横展開しやすい。もっとも、今回の結果はまずシミュレーションでの成果であり、実機での再現性、一般タスクへの転移、報酬設計の妥当性が次の検証点になるとみられる。特に、140年以上の仮想学習が現実の計算負荷とどう釣り合うか、複数エージェントでの協調がどの程度安定するかはまだ確認が必要である。

なぜ重要か

Skild AIは、人間のデモンストレーションを不要にする自己対戦学習をS1に適用したと説明しており、ロボットの学習データの集め方を変える可能性がある。NVIDIA Isaac Sim上で140年以上の学習を要した点は、実運用では計算基盤とシミュレーション設計が前提条件になることを示す。

日本への影響

日本のロボット開発では、実機データの収集力とシミュレーション環境の整備がこの方式の適用条件になるとみられる。自己対戦で多エージェントの振る舞いを学ぶなら、実機の制御だけでなく、報酬設計や仮想環境の作り込みが競争力の源泉になる。