何が起きたか

Pelican-Sim 1.0は2026-09-10、arxiv.orgで公表された技術報告である。視覚文脈とロボット動作から将来観測を予測する汎用世界モデル・シミュレータとして提案され、約100万本の実世界およびシミュレーション軌跡で学習した。設計の核は、28次元の行動表現、行動と画像を結ぶ注入方式、疎なMixture-of-Experts、4ステップの自己回帰生成である。

詳細

報告では、統一行動表現として28次元の行動値空間を採用し、主流の多くの身体形態を1つのモデルで扱えるようにしたとしている。行動-視覚注入では、URDFとカメラでレンダリングした行動動画を橋渡しに使い、PSNRで代替融合ベースライン比+0.904の改善を示したとしている。 疎なMoE層は異種ダイナミクスへの容量を補い、行動モダリティを吸収しつつインターモダリティの衝突を抑える設計だという。効率的ロールアウト生成では、因果適応と少数ステップ蒸留により4ステップの自己回帰シミュレータを実現し、35ステップモデル比で5.67倍の高速化を達成したとしている。

Key Facts

Pelican-Sim 1.0は、視覚文脈とロボット動作から将来観測を予測する汎用世界モデル・シミュレータとして提案された。[1]
学習データは約100万本の実世界およびシミュレーション軌跡である。[1]
統一行動表現として28次元の行動値空間を採用した。[1]
行動-視覚注入で、PSNRは代替融合ベースライン比+0.904となった。[1]
4ステップの自己回帰シミュレータは、35ステップモデル比で5.67倍高速だった。[1]

本紙の見方

Pelican-Sim 1.0の新しさは、単に世界モデルを掲げた点ではなく、28次元の統一行動表現、URDFとカメラレンダリングを使う行動-視覚注入、疎なMoE、4ステップ生成を一体で組み合わせた点にある。特に、約100万本の軌跡を学習に使いながら、異なる身体形態を横断して同じモデルを成立させようとしている構造が目を引く。一方で、これはロボット用のシミュレータ一般で見られる「予測精度向上」の延長でもあり、純粋な概念刷新というより、異種ロボットを同じ入出力規格に寄せる実装上の統合が前面に出た報告とみられる。 本紙の関連記事はないため、過去報道との連続性を直接たどることはできない。ただし、本文だけを見ると、従来の世界モデル研究で分断されがちだった行動表現と視覚表現、さらに推論速度を同時に扱っている点が特徴である。PSNRの改善幅やFVDの改善、4ステップ化による5.67倍高速化は、精度だけでなく実運用時の反復速度まで設計対象にしていることを示す。ここからは、単なる動画生成ではなく、行動選択や方策評価に使えるかどうかが焦点になるとみられる。 業界構造への含意としては、ロボット向け基盤モデルの競争軸が、モデル規模だけでなく「どの身体形態を1つの表現で包摂できるか」「どれだけ速くロールアウトできるか」に移っている点が重要である。28次元の行動空間は汎用性をうたう一方、実際にどこまで異種機体へ移植できるかは、学習済みデータの偏りやタスク範囲に左右される可能性がある。さらに、RoboTwinでの500本の生成軌跡追加により方策成功率が70%から93%へ上がったという結果は、シミュレータがデータ拡張装置として機能しうることを示すが、別ベンチマークや未見環境でも同様かは未確認である。 次に確認すべき論点は、28次元の行動表現がどの身体構成まで実際にカバーするのか、4ステップ生成の速度優位が長いホライズンや複雑な相互作用でも維持されるのか、そして5つのチェックポイントで相関0.994とされた方策評価が他領域へ広がるのかである。加えて、約100万本という学習軌跡の内訳や、どのベンチマークでどの程度の一般化が成立したのかを追う必要がある。

なぜ重要か

発表内容が事実なら、ロボット開発では実機試験の前段で使う予測・評価基盤として、行動と視覚を同時に扱うシミュレータの重要性が高まるとみられる。特にRoboTwinで方策成功率が70%から93%へ、方策選択の相対成功増が47.7%とされており、データ拡張と評価の両方に使えるかが論点になる。

日本への影響

日本のロボット研究や製造現場にとっては、身体形態をまたぐ28次元の行動表現と、4ステップで回す高速ロールアウトが既存の実機検証フローをどこまで置き換えられるかが関心点になるとみられる。実機データが限られる領域では、約100万本の軌跡を前提にした学習方式をそのまま適用できるかが焦点である。