何が起きたか

上海AI Laboratoryは2026-09-23、物理世界モデル系列の第1弾として「InternW0」を発表した。約7200時間の異種ロボット・自我視点データで学習し、その中には275時間の実験室内自我視点データセット「EgoLab」が含まれる。評価対象には、15段階の金属有機構造体(MOF)合成ワークフローと、5段階の接触・力覚対応の巧緻操作が含まれた。

詳細

InternW0は、オムニモーダル・インターフェース、非同期の多周波処理、部分観測と外部影響下での局所物理モデリングを軸に設計されたという。構成としては、将来の視覚ダイナミクスと連続的なロボット制御を、非対称な動画--行動アーキテクチャとflow matchingで同時に学習する。 同社は、長い時間軸の予測文脈を担う高容量の動画エキスパートと、より高速な時間スケールで動く軽量の行動エキスパートを組み合わせたとしている。また、行動更新のたびに未来を再生成するのではなく、層ごとのK/Vを再利用し、観測条件付きのコンテキスト・ルーティングで新たに観測された状態へ適応する方式を採る。異種の実体にはドメイン固有インターフェースとソフトプロンプトを使い、接触を伴う操作には力覚・触覚信号を取り込む事後学習を行ったとしている。

Key Facts

上海AI Laboratoryは「InternW0」を発表した。[1]
InternW0は物理世界モデル系列の第1弾である。[1]
学習データは約7200時間の異種ロボット・自我視点データで、その中に275時間の「EgoLab」が含まれる。[1]
評価には15段階の金属有機構造体(MOF)合成ワークフローが含まれる。[1]
評価には5段階の接触・力覚対応の巧緻操作が含まれる。[1]

本紙の見方

InternW0の新しさは、単なる未来予測モデルではなく、変化し続ける実世界に対して「行動可能な予測」を維持することを前面に置いた点にある。物理世界モデルの系列名を掲げつつ、動画予測と連続制御を非対称アーキテクチャで結び、さらに層ごとのK/V再利用と観測条件付きルーティングを入れているため、処理の主役は生成そのものではなく、観測更新に応じて予測と制御をつなぎ直す仕組みだと読める。 今回の核は、約7200時間という学習規模と、その内訳に275時間のEgoLabが含まれることだ。長い動画文脈を担う高容量の動画エキスパートと、より高速に動く軽量の行動エキスパートを分けた設計は、ロボットの入力から制御までを一体で回す際の計算配分を示している。これに力覚・触覚を含む接触対応の事後学習が加わることで、視覚中心のモデルよりも、把持・挿入・接触を伴う工程に寄せた構造になっている。 ただ、15段階のMOF合成ワークフローと5段階の巧緻操作を同一モデルで扱っている点は、単一のロボット技能ではなく、実験手順のような長い連鎖作業と、接触を要する細かな操作を同じ学習枠組みで評価していることを示す。これは、モデルの汎用性を示す一方で、実験系とマニピュレーション系でどこまで性能差があるかを見極める必要があることも意味する。 次に確認すべきなのは、学習に使った約7200時間のデータの構成比、EgoLabの位置づけ、実ロボット上での再現性、そして15段階・5段階の各評価でどの工程が失敗点になりやすいかである。加えて、ドメイン固有インターフェースとソフトプロンプトが、異なる実体や作業条件の違いをどこまで吸収できるのかが焦点になる。

なぜ重要か

上海AI Laboratoryによると、InternW0は視覚予測と連続制御を同時に学習し、接触・力覚信号も取り込む設計である。これにより、ロボットの実時間制御と長い実験手順の両方を同じ枠組みで扱う余地がある。 学習データに約7200時間、うち275時間の実験室内データを含めた点は、モデル性能がデータ量だけでなく、どの種類の実世界データをどう混ぜるかに左右されることを示す。

日本への影響

日本のロボット研究や実験自動化では、力覚・触覚を含む接触操作と、長い手順の実行が重要になる場面があるため、InternW0が示した学習構成は関心対象になりうる。ただし、実機での再現性や評価条件が本当に同じかは、今回の発表だけでは判断できない。