何が起きたか

arXiv掲載の論文で、研究者らは2026-09-27に水中の具現化エージェント向け世界行動モデル「AquaWAM」を発表した。AquaWAMは、未来画像の予測ではなく、スラスターのデッドバンド、慣性による漂走、海流などの受動的な物理ダイナミクスを含めてモデル化する。USIMベンチマークの20の水中タスクで72.6%の成功率を示し、NVIDIA Jetson AGX Orin上ではU0より2.7倍速く行動判断した。

詳細

AquaWAMは、DVL、IMU、圧力センサー、関節エンコーダーを用いて状態を取得し、カメラは目標や対象姿勢を理解するための意味情報に限定して使う設計である。高次元の視覚観測ではなく、コンパクトなナビゲーション状態を扱うことで、従来のWAMよりモデルサイズと計算コストを抑えるとしている。 論文は、センサー情報が一部欠ける条件でも有効性を示した。たとえばDVLの速度計測がない場合でも成功率は61.6%で、U0の39.4%を上回った。

Key Facts

AquaWAMは、水中の具現化エージェント向けに設計された世界行動モデルである。[1]
AquaWAMは、スラスターのデッドバンド、慣性による漂走、海流などの受動的な物理ダイナミクスをモデル化する。[1]
USIMベンチマークの20の水中タスクで成功率72.6%を記録した。[1]
NVIDIA Jetson AGX Orin上で、AquaWAMはU0より2.7倍速く行動判断した。[1]
DVLの速度計測がない条件でも成功率61.6%を維持し、U0の39.4%を上回った。[1]

本紙の見方

AquaWAMの新しさは、世界行動モデルを水中環境に持ち込みつつ、単なる未来画像予測から離れて受動的な物理ダイナミクスを明示的に扱った点にある。スラスターのデッドバンド、慣性による漂走、海流は、水中ロボットの挙動を行動後も左右するため、ここを状態モデルに組み込む設計は、視覚中心のWAMとは役割が異なる。一方で、DVL、IMU、圧力センサー、関節エンコーダーを用い、カメラを意味情報に限定している点は、知覚の中心を画像から運動状態へ寄せる構成であり、既存の具現化AIの延長線上にある。 本紙の見方では、今回の焦点は「水中で使えるWAMを作った」こと自体より、運動状態を軽量に扱うことでモデルサイズと計算コストを下げた点にある。Jetson AGX Orin上でU0より2.7倍速いという結果は、研究室内の高性能GPU前提ではなく、搭載計算資源の制約下で動かす想定を示す。DVLがない条件でも61.6%を維持したことは、実運用でセンサーが欠損する状況への耐性を測る指標になっている。つまり、AquaWAMは高精度化の主張だけでなく、限定されたオンボード計算とセンサー構成で成立するかが重要な論点である。 業界構造への含意としては、水中ロボットのAIは、画像理解の精度競争だけでなく、推進・慣性・外乱を含む運動モデルの組み込み競争に入る可能性がある。特に、DVLや圧力センサー、IMUのような状態計測系と、カメラの役割分担をどう設計するかが、実装の差になりやすい。加えて、Jetson AGX Orinでの速度優位が示された以上、エッジ側での推論負荷と、モデル精度の両立が次の比較軸になるとみられる。未確定の論点は、USIM以外の実環境での再現性、センサー構成をさらに削った場合の性能、そして他の水中機体への移植性である。

なぜ重要か

AquaWAMは、USIMの20タスクで72.6%の成功率を示し、NVIDIA Jetson AGX Orin上でU0より2.7倍速く動作したとされる。これは、水中ロボットを高性能計算機に依存させず、搭載機材の制約下で動かす設計の有効性を示す材料になる。

日本への影響

日本の水中ロボットや海洋計測の文脈では、DVL、IMU、圧力センサー、関節エンコーダーのような状態計測系を前提にした軽量モデルの設計が、搭載計算資源の小さい機体で重要になる可能性がある。