何が起きたか
2026年7月20日、arxiv.orgに技術報告書が公開され、OpenPangu-7Bを基盤とするVLNシステム「PGN(Pangu Navigator)」の設計と実装が示された。同システムはオフラインの行動予測に特化し、500件の専門家軌道を用いた評価でNAM 62.29%、NER 100.00%を達成したと報告されている。
詳細
PGNは2段階の訓練プロセスを採用する。第1段階では、凍結したEVA-ViT-G/14視覚エンコーダと凍結した言語バックボーンを、Q-Formerと2層MLPプロジェクタで整列させる。第2段階では、整列済みモデルを専門家ナビゲーション軌道に適応させ、5観測ウィンドウ、エポック依存の時間サンプリング、推論-行動の出力形式を用いる。この段階では視覚経路を凍結し、3つの構造トークン埋め込みとLoRAアダプタのみを更新する。実装は混合精度計算、選択的FP32計算、DeepSpeed ZeRO-2を8基のAscend 910B NPU上で使用する。評価は教師強制によるオープンループ方式で、500件のホールドアウト軌道に対して実施された。
Key Facts
| PGNはOpenPangu-7Bを基盤とするオフラインVLN行動予測システムである。 | [1] |
| 訓練は2段階で、第1段階でEVA-ViT-G/14視覚エンコーダと言語バックボーンをQ-FormerとMLPプロジェクタで整列させる。 | [1] |
| 第2段階では5観測ウィンドウ、エポック依存の時間サンプリング、推論-行動出力形式を用いて専門家軌道に適応する。 | [1] |
| 実装は8基のAscend 910B NPU上でDeepSpeed ZeRO-2を使用する。 | [1] |
| オープンループ評価でNAM 62.29%、NER 100.00%を達成した。 | [1] |
本紙の見方
今回のPGNは、マルチモーダル大規模言語モデルをVLNに適用する際の技術的課題、すなわち視覚と言語の整列、時間的入力の圧縮、行動空間への接地、ハードウェア上での安定した訓練に焦点を当てた実装報告である。新規性は、OpenPangu-7Bという特定の基盤モデルを用い、Q-FormerとMLPプロジェクタによる整列、LoRAによる軽量適応、Ascend 910B NPUでの効率的な訓練を組み合わせた点にある。一方で、オフラインの行動予測に限定されており、閉ループのナビゲーション成功を評価していない点は、既存のVLN研究と比較して限定的な成果と言える。 本紙の過去報道との接続は、関連記事が提供されていないため直接的な言及は避けるが、基盤モデルの応用領域が対話や生成からロボット制御へ拡大する流れの一環と位置づけられる。PGNはオフライン評価に留まるため、実環境での性能は未知数であり、誤差蓄積や経路効率、目標達成率の評価が今後の焦点となる。 業界構造への含意として、Ascend 910B NPUを活用した点は、中国製ハードウェア上での大規模モデル訓練の実例を示す。また、LoRAによるパラメータ効率的な適応は、計算資源が限られた環境でのVLN実装を可能にする可能性がある。競合としては、GPT-4VやGeminiなどのマルチモーダルモデルをVLNに適用する研究が存在するが、PGNはオープンソースの基盤モデルを用いる点で差別化を図っている。 未確定の論点としては、閉ループ評価の結果、実環境でのロバスト性、訓練データの規模と多様性、推論速度などが挙げられる。特に、オープンループのNAMが62.29%である一方、閉ループでは誤差が蓄積しやすいため、実用化にはさらなる検証が必要である。
なぜ重要か
PGNは、オープンソースの基盤モデルをVLNに適用する具体的な実装例を示し、特に中国製NPU上での訓練手法を提示した点で、ハードウェア制約のある環境でのVLN研究に影響を与える可能性がある。ただし、オフライン評価のみであり、実環境での性能は未検証であるため、今後の閉ループ評価の結果が重要となる。