何が起きたか

arXivに2026年8月15日付で公開された論文「NPU Offloading of a Frozen Visual Encoder for Robot Policy Training」において、研究チームはロボットポリシー訓練のための非同期訓練パイプラインを提案した。このパイプラインでは、凍結した視覚エンコーダーをMobilint Aries2 NPU上でA8W8 INT8形式で実行し、FP32のアクション生成モジュールをNVIDIA GeForce RTX 5060 Ti GPUで訓練する。実験では、GPUのみのベースラインと、NPUオフロードを1層から4層のTransformerエンコーダー層に段階的に拡張する4つの条件(L1〜L4)を比較した。各条件は30,000ステップ、3つのランダムシードで訓練され、エネルギー消費はL1で17.1%、L4で27.9%削減された。一方、訓練時間はL1で15.2%、L4で37.7%増加し、ピーク時GPUメモリ割り当ては19.8%から20.7%減少した。

詳細

ロボットポリシーを新しいタスクやデータセットで訓練する際、視覚エンコーダーを凍結し、アクション生成モジュールのみを訓練することで訓練コストを削減できる。凍結によりエンコーダーの逆伝播は不要になるが、入力画像が毎ステップ変化するため順伝播は毎訓練ステップで実行され、GPU計算を消費し続ける。研究チームは、この計算をNPUなどの低消費電力AIアクセラレータに移すことで、データ転送と訓練時間の増加を伴っても総エネルギーを削減できるか、またポリシー性能にどのような影響があるかを検証した。 実験では、AR-Actorスペシャリスト向けにGPUとNPUの両方を使用する非同期パイプラインを構築した。凍結した視覚エンコーダーはMobilint Aries2 NPUでA8W8 INT8形式で実行され、FP32のアクションエキスパートはNVIDIA GeForce RTX 5060 Ti GPUで訓練された。GPUのみのベースラインと、NPUオフロードを1層から4層のTransformerエンコーダー層に段階的に拡張する4つの条件(L1〜L4)を比較した。各条件は30,000ステップ、3つのランダムシードで訓練された。GPUボード電力はGPUのみの条件で、NPU条件ではGPUとNPUの合計ボード電力が測定された。 結果として得られた15のポリシーは、それぞれ同じ300の環境シードで評価され、合計4,500回のシミュレーションロールアウトが行われた。成功率はGPUのみで93.33%、NPU条件で91.44%から92.89%であった。これらの結果から、凍結した視覚エンコーダーのNPUオフロードは訓練エネルギーを削減できるが、訓練時間が増加し、成功率がGPUのみの訓練と比較して0.44から1.89ポイント低下することが示された。

Key Facts

論文はarXivに2026年8月15日付で公開された(source_index: 0)出典一覧
凍結した視覚エンコーダーはMobilint Aries2 NPU上でA8W8 INT8形式で実行された(source_index: 0)出典一覧
FP32のアクションエキスパートはNVIDIA GeForce RTX 5060 Ti GPUで訓練された(source_index: 0)出典一覧
NPUオフロードはL1からL4の4条件で、Transformerエンコーダー層を1層から4層に段階的に拡張した(source_index: 0)出典一覧
各条件は30,000ステップ、3つのランダムシードで訓練された(source_index: 0)出典一覧
エネルギー消費はL1で17.1%、L4で27.9%削減された(source_index: 0)出典一覧
訓練時間はL1で15.2%、L4で37.7%増加した(source_index: 0)出典一覧
ピーク時GPUメモリ割り当ては19.8%から20.7%減少した(source_index: 0)出典一覧
成功率はGPUのみで93.33%、NPU条件で91.44%から92.89%だった(source_index: 0)出典一覧
成功率はGPUのみと比較して0.44から1.89ポイント低下した(source_index: 0)出典一覧

なぜ重要か

この研究は、ロボットポリシー訓練におけるエネルギー消費削減の可能性を示すものであり、低消費電力NPUの活用が訓練コスト削減に寄与し得ることを実証した。ただし、訓練時間の増加と成功率の低下というトレードオフがあり、実用化にはさらなる検討が必要である。