日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
安全性arXiv:2609.02293v1

SEAL: 共有エキスパートの整合によるMixture-of-Expertsのグローバル安全性強化

SEAL: Reinforcing Global Safety in Mixture-of-Experts through Shared Expert ALignment

シェア:XThreadsFacebookLINEはてブBluesky

MoEモデルの安全性を強化するため、常時活性化される共有エキスパートに着目し、ルータ非依存の防御手法SEALを提案した。

詳しい要約

1. どんなもの?

SEALは、Mixture-of-Experts (MoE) アーキテクチャの大規模言語モデルにおける安全性を強化するための、トレーニング時にパラメータ効率の良い防御手法である。MoEはトークンごとに一部のエキスパートのみを活性化するため、ルーティングの選択が安全性に影響するという構造的脆弱性を持つ。SEALは、常に活性化されるshared expertに注目し、ルーターに依存しないアンカーとして利用することで、敵対的攻撃に対する安全性を向上させる。SEALはshared expertに取り付けるプラグアンドプレイのアダプタを生成し、SEAL++は既存の安全部分空間を保持するための直交制約を追加する。

2. 先行研究と比べてどこがすごい?

既存の防御は主にルーターの堅牢化に焦点を当てているが、ルーティングプロセスの非決定的な性質により、敵対者はルーティング経路を操作またはバイパスできる可能性がある。SEALは、ルーターに依存しないshared expertを利用することで、このようなルーター操作に対する脆弱性を克服する点が新しい。また、トレーニング時のパラメータ効率の良い防御であり、プラグアンドプレイのアダプタとして既存モデルに容易に統合できる。

3. 技術・手法の肝は?

SEALの手法の肝は、shared expertが常に活性化されることに着目し、その中に含まれる少数の安全上重要なニューロンを特定し、それをアンカーとして利用することである。SEALはshared expertに取り付けるアダプタをトレーニングし、SEAL++は直交制約を追加して既存の安全部分空間を保持する。これにより、スパースなルーティングの不確実性を克服し、ルーターに依存しない安全性のアライメントを実現する。

4. どうやって有効だと検証した?

SEALとSEAL++を、有害なプロンプト、脱獄、悪意のあるファインチューニングの3つの敵対的入力と、ニューロンプルーニングの有無を組み合わせた6つの攻撃シナリオで評価した。その結果、SEALは攻撃成功率 (ASR) を最大60%削減し、5ベンチマーク平均で能力コストは最大1.4%に抑えられた。また、SEALはルーターレベルの防御とシームレスに統合できることも示された。

5. 議論はある?

要旨からは、SEALの限界や議論についての詳細は不明である。ただし、SEALはshared expertに依存するため、shared expertを持たないMoEモデルには適用できない可能性がある。また、トレーニング時の防御であるため、推論時のみの防御と比較して計算コストがかかる可能性がある。さらに、評価は特定の攻撃シナリオに限定されており、他の攻撃手法に対する有効性は不明である。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、Hybrid MoE architecture、既存のルーターレベルの防御手法、および敵対的攻撃に関する研究が挙げられる。具体的には、MoEの安全性に関する研究や、shared expertの利用に関する研究を読むことが推奨される。また、ルーターの堅牢化に関する既存の防御手法の論文も関連する。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Qingyu Meng, Yiwei Zha, Jiahuan Pei, Koen Hindriks, Herbert Bos, Min Chen

分類: cs.LG, cs.AI, cs.CR

原文アブストラクト

Mixture-of-Experts (MoE) is a scaling architecture for large language models that activates only a small subset of expert modules per token, enabling massive parameter growth with nearly constant computation. Recent Hybrid MoE architecture adds \textit{shared experts} to capture consistently useful representations, further improving stability and generalization. MoE now powers many flagship open-source and commercial models, yet remains vulnerable to adversarial attacks. Specifically, sparse routing introduces a structural vulnerability: MoE safety hinges on which experts are activated, and adversaries can subvert this selection through jailbreak prompts, malicious fine-tuning, and weight-level pruning of safety-critical neurons. Existing defenses primarily focus on hardening the router, but an adversary may still manipulate or bypass the routing trajectory due to the routing process's nondeterministic nature, thereby collapsing the defense. To cope with this problem, we first identify theoretically and empirically that shared expert, an always-activated component containing a small proportion of safety-critical neurons, can overcome the uncertainty of sparsely activated routing path and serve as a router-independent anchor to enhance global safety alignment. Based on this insight, we propose SEAL, a training-time parameter-efficient defense that produces a plug-and-play adapter attached to shared expert, and SEAL++, a variant that adds an orthogonal constraint preserving pre-existing safety subspaces during training. We evaluate SEAL and SEAL++ across six attack scenarios that combine three adversarial inputs (harmful prompting, jailbreak, malicious fine-tuning) with and without neuron pruning. SEAL reduces attack success rate (ASR) by up to 60\%, at a capability cost of at most 1.4\% on a five-benchmark average. Additionally, SEAL can seamlessly integrate with router-level ......

関連論文