日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
継続学習arXiv:2608.26720v1

スパースイベントベース変換器のためのパラメータ効率的継続学習

Parameter Efficient Continual Learning for Sparse Event-Based Transformers

シェア:XThreadsFacebookLINEはてブBluesky

スパースイベントベースの視覚変換器(スパイキング変換器)向けに、バックボーンを凍結し、低ランク注意更新と共有ニューロン閾値変調のみを学習することで、リプレイバッファなしでクラス増分学習とオンライン継続学習を実現するパラメータ効率的な継続学習フレームワークを提案した。

詳しい要約

1. どんなもの?

本論文は、スパースなイベントベース(スパイキング)Vision Transformer(ViT)向けのパラメータ効率的な継続学習フレームワーク「sLoTh」を提案する。ロボットやエッジAIシステムは動的環境でデータが連続的に到着し、厳しいメモリ・エネルギー制約下でモデル適応と知識保持が求められる。sLoThは、事前学習済みのスパイキングViTのバックボーンを凍結し、スケーラブルで効率的な低ランクアテンション更新(seLoRA)と共有ニューロン閾値変調のみを学習することで、リプレイバッファなしで適応を実現する。更新パラメータは全体の1%未満であり、CIFAR-100、Tiny-ImageNet、ImageNet-100、ImageNet-Rを用いた最大100タスクの実験で、クラス増分学習とオンライン継続学習において競争力のあるリプレイフリー性能を示し、従来の高密度ViTと比較して約6.5倍のエネルギー消費削減を達成する。

2. 先行研究と比べてどこがすごい?

従来のパラメータ効率的ファインチューニング(PEFT)はVision Transformerの継続学習に有望だが、高密度計算に依存し実環境展開にはコストが高い。一方、スパースなイベントベースViTはエネルギー効率の良いイベント駆動計算を提供するが、その継続学習能力は未探索だった。本手法は、スパイキングViTに特化したPEFTフレームワークを初めて導入し、低ランクアテンション更新と閾値変調を組み合わせることで、リプレイバッファなしで1%未満のパラメータ更新のみで高い性能を達成し、エネルギー消費を大幅に削減する点が新しい。

3. 技術・手法の肝は?

手法の核は、(1) 事前学習済みスパイキングViTのバックボーンを完全に凍結し、学習可能なパラメータをseLoRA(スケーラブルで効率的な低ランクアテンション更新)と共有ニューロン閾値変調に限定すること。(2) seLoRAはアテンション機構の低ランク更新を効率的に実装し、タスク適応を可能にする。(3) 共有閾値変調はスパイキングニューロンの発火閾値を調整し、タスク間の知識干渉を抑える。(4) リプレイバッファを使用せず、オンライン継続学習とクラス増分学習の両方に対応する。

4. どうやって有効だと検証した?

CIFAR-100、Tiny-ImageNet、ImageNet-100、ImageNet-Rの4つのベンチマークで、最大100タスクのクラス増分学習とオンライン継続学習を評価した。比較対象として、従来の高密度ViTや他のPEFT手法を用い、リプレイフリー設定で競争力のある精度を達成した。さらに、エネルギー消費を測定し、従来の高密度ViTと比較して約6.5倍の削減を確認した。

5. 議論はある?

要旨からは、リプレイフリーであるがゆえの限界(例えば、タスク数が極端に多い場合の忘却)や、スパイキングViT特有のハードウェア要件、seLoRAの低ランク設定の影響などについての詳細な議論は不明。また、他のPEFT手法との比較は要旨に明記されていないが、性能とエネルギー効率のトレードオフに関する議論が考えられる。

6. 次に読むべき論文は?

要旨で参照されている関連研究として、パラメータ効率的ファインチューニング(PEFT)を用いた継続学習の既存研究、スパイキングニューラルネットワーク(SNN)を用いたVision Transformer、および低ランク適応(LoRA)に関する論文が挙げられる。具体的には、LoRA(Low-Rank Adaptation)や、スパイキングViTのアーキテクチャに関する論文を次に読むことが推奨される。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Vaishnavi Nagabhushana, Kartikay Agrawal, Ayon Borthakur

分類: cs.CV

原文アブストラクト

Robotic and edge intelligence systems operate in dynamic environments where data arrives continuously, requiring models to adapt while preserving previously learned knowledge under strict memory and energy constraints. While parameter-efficient fine-tuning has shown promise for continual learning with vision transformers, conventional architectures rely on dense computation and remain costly for real-world deployment. Sparse event-based vision transformers provide energy-efficient event-driven computation, yet their continual learning capabilities remain largely unexplored. We here introduce sLoTh, a parameter-efficient continual learning framework for pretrained sparse event-based (spiking) vision transformers. sLoTh freezes the backbone and restricts plasticity to scalable-efficient low-rank attention updates (seLoRA) and shared neuronal threshold modulation, enabling adaptation without replay buffers by updating less than 1% of model parameters. Experiments across CIFAR-100, Tiny-ImageNet, ImageNet-100, and ImageNet-R with up to 100 tasks demonstrate competitive rehearsal-free performance in class-incremental learning and online continual learning, while enabling approximately 6.5x lower energy consumption than conventional dense vision transformers.

関連論文