何が起きたか

arxiv.orgは2026-09-16、REACT: A Fully Spiking State-Space Model for Real-Time Event-Driven Temporal Perception を公開した。REACTは、イベントを時間ビンにまとめず1件ずつ処理する完全スパイキング型の状態空間モデルで、イベントカメラの非同期ストリームを扱う。論文では、ジェスチャー認識とTTC推定で評価し、EvTTC上で4.6msのエンドツーエンド推論遅延と9.59%の相対TTC誤差を示した。

詳細

REACTは、複素値スパイキングニューロン C-SiLIF を用い、その連続時間ダイナミクスを物理的なイベント間隔に従って変化させる設計である。これにより、内部状態を個々のイベントの時間分解能で更新する。論文は、全視野イベントストリームからのTTC推定で、ターゲットのバウンディングボックスやローカライゼーション入力を使わずに評価している。 EvTTCでは、REACTの4.6msという推論遅延は、データセット平均の接近速度において車両が約4cm移動する時間に相当するとしている。これに対し、最速の競合学習法では約1mに相当すると記載されている。さらに、REACTは任意時点でのTTC予測、別の走行シーケンスへのゼロショット転移、INT8量子化に対応し、32,768イベント当たりの推定エネルギーを18.5mJから2.8mJへ下げた。

Key Facts

REACTは、イベントをフレームや時間ビンに集約せず、1件ずつ処理する完全スパイキング型状態空間モデルである。[1]
論文は2026-09-16に arxiv.org で公開された。[1]
EvTTCで9.59%の相対TTC誤差と4.6msのエンドツーエンド推論遅延を示した。[1]
ターゲットのバウンディングボックスやローカライゼーション入力を使わずに評価した。[1]
INT8量子化により、32,768イベント当たりの推定エネルギーは18.5mJから2.8mJになった。[1]

本紙の見方

REACTの新しさは、イベントカメラの出力を「あとでまとめて読む」のではなく、個々のイベントの到来間隔に合わせて内部状態を更新する点にある。ここで主役なのは精度そのものより、4.6msの遅延、9.59%のTTC誤差、32,768イベント当たり18.5mJ→2.8mJという三つの指標が同時に示されたことだとみられる。つまり、知覚モデルを高精度化するだけでなく、反応の締切と電力の制約の中で使える形に寄せた構成である。 本紙の観点では、これは「イベントベース認識」一般の話ではなく、TTC推定という反応系タスクに対して、バウンディングボックスやローカライゼーション入力を不要にした点が重要である。対象を先に切り出してから推定する流れを外し、全視野ストリームから直接、時間余裕を読む設計にしているため、前段の検出器や追跡器に依存する構造を減らす方向と読める。これは、センサー入力→時系列表現→危険度推定という連鎖を短くする試みであり、計算遅延がそのまま車両の移動距離に変換される領域では意味が大きい。 また、INT8量子化への対応は、研究室の精度比較にとどまらず、実装段階での計算資源を意識していることを示す。C-SiLIFのような複素値スパイキングニューロンと状態空間モデルの組み合わせは、時系列を連続時間で扱う一方で、実機側では量子化可能な表現に落とす余地を残している。ただし、論文段階では汎用性の範囲はまだ限定的で、ジェスチャー認識とEvTTC以外の条件で同じ遅延・省電力特性が出るかは未検証である。次に確認すべきなのは、異なるイベントカメラ条件、異なる走行シーケンス、より厳しい実時間制約下での再現性である。

なぜ重要か

REACTは、イベントカメラの低遅延性を生かしつつ、TTC推定を4.6msで返す設計を示した点で、反応遅れが直接リスクになるロボティクス用途に関係する。論文が示したINT8量子化と18.5mJから2.8mJへの低減は、性能だけでなく実装電力も評価軸に入れる必要があることを示している。

日本への影響

イベントカメラを使う移動体・ロボティクスでは、検出器や追跡器を前提にした構成より、REACTのような逐次処理型の時系列モデルが適する場面があるとみられる。日本企業や研究機関がこの領域で競う場合、画像認識の精度だけでなく、遅延4.6msやINT8量子化のような実装条件を満たすかが比較軸になる。