MATH · IN · MODELS

Fewer than 25 register neurons with consistent directions cause ViT outlier tokens

measured in 1 paper

Jiang et al. identify fewer than 10 register neurons in OpenCLIP ViT-B/16 and fewer than 25 in DINOv2-L/14 by ranking neurons on mean activation at outlier-token positions [jiang-etal-2025-vits-dont-need-trained-registers] These neurons' decoder weights consistently peak in specific ambient dimensions across images, a directional claim beyond activation magnitude [jiang-etal-2025-vits-dont-need-trained-registers] Training-free test-time registers built from the discovered directions match trained-register models on object discovery and improve zero-shot segmentation [jiang-etal-2025-vits-dont-need-trained-registers] Register-neuron ablation cuts typographic-attack success on LLaVA-Llama-3-8B from 50.5% to 7.5%, while naive zeroing crashes ImageNet accuracy 71.3% to 55.6% [jiang-etal-2025-vits-dont-need-trained-registers]

Context

register neurons, test-time registers, typographic-attack mitigation

Papers

Vision Transformers Don't Need Trained Registers — Jiang, Nick, Dravid, Amil, Efros, Alexei, Gandelsman, Yossi2025 · arXiv:2506.08010