CLIP/SigLIP covariance splits into signal and shared-noise subspaces
measured in 1 paper- The embedding covariance eigenspectrum of six CLIP/SigLIP models shows a sharp elbow (threshold ~10^-3.6) separating a semantic signal subspace from a shared noise subspace. [grzywaczewski-etal-2026-clip-covariance-eigenspectrum-noise] - The noise subspace's dimensionality is quantified per model (CLIP ViT-L/14 164/768 = 21%; SigLIP2 ViT-L/16 405/1024 = 40%) and is shared across unrelated classes (>50% overlap, >90% for the largest models). [grzywaczewski-etal-2026-clip-covariance-eigenspectrum-noise] - Projecting the noise subspace away leaves ImageNet zero-shot accuracy essentially unchanged (CLIP ViT-L/14 91.2% to 91.1%) while removing the same number of random directions degrades it (to 89.3%); text-image cosine similarity even improves. [grzywaczewski-etal-2026-clip-covariance-eigenspectrum-noise] - Tested on CLIP ViT-B/16, ViT-B/32, ViT-L/14, SigLIP ViT-B/16, SigLIP2 ViT-B/16 and ViT-L/16. [grzywaczewski-etal-2026-clip-covariance-eigenspectrum-noise]