SAE decoder cosine reveals feature splitting in dense embeddings and steers search
measured in 1 paperO'Neill et al. train TopK SAEs directly on OpenAI text-embedding-3-small embeddings of 420,000+ scientific abstracts, one of the first SAE applications to dense embeddings rather than LLM activations [oneill-etal-2024-disentangling-dense-embeddings-sparse-autoencoders] A decoder-direction cosine-similarity matrix between different-sized SAEs shows larger SAEs split a smaller SAE's feature direction, with over 1,100 triplets recurring at cosine >0.95 [oneill-etal-2024-disentangling-dense-embeddings-sparse-autoencoders] Steering semantic search is proven algebraically equivalent to adding a scaled decoder feature vector to the output embedding [oneill-etal-2024-disentangling-dense-embeddings-sparse-autoencoders] Down-weighting one feature and up-weighting an orthogonal one achieves ~20% higher accuracy than query rewriting at a target cosine similarity of 0.75 [oneill-etal-2024-disentangling-dense-embeddings-sparse-autoencoders]