structure: Linear Separability, Anisotropy · models: BERT-base-uncased, ALBERT-base-v1, DistilBERT-base-uncased, RoBERTa-base, GPT-2 Small, Pythia-70M, Pythia-160M, Pythia-410M · paper: Outlier Dimensions Encode Task-Specific Knowledge
structure: Anisotropy · models: BERT-base-cased, RoBERTa-base, GPT-2-small, XLNet-base-cased, word2vec (Google News, 300d) · paper: All Bark and No Bite: Rogue Dimensions in Transformer Language Models Obscure Representational Quality
structure: Anisotropy · models: all-MiniLM-L6-v2, all-MiniLM-L12-v2, all-mpnet-base-v2, paraphrase-mpnet-base-v2, BGE-base-en-v1.5, BGE-large-en-v1.5, E5-large-v2, multilingual-e5-large, e5-mistral-7b-instruct, SFR-Embedding-Mistral, BERT-base-uncased, RoBERTa-base, ELECTRA-base, mBERT (BERT-base, Multilingual Cased), GPT-2-small, Pythia-410M, Qwen2.5-1.5B, Qwen2.5-7B, Mistral-7B · paper: Anisotropy Decides Cosine vs. Rank Metrics for Text Embeddings