methods / Direction Extraction / Language Activation Probability Entropy (LAPE)
Language Activation Probability Entropy (LAPE)
Selects a sparse subset of units — raw neurons or SAE latent features — as language-associated by computing, for each unit, the entropy of its per-language activation-probability distribution and keeping only low-entropy (single-language-dominant) units.