Five shared SAE directions mitigate structurally distinct backdoors
measured in 1 paperMahmoud et al. train SAEs on six real backdoored LLMs and use model diffing to find five SAE features shared across six distinct backdoor types [mahmoud-etal-2026-shared-latent-structures-enable-unified-backdoor-detection-and-mitigation-in-llms] Steering along each feature's decoder direction mitigates attack success: F33881 gives 96% on Sentiment-LoRA, 79% on country-conditioned advice, and 44% zero-shot on a held-out Refusal backdoor [mahmoud-etal-2026-shared-latent-structures-enable-unified-backdoor-detection-and-mitigation-in-llms] F25828 gives 100% zero-shot mitigation on the held-out Refusal backdoor [mahmoud-etal-2026-shared-latent-structures-enable-unified-backdoor-detection-and-mitigation-in-llms] A companion training-time method, Concept Ablation Fine-Tuning, ablates the same shared subspace during training [mahmoud-etal-2026-shared-latent-structures-enable-unified-backdoor-detection-and-mitigation-in-llms]