MATH · IN · MODELS

A single SAE toxic-persona latent controls emergent misalignment in GPT-4o and o3-mini

measured in 1 paper

Wang et al. (OpenAI) train a sparse autoencoder on GPT-4o's middle-layer pretraining activations and screen 2.1 million latents to 10 causally-relevant ones via aligned/misaligned model-diffing [wang-etal-2026-persona-features-control-emergent-misalignment] Latent #10, a "toxic persona" direction, perfectly discriminates aligned from misaligned finetuned models [wang-etal-2026-persona-features-control-emergent-misalignment] Steering positively along it induces misalignment in the safety-trained GPT-4o; steering negatively suppresses misalignment in finetuned models and in a helpful-only o3-mini variant [wang-etal-2026-persona-features-control-emergent-misalignment] The toxic-persona activation is elevated at just 5% malicious training data, well before behavioral misalignment appears, and re-alignment via 120 benign samples reduces misalignment to 0.1-0.5% [wang-etal-2026-persona-features-control-emergent-misalignment]

Context

a single SAE latent direction discovered via model-diffing between aligned/misaligned checkpoints, functioning as a persona-level causal control knob, bidirectional steering (induce/suppress) along one direction across two different models (GPT-4o, o3-mini)

Confirmed in models

Papers

Persona Features Control Emergent Misalignment — Wang, Miles, Dupré la Tour, Tom, Watkins, Olivia, Makelov, Alex, Chi, Ryan A., Miserendino, Samuel, Wang, Jeffrey, Rajaram, Achyuta, Heidecke, Johannes, Patwardhan, Tejal, Mossing, Dan2026 · arXiv:2506.19823