MATH · IN · MODELS

An 'Assistant Axis' persona component causally reduces jailbreaks

measured in 1 paper

Lu et al. extract activation vectors for 275 character archetypes across Gemma-2-27B, Qwen3-32B and Llama-3.3-70B and run PCA on the persona space (4-19 PCs explain 70% of variance) [lu-etal-2026-the-assistant-axis-situating-and-stabilizing-the-default-persona-of-language-models] PC1 is an interpretable "Assistant Axis" whose role loadings correlate >0.92 pairwise across the three models [lu-etal-2026-the-assistant-axis-situating-and-stabilizing-the-default-persona-of-language-models] A contrast-based Assistant Axis (mean role-playing minus default-Assistant) aligns with PC1 at cosine >0.71 in all three models [lu-etal-2026-the-assistant-axis-situating-and-stabilizing-the-default-persona-of-language-models] Activation-capping the Assistant-Axis projection cuts persona-jailbreak harmful-response rate ~60% with no measurable loss on IFEval/MMLU-Pro/GSM8k/EQ-Bench [lu-etal-2026-the-assistant-axis-situating-and-stabilizing-the-default-persona-of-language-models] The axis persists in base (non-instruction-tuned) Gemma-2-27B, evidencing a pretraining origin [lu-etal-2026-the-assistant-axis-situating-and-stabilizing-the-default-persona-of-language-models]

Context

persona, jailbreak-robustness

Papers

The Assistant Axis: Situating and Stabilizing the Default Persona of Language Models — Lu, Xinran, Gallagher, Ryan, Michala, Adam, Fish, Sarah, Lindsey, Jack2026 · arXiv:2601.10387