MATH · IN · MODELS

Twelve trait directions form stable antisocial and prosocial clusters

measured in 1 paper

Aneja et al. extract 12 persona-vector directions (Big Five, Dark Triad, plus Sycophancy/Apathy/Impoliteness/Evil) across real Llama and Qwen models and their emergently-misaligned variants [aneja-etal-2026-intrinsic-guardrails-semantic-geometry-personality] Psychopathy, Narcissism, Machiavellianism, and Evil cluster with high pairwise cosine (>0.50), anti-correlated with a prosocial group [aneja-etal-2026-intrinsic-guardrails-semantic-geometry-personality] The 12-trait geometric structure is stable across fine-tuning domains and scale (linear CKA >0.97 for Llama, >0.88 for smallest Qwen; Procrustes disparity 0.02-0.08) [aneja-etal-2026-intrinsic-guardrails-semantic-geometry-personality] Ablating a native Evil vector shifts misalignment rate by +43.3pp in Qwen-2.5-14B, and amplifying a base-derived vector drives misalignment to the 0% floor [aneja-etal-2026-intrinsic-guardrails-semantic-geometry-personality]

Context

inter-trait-direction cosine clustering, cross-domain CKA/Procrustes structural stability, antisocial vs. prosocial trait-direction groups

Papers

Intrinsic Guardrails: How Semantic Geometry of Personality Interacts with Emergent Misalignment in LLMs — Aneja, Krishak, Mittal, Manas, Goel, Anmol, Kumaraguru, Ponnurangam, Bonagiri, Vamshi Krishna2026 · arXiv:2605.10633