A model's self-report tracks a steerable emotive-state direction
measured in 1 paperMartorell & Bianchi train four contrastive mean-difference concept directions (wellbeing, interest, focus, impulsivity) per layer across five instruct LLMs [martorell-bianchi-2026-quantitative-introspection-in-language-models-tracking-emotive-states-across-conversation] Best-layer separation reaches Cohen's d of 1.67-3.60 (all p<1e-5) [martorell-bianchi-2026-quantitative-introspection-in-language-models-tracking-emotive-states-across-conversation] The model's own logit-based numeric self-report tracks the probe-defined internal state (Spearman rho 0.40-0.76; isotonic R^2 up to 0.93 in Llama-3.1-8B-Instruct) [martorell-bianchi-2026-quantitative-introspection-in-language-models-tracking-emotive-states-across-conversation] Activation steering along the concept direction causally shifts self-reports, and cross-concept steering can improve introspective fidelity for a different concept by up to delta R^2 = 0.30 [martorell-bianchi-2026-quantitative-introspection-in-language-models-tracking-emotive-states-across-conversation]