methods / Causal Validation / Causal interventions (steering) / Representation-alignment loss regularization
Representation-alignment loss regularization
A training-time (not inference-time) causal intervention: an auxiliary cosine-similarity loss term, added alongside the standard training objective, explicitly pulls a model's own intermediate representations toward a target geometric reference (e.g. a frozen foundation model's features) during training, and the resulting change in downstream behavior is measured after training completes.