MATH · IN · MODELS
methods / Causal Validation / Causal Tracing

Causal Tracing

Techniqueintermediate

Corrupts a subject's token embeddings with Gaussian noise, then restores one clean hidden state at a time during the corrupted run, measuring how much each individual state's restoration recovers the original prediction — a noising-and-selective-restoration variant of activation patching, used to localize which layer and token position causally mediates a specific factual prediction.

Used in (3 observations)

structure: Linear Direction · models: GPT-J-6B, GPT-2 XL · paper: Does Localization Inform Editing? Surprising Differences in Causality-Based Localization vs. Knowledge Editing in Language Models
structure: Linear Direction · models: GPT-J-6B, GPT-NeoX-20B · paper: Mass-Editing Memory in a Transformer
structure: Linear Direction · models: GPT-2 XL, GPT-J-6B · paper: Locating and Editing Factual Associations in GPT