Causal attention without positions creates adjacency decay
measured in 1 paper- In causal-attention transformers with no positional encodings, the self-cosine-similarity matrix shows a distance-decaying adjacency pattern: nearby positions are more similar than distant ones. [zuo-etal-2025-position-information-emerges-causal-transformers-similarity-nearby-embeddings] - An adjacency-probability score jumps from ~0.48-0.58 at the raw token-embedding layer to 0.80-0.99 after the first causal-attention layer, and appears even in randomly initialized models. [zuo-etal-2025-position-information-emerges-causal-transformers-similarity-nearby-embeddings] - The pattern is absent under non-causal attention (~0.5) and follows from causal prefix-averaging plus the near-orthogonality of high-dimensional embeddings. [zuo-etal-2025-position-information-emerges-causal-transformers-similarity-nearby-embeddings] - Trained NanoGPT models (6/12/24 layers, hidden 192/384/768) on four synthetic position-sensitive tasks; no pretrained LLMs. [zuo-etal-2025-position-information-emerges-causal-transformers-similarity-nearby-embeddings]