MATH · IN · MODELS

Saponati et al. (2025) Custom Encoder/Decoder Transformers

Research (Saponati, Sager, Vilimelis Aceituno, Stadelmann & Grewe; trained from scratch, arXiv:2502.10927)

By model (2)

Custom Transformer encoder (12-layer, trained from scratch)
Custom Transformer encoder (4-layer, trained from scratch)

Papers

The Underlying Structures of Self-Attention: Symmetry, Directionality, and Emergent Dynamics in Transformer Training (2025)