A protein-LM nativeness axis orders sequences; viral signal stays separable
measured in 1 paperBigot et al. run PCA on mean-pooled embeddings from five protein language models (ESM2, ESM3, ESMC, ProGen2, EvoDiff), finding a dominant nativeness axis (PC1, 54.3-73.1% variance) correlating with masked-reconstruction perplexity (rho=0.83-0.96) [bigot-etal-2026-viral-proteins-reveal-geometry-of-protein-language-models] The axis replicates within each of 10 biological groups via within-group PCA refits [bigot-etal-2026-viral-proteins-reveal-geometry-of-protein-language-models] Linear probes classify viral versus cellular proteins at AUC 0.97-1.00 even under homology-controlled splits, with 88.3-96.7% true-positive rate at 1% false-positive rate versus 26.9-39.2% for a perplexity-only classifier [bigot-etal-2026-viral-proteins-reveal-geometry-of-protein-language-models]