Speech SSL features linearly recover universal articulatory kinematics
measured in 1 paperCho et al. linearly project frozen features from HuBERT-Large, wav2vec2-Large, XLS-R (300M) and MMS (1B) onto electromagnetic-articulography ground truth across 62 speakers and 5 corpora (English, Mandarin, Italian) [cho-etal-2023-self-supervised-models-of-speech-infer-universal-articulatory-kinematics] Average correlation exceeds 0.8 regardless of the SSL model training language (English 0.835, XLS-R 0.830, MMS 0.832), far above a raw-acoustic baseline (0.66) [cho-etal-2023-self-supervised-models-of-speech-infer-universal-articulatory-kinematics] 44% of speakers exceed 0.85 correlation [cho-etal-2023-self-supervised-models-of-speech-infer-universal-articulatory-kinematics] Individual speakers separately-fit linear inversion systems are mutually alignable by affine transformations at near/above-0.85 correlation, evidencing a shared canonical articulatory subspace across speakers, genders and languages [cho-etal-2023-self-supervised-models-of-speech-infer-universal-articulatory-kinematics]