MATH · IN · MODELS

Speech SSL features linearly recover universal articulatory kinematics

measured in 1 paper

Cho et al. linearly project frozen features from HuBERT-Large, wav2vec2-Large, XLS-R (300M) and MMS (1B) onto electromagnetic-articulography ground truth across 62 speakers and 5 corpora (English, Mandarin, Italian) [cho-etal-2023-self-supervised-models-of-speech-infer-universal-articulatory-kinematics] Average correlation exceeds 0.8 regardless of the SSL model training language (English 0.835, XLS-R 0.830, MMS 0.832), far above a raw-acoustic baseline (0.66) [cho-etal-2023-self-supervised-models-of-speech-infer-universal-articulatory-kinematics] 44% of speakers exceed 0.85 correlation [cho-etal-2023-self-supervised-models-of-speech-infer-universal-articulatory-kinematics] Individual speakers separately-fit linear inversion systems are mutually alignable by affine transformations at near/above-0.85 correlation, evidencing a shared canonical articulatory subspace across speakers, genders and languages [cho-etal-2023-self-supervised-models-of-speech-infer-universal-articulatory-kinematics]

Context

articulatory-kinematics, speech-representation

Papers

Self-Supervised Models of Speech Infer Universal Articulatory Kinematics — Cho, Cheol Jun, Mohamed, Abdelrahman, Black, Alan W., Anumanchipalli, Gopala K.2023 · arXiv:2310.10788