Definición
Número de formas léxicas distintas observadas en una muestra definida de habla o texto bajo un procedimiento de preprocesamiento y muestreo explícito (por ejemplo: tokenización, normalización de mayúsculas/minúsculas, lematización y longitud de muestra).