¡Conceptos básicos que todo científico de datos novato debe conocer!
Cuando tratamos con datos, sin importar el volumen, cuanto mejor esté mapeado, más fácil será para nosotros manejarlo. En ciencia de datos existe un término llamado Estimaciones de ubicación. Como sugiere el nombre, podemos mapear distintos datos de acuerdo con sus valores en relación con el resto. Una estimación de ubicación común en las estadísticas diarias sería el valor promedio de una agregación. El valor promedio se erige como un punto en algún lugar en el medio del resto de nuestros datos. Teniendo esto en cuenta, veamos los EoL más importantes con los que todo científico de datos debería estar familiarizado.
Significar
El EoL más básico en esta lista será el valor medio. La media es la suma de todos nuestros datos dividida por el número total de nuestros datos. La media podría referirse al valor promedio de un conjunto de datos.
Media ponderada
Como probablemente sea obvio, la media ponderada es simplemente un valor promedio ponderado. Esto significa que la media ponderada es el valor medio pero más influenciado por algunos datos determinados. Hay dos razones principales para esta discriminación. El primer motivo es la representación desigual de los colectivos que nos interesan debido a los datos recogidos. Una mayor ponderación en los grupos infrarrepresentados sería una solución. La segunda razón es que, en muchos escenarios realistas de recopilación de datos, podría haber desviaciones en nuestros datos debido a mediciones defectuosas. Esto también podría resolverse aplicando un peso menor a estos datos. La media ponderada es el producto de todos los datos multiplicados (cada uno) por un peso y luego su suma dividida por la suma de los pesos que aplicamos.
Mediana
El valor mediano podría considerarse como el valor medio de un conjunto de datos. Se refiere al punto que separa el conjunto en una mitad superior y una mitad inferior. Personalmente, creo que cuanto más discutamos la mediana como concepto, más complicado podría volverse de entender. Entonces, en el cálculo de la mediana en un conjunto de datos. Primero ordenamos los datos en orden ascendente. Si hay un número impar de datos, entonces el valor de la mediana es el que está en el medio del conjunto. Si el número de datos es par, entonces el valor de la mediana es igual a la suma de los dos valores que separan el conjunto en mitades superior e inferior, dividida por dos.
valores atípicos
Consideramos algunos valores como atípicos cuando están bastante distantes del resto de los datos. Esto es bastante normal y se puede encontrar en casi todos los escenarios y experimentos de estadísticas de la vida real. En la práctica, se pueden encontrar valores atípicos incluso en un conjunto de datos en el que los datos se han creado específicamente para que sus datos se generen de manera uniforme. Esto es el resultado de un estricto filtrado de datos. Cuando elegimos etiquetar nuestros valores atípicos, cuanto más estrictas sean nuestras reglas, más valores atípicos encontraremos.
MAD (desviación media absoluta)
Aunque técnicamente MAD no es parte de la familia EoL, la desviación absoluta media es una "herramienta" muy útil que puede ayudarnos a identificar y etiquetar otros valores. Simplemente, es el valor promedio de la distancia de cada punto de datos desde la media. Por ejemplo, MAD se puede usar para identificar valores atípicos en un conjunto de datos. Podríamos decir que, si la distancia entre un punto de datos y el valor medio es mayor que la MAD, entonces este punto de datos es un valor atípico.
Estos son solo una fracción de los conceptos que usamos en la ciencia de datos, pero seguramente son algunos de los más notables con los que todo novato en ciencia de datos debería estar familiarizado. Otros conceptos famosos y útiles son: media recortada, robusta, desviación estándar, rango intercuartílico y muchos más. Si está interesado en aprender más sobre ciencia de datos, le sugiero que eche un vistazo al libro Estadísticas prácticas para científicos de datos: 50 conceptos esenciales de Peter Bruce, Andrew Bruce y Peter Gedeck (las fórmulas de este artículo se tomaron de este libro).

![¿Qué es una lista vinculada, de todos modos? [Parte 1]](https://post.nghiatu.com/assets/images/m/max/724/1*Xokk6XOjWyIGCBujkJsCzQ.jpeg)



































