Media, mediana, moda, y qué tan dispersos están los datos respecto al promedio.
Σx = suma de todos los datos · n = cantidad de datos
Notas de un examen: 4, 7, 2, 7, 9, 3, 7. Calcula media, mediana y moda.
(4+7+2+7+9+3+7)/7 = 39/7 ≈ 5.57
2,3,4,7,7,7,9 → el del medio (posición 4 de 7) es 7
7 aparece 3 veces — más que cualquier otro valor
La desviación estándar mide, en promedio, qué tan lejos está cada dato del promedio general. Una desviación chica significa datos agrupados cerca de la media; una desviación grande significa datos muy dispersos.
Dos grupos de notas tienen la misma media (7), pero: Grupo A: 7,7,7,7,7. Grupo B: 2,5,7,9,12. ¿Cuál tiene más dispersión?
Grupo A: σ=0 (todos los valores son idénticos a la media, no hay dispersión)
Grupo B: tiene una desviación estándar bastante mayor a 0, porque los valores están mucho más repartidos alrededor de la media
La media sola no cuenta toda la historia — dos grupos con la misma media pueden ser completamente distintos en qué tan parejos son los datos.
Sí — si dos o más valores se repiten la misma cantidad de veces (siendo la más alta), el conjunto es "bimodal" (dos modas) o "multimodal" (varias). También puede no tener moda si todos los valores aparecen la misma cantidad de veces.
Cuando hay valores extremos que distorsionarían el promedio — por ejemplo, para hablar de "salario típico" en un país, la mediana da una imagen más realista que la media, que un puñado de sueldos muy altos puede inflar artificialmente.
La varianza es el cuadrado de la desviación estándar (antes de sacar la raíz) — se usa la desviación estándar más seguido porque queda en las mismas unidades que los datos originales, mientras que la varianza queda en unidades al cuadrado.