Normalidad: Shapiro-Wilk y Kolmogorov-Smirnov

Normalidad en estadística: Shapiro-Wilk, Kolmogorov-Smirnov y cuándo importa

Contenido elaborado por el equipo DataMedix.
Revisión metodológica: Lucas Vargas, médico epidemiólogo.

Normalidad: Shapiro-Wilk y Kolmogorov-Smirnov

Una práctica frecuente en tesis médicas es aplicar Shapiro-Wilk o Kolmogorov-Smirnov a todas las variables y decidir:

  • p > 0,05: prueba paramétrica;
  • p < 0,05: prueba no paramétrica.

Esta regla es demasiado simple.

La normalidad debe evaluarse en relación con:

  • el análisis que se realizará;
  • los residuos del modelo;
  • las diferencias entre mediciones;
  • el tamaño de la muestra;
  • los valores extremos;
  • la simetría;
  • la robustez del método.

¿Qué es una distribución normal?

Es una distribución continua, simétrica y con forma de campana.

En una normal ideal:

  • media, mediana y moda coinciden;
  • la mayoría de los valores se concentra cerca del centro;
  • la frecuencia disminuye hacia los extremos;
  • la dispersión se describe mediante la desviación estándar.

Muchas variables biomédicas no son normales en su forma original.

Ejemplos frecuentes de asimetría:

  • estancia hospitalaria;
  • costos;
  • concentraciones de biomarcadores;
  • tiempos de espera;
  • número de crisis;
  • títulos de anticuerpos.

Esto no significa automáticamente que deban analizarse con pruebas no paramétricas.

¿Qué debe ser normal?

Depende del método.

t para grupos independientes

La suposición se relaciona con la distribución dentro de los grupos o con los errores del modelo.

t pareada

Lo importante es la distribución de las diferencias entre las dos mediciones.

Regresión lineal

La normalidad se refiere principalmente a los residuos para determinados procedimientos inferenciales, no a que todos los predictores sean normales.

ANOVA

Se evalúan los residuos dentro de la estructura del modelo.

Por tanto, no existe una exigencia general de que todas las columnas de una base sean normales.

Shapiro-Wilk

Shapiro-Wilk evalúa la hipótesis nula de que una muestra procede de una distribución normal.

Su estadístico se representa mediante W.

  • W cercano a 1: mayor compatibilidad con normalidad.
  • Valores menores: mayor desviación.
  • p pequeño: evidencia contra la hipótesis de normalidad.

Fue propuesto originalmente en 1965 y ha mostrado buen desempeño frente a otras pruebas de normalidad.

Kolmogorov-Smirnov

Kolmogorov-Smirnov compara la distribución empírica observada con una distribución teórica.

Puede utilizarse para evaluar ajuste a diferentes distribuciones, no solamente la normal.

Una precaución importante es que su versión clásica supone que los parámetros de la distribución teórica están especificados. Cuando la media y la desviación estándar se estiman de la misma muestra, deben utilizarse correcciones o procedimientos adaptados.

NIST presenta Kolmogorov-Smirnov como una prueba general de bondad de ajuste y distingue su uso de pruebas específicas como Shapiro-Wilk.

¿Cuál es mejor para normalidad?

Para evaluar normalidad, Shapiro-Wilk suele tener mejor sensibilidad que Kolmogorov-Smirnov en muchos escenarios.

Sin embargo, ninguna prueba debe ser la única decisión.

El resultado depende de:

  • tamaño muestral;
  • tipo de desviación;
  • valores extremos;
  • redondeo;
  • datos repetidos;
  • distribución verdadera.

El problema del tamaño de muestra

Muestras pequeñas

La prueba puede tener poca capacidad para detectar desviaciones.

Un p > 0,05 no demuestra que la distribución sea normal.

Muestras grandes

Pequeñas desviaciones sin importancia práctica pueden producir valores p muy pequeños.

Por eso, la evaluación cuantitativa debe acompañarse de análisis gráfico y de una valoración de cuánto afecta la desviación al método elegido.

Herramientas gráficas

Histograma

Permite observar:

  • asimetría;
  • multimodalidad;
  • colas;
  • valores extremos.

Gráfico Q-Q

Compara los cuantiles observados con los esperados bajo normalidad.

Puntos cercanos a la línea sugieren compatibilidad.

Desviaciones sistemáticas pueden mostrar:

  • asimetría;
  • colas largas;
  • colas cortas;
  • valores extremos.

Diagrama de caja

Ayuda a visualizar mediana, dispersión y posibles valores extremos.

NIST incluye los gráficos de probabilidad y Q-Q entre las herramientas principales para explorar supuestos distribucionales.

¿Qué hacer si los datos no son normales?

No existe una respuesta única.

Puede considerarse:

Mantener el método paramétrico

Algunas pruebas son relativamente robustas ante desviaciones moderadas, especialmente con muestras suficientes y grupos equilibrados.

Transformar la variable

Por ejemplo:

  • logaritmo;
  • raíz cuadrada;
  • transformaciones Box-Cox.

La interpretación debe realizarse en la escala transformada o retransformed con cuidado.

Utilizar métodos no paramétricos

Cuando la pregunta y la estructura de los datos lo justifiquen.

Usar métodos robustos

Como errores estándar robustos, regresión cuantílica o procedimientos bootstrap, según el objetivo.

Cambiar la distribución del modelo

Para conteos, proporciones o tiempos puede ser más apropiado utilizar un modelo diseñado para ese tipo de desenlace.

Errores frecuentes

Aplicar pruebas de normalidad a variables categóricas

No tiene sentido evaluar normalidad de sexo, diagnóstico o presencia de enfermedad.

Aplicar Shapiro-Wilk a toda la base

Solo debe utilizarse cuando la distribución es relevante para el análisis.

Interpretar p > 0,05 como prueba de normalidad

Significa que no se encontró suficiente evidencia para rechazarla.

Elegir Mann-Whitney automáticamente

Debe valorarse qué parámetro o característica se desea comparar.

Ignorar valores extremos

Un solo valor puede afectar la media, la desviación y el resultado de la prueba.

Evaluar las variables y no los residuos

En regresión o ANOVA, la evaluación debe corresponder al modelo.

Confundir normalidad con igualdad de varianzas

Son supuestos diferentes.

Cómo reportarlo

La distribución de la variable se evaluó mediante histogramas y gráficos Q-Q. Se aplicó Shapiro-Wilk como evaluación complementaria. Debido a la asimetría y a la presencia de valores extremos, los datos se resumieron mediante mediana y rango intercuartílico.

Evita:

Se hizo Shapiro-Wilk y, como p fue menor de 0,05, se utilizaron pruebas no paramétricas.

La segunda redacción no explica:

  • qué variable;
  • qué forma presentó;
  • qué valores extremos existieron;
  • por qué la prueba elegida respondía al objetivo.

Checklist

  • ¿La normalidad es realmente un supuesto del método?
  • ¿Debo revisar datos originales, diferencias o residuos?
  • ¿Utilicé gráficos?
  • ¿Existen valores extremos?
  • ¿Los grupos tienen tamaños similares?
  • ¿La desviación es leve o grave?
  • ¿La variable puede transformarse?
  • ¿La prueba paramétrica es robusta?
  • ¿El método no paramétrico responde a la misma pregunta?
  • ¿La elección se justifica clínicamente?

Conclusión

La normalidad no debe convertirse en una decisión automática basada en p = 0,05.

Shapiro-Wilk y Kolmogorov-Smirnov son herramientas complementarias.

La decisión final requiere integrar:

  • gráficos;
  • tamaño de muestra;
  • valores extremos;
  • estructura del modelo;
  • parámetro de interés;
  • robustez del análisis.

¿Necesitas revisar los supuestos de tu análisis?

En DataMedix evaluamos la distribución, los valores extremos y los supuestos de tus modelos para seleccionar una estrategia coherente con tus datos.

Referencias

  1. S. S. SHAPIRO, M. B. WILK, An analysis of variance test for normality (complete samples), Biometrika, Volume 52, Issue 3-4, December 1965, Pages 591–611, https://doi.org/10.1093/biomet/52.3-4.591
  2. (2009). The Analysis Of Efficacy Data. In: Cleophas, T.J., Zwinderman, A.H., Cleophas, T.F., Cleophas, E.P. (eds) Statistics Applied to Clinical Trials. Springer, Dordrecht. https://doi.org/10.1007/978-1-4020-9523-8_2
  3. Ginn, G. L., & Campbell-Cooper, C. (2025). Statistical analysis and significance tests for clinical trial data. Medicine53(6), 376-379.
  4. Glass, R. L., Alman, J. E., & Fleisch, S. (1972). The appropriateness of analysis of variance to the statistical analyses of dental clinical trials. Archives of Oral Biology17(4), 633-643.
  5. Ghasemi A, Zahediasl S. Normality tests for statistical analysis: a guide for non-statisticians. Int J Endocrinol Metab. 2012 Spring;10(2):486-9. doi: 10.5812/ijem.3505. Epub 2012 Apr 20. PMID: 23843808; PMCID: PMC3693611.
  6. Lang TA, Altman DG. Basic statistical reporting for articles published in biomedical journals: the “Statistical Analyses and Methods in the Published Literature” or the SAMPL Guidelines. Int J Nurs Stud. 2015 Jan;52(1):5-9. doi: 10.1016/j.ijnurstu.2014.09.006. Epub 2014 Sep 28. PMID: 25441757.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Scroll to Top