Errores en el análisis estadístico de tesis médicas, los más comunes
Contenido elaborado por el equipo DataMedix.
Revisión metodológica: Lucas Vargas, médico epidemiólogo.

Los errores estadísticos no comienzan necesariamente al abrir SPSS, R, Stata o Python.
Muchos se originan antes:
- en la pregunta;
- en los objetivos;
- en la definición de variables;
- en la selección de participantes;
- en la estructura de la base;
- en la ausencia de un plan de análisis.
Una prueba sofisticada no puede corregir un diseño incoherente o datos mal definidos.
Error 1. Empezar a analizar sin un plan
Una práctica frecuente es recolectar toda la información disponible y decidir después qué hacer.
Esto puede generar:
- análisis innecesarios;
- múltiples comparaciones;
- selección de resultados llamativos;
- objetivos modificados;
- conclusiones guiadas por los datos.
Cómo evitarlo
Antes de analizar, define:
- objetivo;
- desenlace;
- exposición;
- covariables;
- estadísticos descriptivos;
- comparaciones;
- modelos;
- análisis secundarios;
- tratamiento de datos faltantes.
Error 2. No definir la unidad de análisis
La unidad puede ser:
- paciente;
- consulta;
- hospitalización;
- ojo;
- lesión;
- procedimiento;
- institución.
Si un paciente aporta varias observaciones, estas pueden estar correlacionadas.
Analizarlas como independientes puede producir errores estándar demasiado pequeños y conclusiones exageradas.
Cómo evitarlo
Determina:
- cuántas filas aporta cada participante;
- si existen mediciones repetidas;
- si hay agrupamiento por hospital, médico o familia;
- qué modelo representa esa estructura.
Error 3. Codificar mal las variables
Problemas frecuentes:
- sí codificado a veces como 1 y otras como 2;
- fechas guardadas como texto;
- unidades mezcladas;
- categorías duplicadas;
- valores faltantes representados como 0;
- errores ortográficos que crean nuevas categorías.
Cómo evitarlo
Construye un diccionario con:
- nombre;
- definición;
- tipo;
- unidad;
- categorías;
- códigos;
- valor faltante;
- reglas de validación.
Error 4. Elegir pruebas solamente por Shapiro-Wilk
La normalidad no debe decidir automáticamente entre prueba paramétrica y no paramétrica.
Debe revisarse:
- objetivo;
- grupo;
- independencia;
- valores extremos;
- gráficos;
- residuos;
- robustez;
- parámetro de interés.
Error 5. Ignorar si los datos son pareados
Comparar antes y después mediante una t independiente o Mann-Whitney ignora la relación dentro de cada participante.
Alternativas posibles
- t pareada;
- Wilcoxon;
- McNemar;
- modelos de medidas repetidas;
- modelos mixtos.
Error 6. Elegir la prueba que produce el menor valor p
Probar diferentes métodos y reportar solamente el más favorable reduce la transparencia.
La ASA advierte que las decisiones no deben basarse exclusivamente en superar un umbral y que el reporte completo es fundamental para una inferencia adecuada.
Cómo evitarlo
Define el análisis previamente y documenta cualquier cambio.
Error 7. Realizar muchas comparaciones
Si se ejecutan suficientes pruebas, algunas pueden producir p < 0,05 aunque no exista una asociación real.
Cómo evitarlo
- Define un desenlace principal.
- Limita los análisis exploratorios.
- Considera ajustes por multiplicidad.
- Diferencia análisis confirmatorios y exploratorios.
- Reporta todas las comparaciones relevantes.
Error 8. Interpretar p > 0,05 como igualdad
No alcanzar significación no demuestra que dos grupos sean iguales.
Puede existir:
- efecto pequeño;
- muestra insuficiente;
- alta variabilidad;
- pocos eventos;
- medición imprecisa.
Debe interpretarse el intervalo de confianza.
Error 9. Reportar solamente valores p
Un valor p no muestra:
- dirección;
- magnitud;
- precisión;
- importancia clínica.
Las recomendaciones de reporte biomédico enfatizan estimaciones e intervalos, no solamente pruebas de hipótesis.
Error 10. Confundir OR con riesgo relativo
Cuando el desenlace es frecuente, el odds ratio puede alejarse considerablemente del riesgo relativo.
Escribir:
OR 2,0 = doble de riesgo
puede ser incorrecto.
Debe utilizarse la terminología adecuada y presentar riesgos absolutos cuando sea posible.
Error 11. Incluir demasiadas variables en una regresión
Un modelo complejo con pocos eventos puede sobreajustarse.
Consecuencias:
- coeficientes inestables;
- intervalos amplios;
- asociaciones exageradas;
- pobre rendimiento en nuevas muestras.
Cómo evitarlo
Considera:
- número de eventos;
- parámetros;
- conocimiento clínico;
- penalización;
- validación;
- complejidad.
Error 12. Seleccionar variables solo por análisis bivariado
Excluir un confusor porque tuvo p > 0,05 puede dejar sesgo en el modelo.
La selección debe fundamentarse en:
- pregunta;
- marco causal;
- evidencia;
- función de la variable;
- propósito del análisis.
Error 13. Categorizar variables continuas
Dividir edad, presión o biomarcadores en dos categorías:
- pierde información;
- reduce potencia;
- introduce puntos de corte arbitrarios;
- puede ocultar relaciones no lineales.
Debe mantenerse la escala continua cuando sea razonable.
Error 14. Ignorar datos faltantes
Eliminar automáticamente todos los registros incompletos puede cambiar la población analizada.
Debe informarse:
- cantidad;
- patrón;
- posibles causas;
- método de manejo;
- análisis de sensibilidad.
Error 15. No revisar valores extremos
Los valores extremos pueden ser:
- errores de digitación;
- unidades incorrectas;
- observaciones reales;
- participantes clínicamente diferentes.
No deben eliminarse solo porque modifican el resultado.
Cada decisión debe justificarse.
Error 16. Confundir asociación con causalidad
Una regresión ajustada no demuestra automáticamente causalidad.
Todavía pueden existir:
- confusión residual;
- sesgo de selección;
- errores de medición;
- temporalidad incierta;
- variables no medidas.
Error 17. No evaluar los supuestos del modelo
Cada modelo tiene requisitos.
Ejemplos:
- independencia;
- linealidad;
- distribución de residuos;
- igualdad de varianzas;
- riesgos proporcionales;
- ausencia de colinealidad grave;
- especificación correcta.
Error 18. Copiar la salida del programa
Las salidas suelen incluir:
- nombres técnicos;
- decimales excesivos;
- tablas innecesarias;
- estadísticos no interpretados.
Deben transformarse en tablas comprensibles.
Error 19. Ocultar resultados no significativos
Reportar solamente los análisis favorables puede producir una visión sesgada.
La transparencia requiere mostrar los resultados definidos en el protocolo, independientemente de su valor p.
Error 20. Concluir más de lo que permiten los datos
Ejemplo inadecuado:
El factor X causa mortalidad.
Ejemplo prudente:
El factor X se asoció con mayores odds de mortalidad después del ajuste por las variables incluidas.
La conclusión debe corresponder al diseño.
Ruta para prevenir los errores en el análisis estadístico de tesis médicas
Antes de recolectar
- Define pregunta y objetivos.
- Define desenlace.
- Calcula el tamaño de muestra.
- Diseña las variables.
- Construye el plan estadístico.
Antes de analizar
- Limpia la base.
- Verifica unidades.
- Revisa duplicados.
- Describe datos faltantes.
- Examina distribuciones.
- Confirma unidad de análisis.
Durante el análisis
- Usa pruebas coherentes.
- Revisa supuestos.
- Reporta magnitud e incertidumbre.
- Documenta cambios.
- Diferencia análisis crudos y ajustados.
Al interpretar
- Evita causalidad injustificada.
- Evalúa relevancia clínica.
- Reconoce limitaciones.
- No reduzcas la conclusión a p < 0,05.
Checklist final
- ¿El análisis responde a los objetivos?
- ¿La unidad de análisis es correcta?
- ¿Las variables están bien codificadas?
- ¿Los datos pareados fueron reconocidos?
- ¿Se revisaron valores extremos?
- ¿Los datos faltantes están descritos?
- ¿Las pruebas fueron planificadas?
- ¿Los supuestos fueron evaluados?
- ¿Se controló la multiplicidad?
- ¿Los modelos tienen suficiente información?
- ¿Se reportan intervalos?
- ¿Las medidas están correctamente interpretadas?
- ¿La conclusión corresponde al diseño?
Conclusión
Los errores estadísticos más graves no siempre son cálculos incorrectos.
Con frecuencia consisten en:
- responder otra pregunta;
- ignorar la estructura;
- seleccionar resultados;
- sobreajustar;
- interpretar mal;
- concluir más de lo permitido.
Un análisis sólido comienza antes de abrir el programa estadístico.
¿Necesitas revisar el análisis de tu tesis?
En DataMedix evaluamos la coherencia entre objetivos, variables, base, pruebas, modelos e interpretación para identificar errores antes de entregar o publicar.
Referencias
- Wasserstein, R. L., & Lazar, N. A. (2016). The ASA Statement on p-Values: Context, Process, and Purpose. The American Statistician, 70(2), 129–133. https://doi.org/10.1080/00031305.2016.1154108
- Basic statistical reporting for articles published in biomedical journals: the “Statistical Analyses and Methods in the Published Literature” or the SAMPL Guidelines
- von Elm E, Altman DG, Egger M, Pocock SJ, Gøtzsche PC, Vandenbroucke JP; STROBE Initiative. Strengthening the Reporting of Observational Studies in Epidemiology (STROBE) statement: guidelines for reporting observational studies. BMJ. 2007 Oct 20;335(7624):806-8. doi: 10.1136/bmj.39335.541782.AD. PMID: 17947786; PMCID: PMC2034723.
- Collins GS, Moons KGM, Dhiman P, Riley RD, Beam AL, Van Calster B, Ghassemi M, Liu X, Reitsma JB, van Smeden M, Boulesteix AL, Camaradou JC, Celi LA, Denaxas S, Denniston AK, Glocker B, Golub RM, Harvey H, Heinze G, Hoffman MM, Kengne AP, Lam E, Lee N, Loder EW, Maier-Hein L, Mateen BA, McCradden MD, Oakden-Rayner L, Ordish J, Parnell R, Rose S, Singh K, Wynants L, Logullo P. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024 Apr 16;385:e078378. doi: 10.1136/bmj-2023-078378. Erratum in: BMJ. 2024 Apr 18;385:q902. doi: 10.1136/bmj.q902. PMID: 38626948; PMCID: PMC11019967.
- Moons KGM, Wolff RF, Riley RD, Whiting PF, Westwood M, Collins GS, Reitsma JB, Kleijnen J, Mallett S. PROBAST: A Tool to Assess Risk of Bias and Applicability of Prediction Model Studies: Explanation and Elaboration. Ann Intern Med. 2019 Jan 1;170(1):W1-W33. doi: 10.7326/M18-1377. PMID: 30596876.
- Harrington D, D’Agostino RB Sr, Gatsonis C, Hogan JW, Hunter DJ, Normand ST, Drazen JM, Hamel MB. New Guidelines for Statistical Reporting in the Journal. N Engl J Med. 2019 Jul 18;381(3):285-286. doi: 10.1056/NEJMe1906559. PMID: 31314974.
- Monge, E. (2008). Los errores más frecuentes en estadística médica. Revista de Gastroenterología del Perú.
- Perales, C. A. (2010). ¿ Estadística en profesionales de la salud?. Revista-e Ibn Sina, 1(1), 20-34.



