Regresión logística para tesis médicas
Contenido elaborado por el equipo DataMedix.
Revisión metodológica: Lucas Vargas, médico epidemiólogo.

La regresión logística es uno de los modelos más utilizados en investigación médica.
Permite estudiar un desenlace con dos categorías, por ejemplo:
- complicación: sí o no;
- fallecimiento: sí o no;
- respuesta al tratamiento: sí o no;
- diagnóstico positivo: sí o no;
- reingreso: sí o no.
Su principal ventaja es que puede evaluar simultáneamente la relación entre el desenlace y varias variables.
¿Qué pregunta responde?
Puede utilizarse para preguntas como:
¿La obesidad se asocia con complicaciones posoperatorias después de considerar edad, sexo y comorbilidades?
¿Qué variables se relacionan con reingreso hospitalario?
¿Cuál es la probabilidad estimada de presentar un desenlace?
Sin embargo, deben diferenciarse dos propósitos:
Explicativo o etiológico
Busca estimar una asociación y controlar confusión.
Predictivo
Busca generar predicciones precisas para nuevos pacientes.
Ambos pueden utilizar regresión logística, pero necesitan decisiones, validaciones y formas de reporte diferentes.
¿Cómo funciona?
La regresión logística modela el logaritmo de las odds del desenlace.
La ecuación general es:
logit(p) = β₀ + β₁X₁ + β₂X₂ + … + βkXk
Al exponenciar un coeficiente:
e^β
se obtiene un odds ratio.
OR crudo y OR ajustado
OR crudo
Representa la asociación entre una variable y el desenlace sin controlar otras variables.
OR ajustado
Proviene de un modelo que incluye otros predictores o posibles factores de confusión.
Ejemplo:
OR crudo de obesidad: 2,10.
OR ajustado por edad, sexo y diabetes: 1,45.
Parte de la asociación inicial podría estar relacionada con las variables incluidas en el ajuste.
Esto no significa que el OR ajustado esté libre de todo sesgo o confusión.
Interpretación de una variable categórica
Supongamos:
OR ajustado para tabaquismo: 1,80; IC 95 %: 1,20 a 2,70.
Interpretación:
Después de considerar las demás variables incluidas en el modelo, las odds del desenlace fueron aproximadamente 80 % mayores entre fumadores que entre no fumadores.
Debe especificarse siempre:
- desenlace;
- grupo expuesto;
- categoría de referencia;
- variables de ajuste.
Interpretación de una variable continua
Supongamos:
OR para edad: 1,05 por año.
Interpretación:
Por cada año adicional de edad, las odds del desenlace aumentaron aproximadamente 5 %, manteniendo constantes las demás variables.
Pero quizá sea más interpretable expresarlo por diez años:
OR por diez años: 1,63.
La unidad debe definirse antes de interpretar.
Categorías de referencia
Toda variable categórica requiere una referencia.
Ejemplo:
| Tratamiento | OR |
|---|---|
| Tratamiento A | Referencia |
| Tratamiento B | 1,40 |
| Tratamiento C | 0,80 |
Cambiar la referencia modifica los coeficientes, pero no la información subyacente.
No categorizar variables continuas sin justificación
Convertir edad en:
- menor de 60;
- 60 o más;
produce pérdida de información y puede crear un punto de corte artificial.
Las variables continuas pueden modelarse mediante:
- relación lineal;
- transformaciones;
- polinomios;
- splines.
La forma debe justificarse y revisarse.
Selección de variables
No conviene incluir variables únicamente porque tuvieron p < 0,05 en análisis bivariados.
La selección debería considerar:
- pregunta de investigación;
- conocimiento clínico;
- literatura;
- confusores;
- relaciones causales;
- número de eventos;
- complejidad del modelo;
- propósito explicativo o predictivo.
Tamaño de muestra y sobreajuste
Un modelo puede sobreajustarse cuando intenta estimar demasiados parámetros con poca información.
El problema depende especialmente de:
- número de eventos;
- número de parámetros;
- prevalencia del desenlace;
- correlación entre predictores;
- fuerza de las asociaciones;
- separación de los datos;
- datos faltantes.
La regla clásica de diez eventos por parámetro es solo una orientación histórica, no una garantía universal. Estudios de simulación muestran que el rendimiento depende de más elementos que una cifra fija.
Datos faltantes
Eliminar automáticamente todos los participantes con algún dato faltante puede:
- reducir la muestra;
- disminuir precisión;
- introducir sesgo.
Debe describirse:
- cantidad de datos faltantes;
- variables afectadas;
- patrón;
- estrategia utilizada;
- análisis de sensibilidad, cuando corresponda.
TRIPOD exige describir claramente cómo fueron manejados los datos faltantes en estudios de modelos predictivos.
Colinealidad
Ocurre cuando dos o más predictores contienen información muy semejante.
Puede causar:
- coeficientes inestables;
- intervalos amplios;
- cambios de signo;
- dificultad de interpretación.
Debe revisarse mediante:
- conocimiento clínico;
- matriz de correlación;
- tolerancia;
- factor de inflación de la varianza;
- estabilidad del modelo.
Interacciones
Una interacción ocurre cuando la asociación de una variable depende del nivel de otra.
Ejemplo:
El efecto del tratamiento podría ser diferente en pacientes con y sin diabetes.
Las interacciones deben tener una justificación y no buscarse indiscriminadamente.
Evaluación del modelo
Cuando el propósito es explicativo
Debe revisarse:
- especificación;
- confusión;
- linealidad en el logit;
- colinealidad;
- observaciones influyentes;
- estabilidad;
- precisión.
Cuando el propósito es predictivo
Además debe evaluarse:
- discriminación;
- calibración;
- validación interna;
- validación externa;
- utilidad clínica.
TRIPOD+AI es actualmente la guía principal para reportar modelos diagnósticos y pronósticos desarrollados mediante regresión o aprendizaje automático. Exige definir desenlace, predictores, tamaño de muestra, datos faltantes, construcción y desempeño del modelo.
Errores frecuentes
- Confundir OR con riesgo relativo.
- Incluir demasiadas variables.
- Seleccionar predictores únicamente por valores p.
- Categorizar variables continuas.
- No indicar referencias.
- Ignorar datos faltantes.
- No evaluar linealidad.
- No revisar colinealidad.
- Interpretar asociación como causalidad.
- Reportar solo los predictores significativos.
- No presentar el modelo completo cuando es predictivo.
- Evaluar desempeño únicamente en la misma muestra.
Cómo reportar una regresión logística
Se ajustó un modelo de regresión logística binaria con complicación como desenlace. Se incluyeron edad, sexo, obesidad y diabetes con base en la pregunta de investigación y la evidencia previa. La obesidad se asoció con mayores odds de complicación después del ajuste (OR ajustado: 1,52; IC 95 %: 1,08 a 2,15). Se evaluaron colinealidad, linealidad de variables continuas y observaciones influyentes.
Tabla recomendada
| Variable | OR crudo | IC 95 % | OR ajustado | IC 95 % | p |
|---|---|---|---|---|---|
| Edad, por 10 años | 1,30 | 1,10–1,55 | 1,22 | 1,02–1,47 | 0,03 |
| Sexo masculino | 1,15 | 0,80–1,66 | 1,08 | 0,73–1,60 | 0,70 |
| Obesidad | 1,90 | 1,36–2,66 | 1,52 | 1,08–2,15 | 0,02 |
Conclusión
La regresión logística no consiste solamente en introducir variables en un programa y observar cuáles tienen p < 0,05.
Requiere:
- pregunta clara;
- desenlace definido;
- selección justificada;
- tamaño de muestra suficiente;
- revisión de supuestos;
- evaluación del ajuste;
- interpretación prudente.
¿Necesitas construir una regresión logística para tesis medicas?
En DataMedix revisamos tu desenlace, predictores, número de eventos y propósito del modelo para desarrollar un análisis coherente y reportable.
Referencias
- Collins GS, Moons KGM, Dhiman P, Riley RD, Beam AL, Van Calster B, Ghassemi M, Liu X, Reitsma JB, van Smeden M, Boulesteix AL, Camaradou JC, Celi LA, Denaxas S, Denniston AK, Glocker B, Golub RM, Harvey H, Heinze G, Hoffman MM, Kengne AP, Lam E, Lee N, Loder EW, Maier-Hein L, Mateen BA, McCradden MD, Oakden-Rayner L, Ordish J, Parnell R, Rose S, Singh K, Wynants L, Logullo P. TRIPOD+AI statement: updated guidance for reporting clinical prediction models that use regression or machine learning methods. BMJ. 2024 Apr 16;385:e078378. doi: 10.1136/bmj-2023-078378. Erratum in: BMJ. 2024 Apr 18;385:q902. doi: 10.1136/bmj.q902. PMID: 38626948; PMCID: PMC11019967.
- Moons KGM, Wolff RF, Riley RD, Whiting PF, Westwood M, Collins GS, Reitsma JB, Kleijnen J, Mallett S. PROBAST: A Tool to Assess Risk of Bias and Applicability of Prediction Model Studies: Explanation and Elaboration. Ann Intern Med. 2019 Jan 1;170(1):W1-W33. doi: 10.7326/M18-1377. PMID: 30596876.
- Peduzzi P, Concato J, Kemper E, Holford TR, Feinstein AR. A simulation study of the number of events per variable in logistic regression analysis. J Clin Epidemiol. 1996 Dec;49(12):1373-9. doi: 10.1016/s0895-4356(96)00236-3. PMID: 8970487.
- Vittinghoff E, McCulloch CE. Relaxing the rule of ten events per variable in logistic and Cox regression. Am J Epidemiol. 2007 Mar 15;165(6):710-8. doi: 10.1093/aje/kwk052. Epub 2006 Dec 20. PMID: 17182981.
- Lang TA, Altman DG. Basic statistical reporting for articles published in biomedical journals: the “Statistical Analyses and Methods in the Published Literature” or the SAMPL Guidelines. Int J Nurs Stud. 2015 Jan;52(1):5-9. doi: 10.1016/j.ijnurstu.2014.09.006. Epub 2014 Sep 28. PMID: 25441757.



