limpieza y calidad de datos en investigacion clinica

Limpieza y calidad de datos en investigación clínica

Contenido elaborado por el equipo DataMedix.
Revisión metodológica: Lucas Vargas, médico especialista en Epidemiología.

limpieza y calidad de datos en investigacion clinica

Antes de analizar una base de datos clínica es necesario comprobar que la información sea suficientemente consistente, completa e interpretable.

Este proceso suele llamarse limpieza de datos.

Sin embargo, limpiar una base no significa modificar todo aquello que parece extraño.

Significa:

identificar posibles problemas, verificar su origen y documentar las decisiones tomadas.

En investigación clínica, la integridad de los datos depende también de poder comprender de dónde provienen y qué modificaciones han sufrido. La FDA enfatiza la confiabilidad y exactitud de los datos y la necesidad de estrategias proporcionales al riesgo para preservar su integridad.

¿Qué es calidad de datos?

No existe una única dimensión.

Una base puede evaluarse según aspectos como:

Completitud

¿Está disponible la información requerida?

Exactitud

¿El valor registrado corresponde con la fuente?

Consistencia

¿La información concuerda dentro de la base?

Validez

¿El valor cumple las reglas definidas?

Unicidad

¿Existen registros duplicados?

Temporalidad

¿Las fechas siguen una secuencia posible?

Trazabilidad

¿Puede conocerse el origen y las modificaciones relevantes?

Paso 1. Conserva la base original

Nunca realices toda la limpieza sobre la única copia.

Crea una versión de trabajo.

Ejemplo:

Base original → Base de limpieza → Base analítica.

La original funciona como referencia.

Paso 2. Revisa la estructura

Comprueba:

  • número de filas;
  • número de columnas;
  • encabezados;
  • variables duplicadas;
  • filas vacías;
  • tablas mezcladas.

Paso 3. Busca registros duplicados

Un mismo paciente puede aparecer dos veces accidentalmente.

Pero recuerda:

repetición no siempre significa duplicado.

En una cohorte, un paciente puede tener varias visitas legítimas.

La unidad de observación determina qué constituye realmente un duplicado.

Paso 4. Evalúa rangos

Busca valores imposibles o improbables.

Ejemplos:

  • edad = 450 años;
  • saturación = 850 %;
  • temperatura = 350 °C;
  • talla = 17 metros.

Estos valores pueden deberse a:

  • error decimal;
  • unidad incorrecta;
  • digitación;
  • importación.

No se deben corregir mediante suposición.

Primero verifica la fuente.

Paso 5. Revisa consistencia lógica

Algunas combinaciones son incompatibles.

Ejemplo hipotético:

fecha de fallecimiento anterior a fecha de ingreso.

O:

participante registrado como “no ingresó a UCI”, pero con 12 días de estancia en UCI.

Este tipo de reglas permite encontrar errores que un simple rango numérico no detectaría.

Paso 6. Revisa consistencia temporal

Comprueba:

fecha nacimiento < fecha ingreso < fecha alta < seguimiento.

En estudios longitudinales esto es fundamental.

Paso 7. Revisa unidades

Una creatinina puede expresarse en diferentes unidades.

Un peso puede haberse registrado en:

  • kg;
  • libras.

Una diferencia de unidad puede parecer un valor extremo cuando en realidad es un problema de estandarización.

Paso 8. Revisa categorías

Busca:

  • errores ortográficos;
  • mayúsculas inconsistentes;
  • categorías duplicadas;
  • abreviaturas no documentadas.

Ejemplo:

  • Sí;
  • Si;
  • SI;

Deben convertirse a una codificación coherente.

Paso 9. Evalúa los datos faltantes

Calcula:

  • porcentaje por variable;
  • patrón por grupo;
  • cantidad por participante.

No borres casos incompletos antes de estudiar el problema.

Paso 10. Revisa valores extremos

Un valor extremo puede ser real.

Por ejemplo, una estancia hospitalaria de 120 días puede ser poco común, pero perfectamente posible.

La secuencia correcta es:

detectar → verificar → documentar → decidir.

No:

detectar → eliminar.

Paso 11. Verifica variables derivadas

Si tienes:

  • edad calculada;
  • IMC;
  • escala clínica;
  • duración;
  • puntaje;

recalcula una muestra o, idealmente, todos los registros mediante una regla reproducible.

Paso 12. Compara variables relacionadas

Ejemplo:

Si:

mortalidad = sí

debería existir coherencia con:

  • fecha de fallecimiento;
  • estado al egreso;
  • seguimiento.

Estas comprobaciones cruzadas son útiles para encontrar errores.

¿Qué es una query o consulta de datos?

En gestión de datos clínicos, cuando aparece una inconsistencia no siempre se corrige directamente.

Puede generarse una consulta:

“Verificar valor de creatinina del paciente 024. En base figura 14,8 mg/dL.”

El responsable revisa la fuente y confirma o corrige.

Este proceso evita modificar información sin evidencia.

No “arregles” datos para que se vean normales

Nunca deberías cambiar un valor porque:

  • afecta la media;
  • produce un resultado no significativo;
  • parece demasiado alto;
  • dificulta un modelo;
  • cambia una gráfica.

La limpieza ocurre con criterios definidos, no según el resultado estadístico deseado.

Diferencia entre limpieza y manipulación

Limpieza legítima

Corregir:

peso = 720 kg

a:

72,0 kg

cuando la fuente original confirma 72 kg.

Manipulación inadecuada

Cambiar:

peso = 120 kg

a:

100 kg

porque 120 parece demasiado elevado, sin evidencia documental.

Registra las modificaciones

Una tabla de control puede incluir:

IDvariableoriginalnuevomotivo
034edad33033fuente verificada
071sexoMASCMestandarización

No todas las transformaciones necesitan una tabla manual, pero las correcciones relevantes deberían ser reproducibles y justificables. Procura siempre dejar algún tipo de registro en tu Limpieza y calidad de datos en investigación clínica para poder volver a ella cuando sea necesario.

¿Qué significa que una base tenga “buena calidad”?

No significa que tenga cero datos faltantes ni que todas las variables tengan distribuciones perfectas.

Significa que los datos son suficientemente:

  • confiables;
  • consistentes;
  • interpretables;
  • documentados;

para responder la pregunta de investigación dentro de las limitaciones del estudio.

Checklist final de Limpieza y calidad de datos en investigación clínica

Antes del análisis comprueba:

  • estructura;
  • identificadores;
  • duplicados;
  • rangos;
  • unidades;
  • categorías;
  • fechas;
  • lógica interna;
  • datos faltantes;
  • valores extremos;
  • variables derivadas;
  • trazabilidad;
  • diccionario.
limpieza y calidad de datos en investigacion clinica

Conclusión

La limpieza de datos es una etapa metodológica, no cosmética.

Su objetivo no es producir una base “perfecta”, sino garantizar que los errores detectables se investiguen y que cualquier transformación importante pueda justificarse.

Una prueba estadística avanzada no corrige una base mal construida.

Por eso, la calidad del análisis comienza con la calidad de los datos.

¿Necesitas limpiar una base clínica antes del análisis?

En DataMedix podemos revisar estructura, inconsistencias, duplicados, rangos, valores faltantes y variables para construir una base analítica documentada antes de realizar las pruebas estadísticas.

Referencias

  1. FDA. Data Integrity and Compliance With Drug CGMP: Questions and Answers.
  2. Broman KW, Woo KH. Data Organization in Spreadsheets. The American Statistician. 2018.
  3. CDISC. Define-XML.
  4. International Council for Harmonisation. Good Clinical Practice.
  5. von Elm E, et al. STROBE Statement.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Scroll to Top