Limpieza y calidad de datos en investigación clínica
Contenido elaborado por el equipo DataMedix.
Revisión metodológica: Lucas Vargas, médico especialista en Epidemiología.

Antes de analizar una base de datos clínica es necesario comprobar que la información sea suficientemente consistente, completa e interpretable.
Este proceso suele llamarse limpieza de datos.
Sin embargo, limpiar una base no significa modificar todo aquello que parece extraño.
Significa:
identificar posibles problemas, verificar su origen y documentar las decisiones tomadas.
En investigación clínica, la integridad de los datos depende también de poder comprender de dónde provienen y qué modificaciones han sufrido. La FDA enfatiza la confiabilidad y exactitud de los datos y la necesidad de estrategias proporcionales al riesgo para preservar su integridad.
¿Qué es calidad de datos?
No existe una única dimensión.
Una base puede evaluarse según aspectos como:
Completitud
¿Está disponible la información requerida?
Exactitud
¿El valor registrado corresponde con la fuente?
Consistencia
¿La información concuerda dentro de la base?
Validez
¿El valor cumple las reglas definidas?
Unicidad
¿Existen registros duplicados?
Temporalidad
¿Las fechas siguen una secuencia posible?
Trazabilidad
¿Puede conocerse el origen y las modificaciones relevantes?
Paso 1. Conserva la base original
Nunca realices toda la limpieza sobre la única copia.
Crea una versión de trabajo.
Ejemplo:
Base original → Base de limpieza → Base analítica.
La original funciona como referencia.
Paso 2. Revisa la estructura
Comprueba:
- número de filas;
- número de columnas;
- encabezados;
- variables duplicadas;
- filas vacías;
- tablas mezcladas.
Paso 3. Busca registros duplicados
Un mismo paciente puede aparecer dos veces accidentalmente.
Pero recuerda:
repetición no siempre significa duplicado.
En una cohorte, un paciente puede tener varias visitas legítimas.
La unidad de observación determina qué constituye realmente un duplicado.
Paso 4. Evalúa rangos
Busca valores imposibles o improbables.
Ejemplos:
- edad = 450 años;
- saturación = 850 %;
- temperatura = 350 °C;
- talla = 17 metros.
Estos valores pueden deberse a:
- error decimal;
- unidad incorrecta;
- digitación;
- importación.
No se deben corregir mediante suposición.
Primero verifica la fuente.
Paso 5. Revisa consistencia lógica
Algunas combinaciones son incompatibles.
Ejemplo hipotético:
fecha de fallecimiento anterior a fecha de ingreso.
O:
participante registrado como “no ingresó a UCI”, pero con 12 días de estancia en UCI.
Este tipo de reglas permite encontrar errores que un simple rango numérico no detectaría.
Paso 6. Revisa consistencia temporal
Comprueba:
fecha nacimiento < fecha ingreso < fecha alta < seguimiento.
En estudios longitudinales esto es fundamental.
Paso 7. Revisa unidades
Una creatinina puede expresarse en diferentes unidades.
Un peso puede haberse registrado en:
- kg;
- libras.
Una diferencia de unidad puede parecer un valor extremo cuando en realidad es un problema de estandarización.
Paso 8. Revisa categorías
Busca:
- errores ortográficos;
- mayúsculas inconsistentes;
- categorías duplicadas;
- abreviaturas no documentadas.
Ejemplo:
- Sí;
- Si;
- SI;
Deben convertirse a una codificación coherente.
Paso 9. Evalúa los datos faltantes
Calcula:
- porcentaje por variable;
- patrón por grupo;
- cantidad por participante.
No borres casos incompletos antes de estudiar el problema.
Paso 10. Revisa valores extremos
Un valor extremo puede ser real.
Por ejemplo, una estancia hospitalaria de 120 días puede ser poco común, pero perfectamente posible.
La secuencia correcta es:
detectar → verificar → documentar → decidir.
No:
detectar → eliminar.
Paso 11. Verifica variables derivadas
Si tienes:
- edad calculada;
- IMC;
- escala clínica;
- duración;
- puntaje;
recalcula una muestra o, idealmente, todos los registros mediante una regla reproducible.
Paso 12. Compara variables relacionadas
Ejemplo:
Si:
mortalidad = sí
debería existir coherencia con:
- fecha de fallecimiento;
- estado al egreso;
- seguimiento.
Estas comprobaciones cruzadas son útiles para encontrar errores.
¿Qué es una query o consulta de datos?
En gestión de datos clínicos, cuando aparece una inconsistencia no siempre se corrige directamente.
Puede generarse una consulta:
“Verificar valor de creatinina del paciente 024. En base figura 14,8 mg/dL.”
El responsable revisa la fuente y confirma o corrige.
Este proceso evita modificar información sin evidencia.
No “arregles” datos para que se vean normales
Nunca deberías cambiar un valor porque:
- afecta la media;
- produce un resultado no significativo;
- parece demasiado alto;
- dificulta un modelo;
- cambia una gráfica.
La limpieza ocurre con criterios definidos, no según el resultado estadístico deseado.
Diferencia entre limpieza y manipulación
Limpieza legítima
Corregir:
peso = 720 kg
a:
72,0 kg
cuando la fuente original confirma 72 kg.
Manipulación inadecuada
Cambiar:
peso = 120 kg
a:
100 kg
porque 120 parece demasiado elevado, sin evidencia documental.
Registra las modificaciones
Una tabla de control puede incluir:
| ID | variable | original | nuevo | motivo |
|---|---|---|---|---|
| 034 | edad | 330 | 33 | fuente verificada |
| 071 | sexo | MASC | M | estandarización |
No todas las transformaciones necesitan una tabla manual, pero las correcciones relevantes deberían ser reproducibles y justificables. Procura siempre dejar algún tipo de registro en tu Limpieza y calidad de datos en investigación clínica para poder volver a ella cuando sea necesario.
¿Qué significa que una base tenga “buena calidad”?
No significa que tenga cero datos faltantes ni que todas las variables tengan distribuciones perfectas.
Significa que los datos son suficientemente:
- confiables;
- consistentes;
- interpretables;
- documentados;
para responder la pregunta de investigación dentro de las limitaciones del estudio.
Checklist final de Limpieza y calidad de datos en investigación clínica
Antes del análisis comprueba:
- estructura;
- identificadores;
- duplicados;
- rangos;
- unidades;
- categorías;
- fechas;
- lógica interna;
- datos faltantes;
- valores extremos;
- variables derivadas;
- trazabilidad;
- diccionario.

Conclusión
La limpieza de datos es una etapa metodológica, no cosmética.
Su objetivo no es producir una base “perfecta”, sino garantizar que los errores detectables se investiguen y que cualquier transformación importante pueda justificarse.
Una prueba estadística avanzada no corrige una base mal construida.
Por eso, la calidad del análisis comienza con la calidad de los datos.
¿Necesitas limpiar una base clínica antes del análisis?
En DataMedix podemos revisar estructura, inconsistencias, duplicados, rangos, valores faltantes y variables para construir una base analítica documentada antes de realizar las pruebas estadísticas.
Referencias
- FDA. Data Integrity and Compliance With Drug CGMP: Questions and Answers.
- Broman KW, Woo KH. Data Organization in Spreadsheets. The American Statistician. 2018.
- CDISC. Define-XML.
- International Council for Harmonisation. Good Clinical Practice.
- von Elm E, et al. STROBE Statement.



