No history yet

Limpieza y Calidad

Más Allá de lo Básico: Calidad de Datos Avanzada

Los datos crudos rara vez están listos para el análisis. Más allá de eliminar duplicados, la verdadera preparación de datos consiste en manejar sistemáticamente las imperfecciones para no comprometer los resultados. El objetivo es asegurar la integridad analítica, transformando datos ruidosos e incompletos en un recurso confiable para la toma de decisiones estratégicas.

El Dilema de los Datos Faltantes

Los valores faltantes son inevitables, pero no todos son iguales. Entender su naturaleza es el primer paso para tratarlos sin introducir sesgos. Se clasifican en tres categorías: MCAR (Missing Completely at Random), MAR (Missing at Random) y NMAR (Missing Not at Random).

TipoDescripciónEjemplo
MCARLa ausencia del dato no tiene relación con ninguna variable.Un participante olvidó responder una pregunta en una encuesta por distracción.
MARLa ausencia se relaciona con otra variable observada.Es más probable que hombres no reporten su peso que mujeres.
NMARLa ausencia depende del propio valor faltante.Personas con ingresos muy altos prefieren no declararlos.

Identificar el tipo de dato faltante guía la estrategia de imputación y evita conclusiones erróneas. Por ejemplo, eliminar filas con datos MAR o NMAR puede sesgar gravemente el análisis, ya que estaríamos eliminando sistemáticamente un subgrupo particular de la población.

Para casos complejos, especialmente con datos MAR y NMAR, las técnicas de imputación simples como reemplazar con la media o la mediana son insuficientes. Métodos más avanzados ofrecen mejores resultados:

  • Imputación Múltiple: Crea varios datasets completos, cada uno con estimaciones diferentes para los valores faltantes. Los análisis se ejecutan en cada dataset y los resultados se combinan. Este método captura la incertidumbre asociada a los valores faltantes.

  • Imputación KNN (K-Nearest Neighbors): Busca los 'k' registros más similares al que tiene el valor faltante (basado en otras variables) y usa un promedio de sus valores para imputar el dato. Es eficaz porque utiliza el contexto de otros puntos de datos.

La mejor estrategia de imputación no es la más compleja, sino la que mejor se alinea con la naturaleza de los datos faltantes y los objetivos del análisis.

Detectando Anomalías en el Conjunto

Los outliers o valores atípicos son observaciones que se desvían drásticamente del resto. Pueden ser errores de entrada o eventos genuinamente raros. Ignorarlos o eliminarlos sin criterio puede llevar a modelos que no generalizan bien a la realidad. Dos métodos robustos para detectarlos son la puntuación Z y el rango intercuartílico (IQR).

Puntuación Z

noun

Una medida estadística que describe la relación de un valor con la media de un grupo de valores. Se mide en términos de desviaciones estándar desde la media.

Z=xμσZ = \frac{x - \mu}{\sigma}

El método del es otra técnica potente, especialmente útil cuando la distribución de los datos no es normal. Se basa en dividir el conjunto de datos en cuartiles. Un valor se considera atípico si se encuentra muy por debajo del primer cuartil o muy por encima del tercer cuartil.

Automatización del Proceso

La limpieza de datos no es una tarea que se realiza una sola vez. En entornos donde los datos se actualizan constantemente, la calidad puede degradarse con el tiempo. La solución es automatizar los flujos de trabajo de calidad de datos.

Un pipeline de calidad de datos automatizado es una secuencia de scripts o procesos programados que se ejecutan de forma regular. Estos flujos de trabajo pueden:

  1. Validar tipos de datos: Verificar que una columna que debería contener fechas solo contenga fechas válidas.
  2. Estandarizar categorías: Convertir automáticamente variaciones como "México", "MEX" y "mx" a un único estándar.
  3. Aplicar reglas de negocio: Asegurar que los datos cumplan con lógicas específicas, como que la fecha de entrega de un pedido no puede ser anterior a la fecha de compra.
  4. Generar alertas: Notificar a los responsables cuando se detectan anomalías o un deterioro en la calidad de los datos.
Lesson image

La automatización no solo ahorra tiempo, sino que garantiza que las reglas de calidad se apliquen de manera consistente a todos los datos que ingresan al sistema. Esto crea una base sólida y confiable para cualquier análisis o modelo de machine learning.

Realizar un buen proceso de depuración de datos mejora significativamente la calidad del análisis, ayuda a tomar decisiones acertadas y evita errores que podrían costar mucho tiempo (y dinero).

Quiz Questions 1/5

¿Cuál es el objetivo principal de la preparación de datos antes del análisis?

Quiz Questions 2/5

Si se sospecha que los datos faltantes en una columna de 'ingresos' no son aleatorios (NMAR), porque las personas con altos ingresos tienden a no reportarlos, ¿cuál es el mayor riesgo de simplemente eliminar esas filas?

Al dominar estas técnicas avanzadas, pasas de simplemente limpiar datos a diseñar un ecosistema de datos robusto y confiable, listo para generar inteligencia de negocio precisa y accionable.