Introduction
Los pipelines de ETL en entornos cloud a menudo enfrentan un dilema: monitorear la calidad de los datos en busca de anomalías introduce costos operativos y complejidad, pero no hacerlo deja pasar errores que pueden corromper análisis downstream. Hasta ahora, la detección de anomalías en AWS Glue Data Quality implicaba un costo adicional, lo que llevaba a los equipos a priorizar qué jobs monitorear, dejando otros en riesgo. Además, los algoritmos existentes podían generar falsos positivos en datasets con patrones irregulares o intervalos de llegada de datos variables, obligando a los equipos a filtrar alertas ruidosas manualmente.
Qué ocurrió
AWS announcement el 26 de agosto de 2026 que AWS Glue Data Quality introduce dos mejoras significativas:
- Detección de anomalías gratis: La funcionalidad de anomaly detection para jobs ETL de Glue ya no tiene costo adicional. Esto permite monitorear la calidad de datos en todos los pipelines sin impacto en el presupuesto.
- Modo de observación mejorado: Un nuevo observation mode optimizado para datasets con patrones planos, aleatorios o sin tendencias predecibles. Este modo evita la extrapolación lineal de tendencias (que puede generar falsos positivos) y usa una línea base constante, reduciendo el ruido en las alertas.
Estas mejoras están disponibles en todas las regiones comerciales de AWS y en AWS GovCloud (US).
Impacto para DevOps / Infraestructura / Cloud / Seguridad
Para los equipos de DevOps e infraestructura, la eliminación del costo de anomaly detection simplifica la implementación de controles de calidad de datos en todos los pipelines. Ya no es necesario seleccionar selectivamente qué jobs monitorear, lo que reduce el riesgo de errores no detectados en flujos de datos críticos. Esto es especialmente relevante en entornos con cientos o miles de jobs ETL, donde el costo acumulado de la detección de anomalías podía ser significativo.
En seguridad, la capacidad de monitorear la calidad de los datos sin costo adicional facilita la detección de anomalías que podrían indicar actividades maliciosas, como inyecciones de datos o manipulaciones en el origen. Por ejemplo, un cambio inesperado en la distribución de valores en un dataset podría alertar sobre un compromiso en el sistema source.
Para los equipos de cloud, el nuevo modo de observación es particularly útil para:
- Análisis exploratorios en notebooks (Glue Interactive Sessions), donde los patrones de datos pueden ser irregulares.
- Datasets con arrival intervals variables, como logs o eventos en tiempo real.
- Workloads sin tendencias claras, como datos de sensores o métricas estables.
Detalles técnicos
Modo de observación mejorado
El nuevo observation mode en AWS Glue Data Quality implementa un algoritmo que:
- Usa una línea base constante en lugar de extrapolar tendencias lineales. Esto evita que el sistema interprete variaciones aleatorias como anomalías.
- Maneja intervalos de datos irregulares sin asumir una frecuencia fija. Por ejemplo, si un job ETL se ejecuta todos los lunes y miércoles, el algoritmo no esperará datos los martes y jueves.
- Reduce falsos positivos en datasets con patrones planos o aleatorios. AWS reporta que este modo es especialmente efectivo para estos casos, donde los métodos basados en tendencias generaban alertas espurias.
Integración con jobs ETL
La detección de anomalías gratis se activa automáticamente para todos los jobs ETL de Glue (basados en Spark) cuando:
- El job tiene asociado un Data Quality baseline (definido previamente).
- El job escribe datos en Amazon S3, Amazon Redshift, o JDBC targets (como Aurora, RDS).
No se requiere cambio en el código del job. Las anomalías se registran en:
- CloudWatch Metrics: Métricas
DataQualityRuleEvaluationcon dimensiónAnomalyDetection. - AWS Glue run logs: Detalles en los logs del job.
- EventBridge: Eventos de tipo
Glue Data Quality Rule Evaluationpara integración con sistemas de alerta.
Limitaciones y consideraciones
- La detección gratis solo aplica a jobs ETL. Para ad hoc checks usando la API
BatchGetDataQualityResults, sí hay costos (USD 0.10 por cada 100 evaluaciones). - El nuevo modo de observación está disponible al crear o editar un baseline en la consola de AWS Glue o via AWS CLI/SDK.
- El algoritmo de línea base constante puede no ser óptimo para datasets con tendencias claras (ej.: crecimiento mensual). En esos casos, el modo Trend (existente) sigue siendo recomendable.
Qué deberían hacer los administradores y equipos técnicos
1. Habilitar la detección de anomalías en jobs existentes
Para jobs ETL con baselines configurados:
- No es necesario hacer nada. La detección de anomalías ahora es gratis y se activará automáticamente.
- Verificar que los baselines estén actualizados. Usar la consola de AWS Glue o el CLI:
aws glue get-data-quality-baseline id --baseline-id <baseline_id>
2. Configurar el nuevo modo de observación
Para datasets con patrones irregulares:
- Crear un nuevo baseline o editar uno existente con el modo Observation:
aws glue put-data-quality-baseline \
--baseline-id my-observation-baseline \
--baseline-config '{
"DataQualityBaselineConfig": {
"AnomalyDetectionConfiguration": {
"AnomalyDetectionMode": "OBSERVATION",
"Thresholds": {
"RowConditionExpression": "COUNT(*) < 100",
"ValueExpression": "COLUMN_COUNT - EXPECTED_COLUMN_COUNT = 0"
}
},
"BaselineTable": {
"TableName": "my-table",
"DataCatalogType": "CATALOG"
}
}
}'
- Aplicar el baseline a los jobs relevantes via la propiedad
DataQualityConfigen el job.
3. Monitorear anomalías
- CloudWatch: Crear alarmas en la métrica
DataQualityRuleEvaluationcon filtroAnomalyDetection = "FAILED". Ejemplo:
aws cloudwatch put-metric-alarm \
--alarm-name "Glue Data Quality Anomalies" \
--metric-name "DataQualityRuleEvaluation" \
--namespace "AWS/Glue" \
--statistic "Sum" \
--period 300 \
--threshold 1 \
--comparison-operator "GreaterThanOrEqualToThreshold" \
--evaluate-on-low-resolution-samples \
--alarm-actions <arn-del-sns-topic>
- EventBridge: Configurar una regla para enviar anomalías a un canal de Slack o ticketing system:
{
"source": ["aws.glue"],
"detail-type": ["Glue Data Quality Rule Evaluation"],
"detail": {
"findings": {
"anomalyDetection": { "exists": true }
}
}
}
4. Evaluar el modo adecuado para cada dataset
- Usar Observation mode para:
– Jobs con schedules variables (ej.: trigger-based).
– Análisis exploratorios en notebooks.
- Usar Trend mode (default) para datasets con tendencias claras (ej.: crecimiento mensual).
Conclusión
La actualización de AWS Glue Data Quality elimina una barrera clave para el monitoreo universal de la calidad de datos en pipelines ETL: el costo. Al mismo tiempo, el nuevo modo de observación mejora la precisión de las alertas, reduciendo el tiempo que los equipos dedican a filtrar falsos positivos. Para los equipos de DevOps y cloud, esto significa poder implementar controles de calidad de datos de manera más completa y eficiente, con un impacto directo en la confiabilidad de los flujos de datos. La integración nativa con CloudWatch y EventBridge facilita la incorporación de estas alertas en los sistemas de monitoreo existentes.