Estimador de tasa de error para canalizaciones de datos

Este estimador resume la frecuencia de errores de una canalización de datos a partir de dos recuentos básicos: registros procesados y registros que han fallado el criterio definido. El fallo puede representar una transformación inválida, un rechazo de esquema, una entrega perdida o cualquier otra condición binaria que tu observabilidad registre de forma consistente.

Además de la tasa porcentual, la herramienta muestra la tasa de éxito y los errores por millón de registros, una escala útil cuando los fallos son poco frecuentes. La métrica describe frecuencia, no severidad: dos pipelines con la misma tasa pueden tener impactos muy distintos si uno pierde campos críticos y otro solo genera advertencias recuperables. Para decisiones operativas, acompaña el porcentaje con categorías de error, volumen y consecuencias.

Datos de entrada

Resultado
Tasa de error de la canalización
Tasa de éxito
Errores por millón
Registros correctos
Registros con error

1. Fija una definición de fallo
Decide qué estados cuentan como error y evita mezclar advertencias o reintentos exitosos si no forman parte del mismo indicador.

2. Introduce el volumen total
Usa el número de registros que realmente atravesó el tramo del pipeline que estás midiendo.

3. Añade los registros fallidos
Escribe el recuento de errores aplicando la definición anterior.

4. Revisa varias escalas
Consulta porcentaje, tasa de éxito y errores por millón para facilitar comparaciones con tasas muy bajas.

5. Segmenta si hace falta
Si la tasa agregada oculta diferencias entre fuentes, particiones o tipos de error, calcula cada segmento por separado.

Fórmula principal:

Tasa de error (%) = errores / registros procesados × 100
Errores por millón = errores / registros procesados × 1.000.000

Variables:

  • errores: registros que cumplen la definición de fallo
  • registros procesados: volumen total evaluado en el mismo ámbito

Supuestos: El numerador debe ser un subconjunto del denominador y cada registro debe contar una sola vez para el indicador. Si un registro genera varios eventos de error, decide previamente si la métrica es por registro o por evento.

Qué significa el resultado

La tasa expresa la frecuencia de registros fallidos dentro del volumen procesado.

Para fiabilidad de servicio, complementa esta métrica con latencia, tiempo de recuperación, reintentos y severidad de los fallos.

Datos:

  • 2.500.000 registros procesados
  • 3.250 registros con error

Cálculo:
Tasa = 3.250 / 2.500.000 × 100 = 0,13 %.
Errores por millón = 3.250 / 2.500.000 × 1.000.000 = 1.300.

Resultado:
Tasa de error = 0,13 %; 1.300 errores por millón.

Interpretación:
El pipeline falla aproximadamente 13 de cada 10.000 registros bajo la definición aplicada.

¿Debo contar reintentos como errores separados?

Depende de la unidad de análisis. Si tu métrica es por registro, cuenta el resultado final de cada registro una sola vez; si es por intento, el denominador también debe ser intentos.

¿Qué hago con registros descartados intencionadamente?

No los trates como error salvo que incumplan el comportamiento esperado. Mantén una categoría separada si los descartes válidos forman parte de la lógica del pipeline.

¿Por qué mostrar errores por millón?

Cuando la tasa es muy pequeña, una escala por millón hace más intuitiva la comparación sin depender de muchos decimales.

¿Puede la tasa ser superior al 100 %?

No si se mide por registros y cada registro se clasifica una sola vez. Un resultado mayor indicaría que estás contando eventos múltiples sobre un denominador de registros.

¿Cómo se relaciona con una SLO?

Una SLO puede fijar un objetivo máximo de fallos o mínimo de éxito. La calculadora proporciona la tasa observada que luego puedes comparar con ese objetivo, pero no define la SLO adecuada.