Estimador de tasa de error en etiquetado de datos

Este estimador calcula la tasa de error observada en una revisión de etiquetado de datos. Solo necesita el número total de etiquetas auditadas y cuántas de ellas se consideran incorrectas según el criterio de control de calidad utilizado. El resultado principal expresa los errores como porcentaje y también muestra la tasa de acierto y la relación de errores por cada 1.000 etiquetas revisadas.

Puede servir para comparar lotes, detectar degradaciones en un proceso de anotación o comunicar la calidad observada de una muestra de control. La cifra depende por completo de cómo se definió y verificó un “error”: una guía ambigua, desacuerdos entre revisores o una muestra poco representativa pueden cambiar la interpretación. Por eso conviene usar el mismo protocolo de auditoría cuando se comparan equipos, periodos o proveedores.

Datos de entrada

Resultado
tasa de error observada
Tasa de acierto
Errores por 1.000
Etiquetas correctas

1. Introduce el tamaño de la auditoría
Indica cuántas etiquetas se revisaron con un criterio de calidad definido.

2. Registra los errores encontrados
Cuenta solo los casos que el protocolo de revisión clasifica como incorrectos.

3. Comprueba que los errores no superen el total
El número de etiquetas incorrectas debe ser igual o menor que la muestra revisada.

4. Interpreta las tasas
Compara el porcentaje de error con la tasa de acierto y con los errores por cada 1.000 observaciones.

La tasa de error observada se calcula de forma directa:

Tasa de error (%) = etiquetas incorrectas / etiquetas revisadas × 100

La tasa de acierto es 100 % menos la tasa de error. Los errores por 1.000 se obtienen multiplicando la proporción de error por 1.000. Esta medida describe únicamente la muestra auditada y no añade por sí sola un intervalo de incertidumbre.

Qué significa el resultado

Una tasa menor indica menos etiquetas clasificadas como erróneas dentro de la muestra revisada.

Para extrapolar la tasa al conjunto completo conviene considerar el diseño de la muestra y, si procede, calcular también un intervalo de confianza.

Datos:

  • 1.200 etiquetas revisadas
  • 54 etiquetas incorrectas

Cálculo:
Tasa de error = 54 / 1.200 × 100 = 4,5 %. Tasa de acierto = 100 − 4,5 = 95,5 %. Errores por 1.000 = 0,045 × 1.000 = 45.

Resultado:
4,5 % de error; 95,5 % de acierto; 45 errores por cada 1.000 etiquetas.

Interpretación:
La auditoría encontró aproximadamente un error por cada 22 etiquetas revisadas.

¿Qué cuenta como error de etiquetado?

Depende de la guía de anotación y del protocolo de control de calidad. Antes de comparar tasas, utiliza la misma definición de error en todas las muestras.

¿Debo introducir todo el dataset o solo la muestra auditada?

Introduce únicamente las etiquetas que realmente se revisaron. Las etiquetas no inspeccionadas no deben contarse como correctas por defecto.

¿Una tasa de error baja garantiza buena calidad?

No necesariamente. Puede ocultar clases raras, errores sistemáticos o problemas que una muestra poco representativa no captó.

¿Puedo introducir cero errores?

Sí. El resultado observado será 0 %, aunque eso no demuestra que la tasa real del conjunto completo sea exactamente cero.

¿Cómo puedo comparar dos lotes?

Calcula cada lote con un criterio de auditoría equivalente y compara sus tasas. Si necesitas saber si la diferencia puede deberse al azar muestral, añade un análisis estadístico con intervalos o una prueba de proporciones.