Estimador de tamaño de muestra para etiquetado de datos

Este estimador calcula el tamaño de muestra necesario para auditar una proporción en un proyecto de etiquetado de datos, como la tasa de etiquetas correctas, el cumplimiento de una guía o la fracción de ejemplos que necesitan adjudicación. Introduce la precisión deseada, el nivel de confianza y una proporción esperada para obtener un número mínimo aproximado de elementos a revisar.

Sirve para planificar controles de calidad sin revisar el conjunto completo. Si no hay información histórica sobre la tasa esperada, usar 50 % produce la muestra más conservadora con esta fórmula. El cálculo presupone una muestra aproximadamente aleatoria; una selección basada solo en casos fáciles o en un único anotador puede dar una impresión demasiado optimista de la calidad.

Plan de auditoría

%
%
Resultado
etiquetas a auditar como mínimo
Valor crítico z
Proporción esperada
Margen en decimal

1. Define la métrica de calidad
Antes de muestrear, decide qué condición contará como éxito: etiqueta correcta, acuerdo con adjudicación u otro criterio verificable.

2. Elige el margen
Indica cuánta incertidumbre, en puntos porcentuales, estás dispuesto a aceptar alrededor de la proporción estimada.

3. Selecciona la confianza
Escoge 90 %, 95 % o 99 % según el nivel de cobertura deseado.

4. Añade una tasa esperada
Usa resultados anteriores o un piloto. Si no tienes una referencia, 50 % es una opción conservadora.

5. Planifica reemplazos
El resultado es un mínimo teórico; añade margen operativo si algunas muestras pueden ser inválidas o no revisables.

Para una proporción y población grande:

n = z² × p × (1 − p) / e²

p es la proporción esperada, e el margen de error absoluto y z el valor crítico. Todos se usan en forma decimal salvo n, que se redondea hacia arriba.

Qué significa el resultado

El resultado es el número aproximado de etiquetas que habría que auditar para lograr la precisión indicada bajo un muestreo independiente y representativo.

Cuando las etiquetas están agrupadas por tarea, anotador, documento o conversación, puede ser necesario un diseño de muestreo que tenga en cuenta esa estructura.

Datos: calidad esperada del 90 %, margen de ±4 puntos porcentuales y 95 % de confianza.

Cálculo: n = 1,96² × 0,90 × 0,10 / 0,04² = 216,09.

Resultado: se redondea a 217 etiquetas.

Interpretación: con estos supuestos, auditar al menos 217 elementos proporciona la precisión objetivo aproximada para estimar la proporción de calidad.

¿Debo muestrear por anotador?

Si quieres estimar una tasa global, la muestra debería representar la mezcla real de anotadores y tareas. Para evaluar a cada anotador por separado necesitarás muestras específicas por persona o grupo.

¿Puedo usar la tasa de acuerdo entre anotadores como proporción esperada?

Solo si esa es realmente la métrica que deseas estimar. Acuerdo y exactitud frente a una referencia son conceptos distintos y pueden requerir diseños de evaluación diferentes.

¿Qué ocurre si la proporción real es muy distinta de la esperada?

La precisión obtenida puede diferir de la prevista. Usar 50 % cuando no hay una estimación fiable evita subestimar la muestra en esta fórmula.

¿La muestra debe ser aleatoria?

Idealmente debe ser probabilística o, al menos, representativa del universo que quieres describir. Sesgos de selección pueden dominar el error aunque el tamaño sea grande.

¿Cuándo necesito más que este cálculo simple?

Cuando hay múltiples clases, fuerte agrupamiento, prevalencias muy desiguales o métricas complejas como kappa, F1 o IoU, conviene diseñar la muestra específicamente para esa métrica.