Calculadora de intervalo de confianza para etiquetado de datos

Esta calculadora estima un intervalo de confianza para una proporción observada en una muestra de etiquetado, como la tasa de acuerdo entre revisores o la proporción de etiquetas consideradas correctas. A partir del tamaño de la muestra, el porcentaje observado y el nivel de confianza elegido, muestra un rango plausible para la proporción real del conjunto del que procede la muestra.

Resulta útil al auditar lotes de anotaciones, comparar proveedores o decidir si una revisión manual ofrece suficiente precisión estadística. El intervalo no demuestra que todas las etiquetas sean correctas: cuantifica la incertidumbre muestral bajo una aproximación normal para una proporción. Si la muestra es pequeña o el porcentaje está muy cerca de 0 % o 100 %, conviene interpretar el resultado con más cautela y considerar métodos binomiales más exactos.

Datos de entrada

%
Resultado
intervalo estimado
Límite inferior
Límite superior
Margen de error

1. Indica cuántas etiquetas se revisaron
Introduce el número de observaciones independientes incluidas en la auditoría.

2. Añade la proporción observada
Escribe el porcentaje de acuerdo, acierto u otra condición binaria que quieras estimar.

3. Elige el nivel de confianza
Un nivel mayor produce un intervalo más amplio porque exige más cobertura estadística.

4. Revisa el intervalo
El resultado principal muestra los límites inferior y superior; el margen de error aparece por separado.

Se utiliza la aproximación normal para una proporción:

IC = p ± z × √(p × (1 − p) / n)

Donde: p es la proporción observada en forma decimal, n es el número de etiquetas revisadas y z es el valor crítico del nivel de confianza (1,645; 1,96; 2,576). Los límites se restringen al rango 0 %–100 %.

Qué significa el resultado

Un intervalo más estrecho indica menor incertidumbre muestral sobre la proporción observada.

La aproximación normal puede ser poco adecuada con muestras pequeñas o proporciones extremas; en esos casos, un intervalo binomial exacto o de Wilson puede ser preferible.

Datos:

  • 500 etiquetas revisadas
  • 92 % de acuerdo observado
  • 95 % de confianza

Cálculo:
p = 0,92; error estándar = √(0,92 × 0,08 / 500) ≈ 0,01213; margen = 1,96 × 0,01213 ≈ 0,02378.

Resultado:
IC ≈ 92 % ± 2,38 %, es decir, de 89,62 % a 94,38 %.

Interpretación:
Con estos datos, el rango estimado para la proporción real se sitúa aproximadamente entre 89,62 % y 94,38 %.

¿Qué representa exactamente el intervalo?

Es un rango calculado a partir de la muestra y del nivel de confianza. No significa que cada etiqueta dentro del lote tenga esa probabilidad de ser correcta.

¿Puedo usar la tasa de acuerdo entre dos anotadores?

Sí, si la conviertes en una proporción de casos con acuerdo sobre el total revisado. Ten en cuenta que el acuerdo bruto no corrige el acuerdo esperado por azar.

¿Qué nivel de confianza conviene elegir?

El 95 % es una opción habitual, pero no universal. Un nivel de confianza más alto aumenta el margen de error si el tamaño de la muestra no cambia.

¿Qué ocurre si obtengo 0 % o 100 %?

La aproximación normal puede producir una incertidumbre poco realista en los extremos. Para esos casos suele ser más apropiado un método binomial específico.

¿En qué se diferencia de una calculadora de tamaño de muestra?

Aquí partes de una muestra ya observada para estimar un rango. Una calculadora de tamaño de muestra hace el proceso inverso: estima cuántas observaciones necesitas para un margen de error objetivo.