Calculadora de potencia estadística para etiquetado de datos

Esta calculadora aproxima la potencia estadística de una comparación entre dos tasas de calidad de etiquetado, por ejemplo la exactitud obtenida con dos guías, proveedores o flujos de revisión. Introduce las proporciones que quieres distinguir, el tamaño de muestra por grupo y el nivel alfa para estimar la probabilidad de detectar esa diferencia si realmente existe.

La herramienta resulta útil al planificar una evaluación comparativa antes de invertir en una auditoría grande. Utiliza una aproximación normal para dos proporciones independientes con igual número de observaciones. Si los mismos ejemplos son etiquetados por ambos métodos, existe emparejamiento y se requiere un análisis distinto que aproveche esa dependencia.

Diseño de la comparación

%
%
etiquetas
Resultado
potencia aproximada
Diferencia absoluta
Error estándar de la diferencia
z crítico bilateral

1. Introduce la calidad de referencia
Añade la tasa esperada del grupo A según la métrica binaria que vayas a evaluar.

2. Define la alternativa relevante
Indica la tasa del grupo B que representaría una diferencia suficientemente importante para detectar.

3. Especifica la muestra
Introduce el número de etiquetas independientes que revisarás en cada grupo.

4. Selecciona alfa
Un alfa más estricto reduce la probabilidad de falso positivo, pero también disminuye la potencia con la misma muestra.

5. Evalúa el diseño
Si la potencia es baja, prueba con una muestra mayor o reconsidera el efecto mínimo que necesitas detectar.

Para dos proporciones independientes con n igual por grupo:

EE = √(pA(1−pA)/n + pB(1−pB)/n)
μz = |pB − pA| / EE
Potencia ≈ Φ(−zα/2 − μz) + 1 − Φ(zα/2 − μz)

La fórmula es una aproximación normal bilateral y no incluye correcciones por comparaciones múltiples ni efectos de agrupamiento por anotador o lote.

Qué significa el resultado

La potencia resume la sensibilidad del diseño frente a la diferencia especificada. Un porcentaje mayor implica una mayor probabilidad de detectar ese efecto con el criterio alfa elegido.

Si ambos grupos se evalúan sobre los mismos ejemplos, trata el diseño como pareado en lugar de asumir independencia.

Datos: 88 % frente a 93 %, 300 etiquetas por grupo y alfa 0,05.

Cálculo: EE = √(0,88×0,12/300 + 0,93×0,07/300) ≈ 0,02385. La diferencia es 0,05, por lo que μz ≈ 2,096. Con z crítico ≈ 1,96, la potencia bilateral aproximada es cercana al 55,4 %.

Resultado: potencia aproximada del 55 %.

Interpretación: con 300 etiquetas por grupo, el diseño todavía tiene una probabilidad importante de no detectar una mejora real de 5 puntos porcentuales.

¿Qué significa una potencia del 55 %?

Bajo los supuestos introducidos, el procedimiento detectaría una diferencia de ese tamaño en algo más de la mitad de repeticiones hipotéticas. No es la probabilidad de que una hipótesis concreta sea verdadera.

¿Puedo comparar dos proveedores que etiquetan los mismos ejemplos?

Sí, pero esta fórmula no es la adecuada porque las observaciones quedan emparejadas por ejemplo. Un análisis pareado puede tener distinta variabilidad y potencia.

¿La métrica puede ser F1 en lugar de exactitud?

No con esta formulación simple. F1 no es una proporción binomial directa y su potencia suele evaluarse mediante métodos específicos o simulación.

¿Por qué un alfa de 0,01 reduce la potencia?

Porque exige una evidencia más extrema para declarar una diferencia. Con el mismo efecto y muestra, ese umbral más estricto hace más difícil superar el criterio.

¿Cómo puedo aumentar la potencia sin cambiar el efecto esperado?

La opción más directa es aumentar el tamaño de muestra. También ayuda reducir variabilidad mediante un diseño apropiado, por ejemplo usando comparación pareada cuando corresponda.