Calculadora de potencia estadística para Feature Store

Esta calculadora aproxima la potencia estadística de una comparación entre dos proporciones relacionadas con un Feature Store, por ejemplo la tasa de lecturas correctas antes y después de un cambio o entre dos estrategias de serving. La potencia expresa la probabilidad aproximada de detectar una diferencia del tamaño especificado cuando esa diferencia realmente existe.

Puede utilizarse para comprobar si un experimento o una validación tendrá suficiente sensibilidad antes de ejecutarlo. El cálculo emplea una aproximación normal para dos grupos independientes de igual tamaño; no representa diseños pareados, pruebas secuenciales ni estructuras con observaciones agrupadas.

Supuestos de la comparación

%
%
casos
Resultado
potencia aproximada
Diferencia absoluta
Error estándar de la diferencia
z crítico bilateral

1. Introduce la tasa de referencia
Usa la proporción esperada en la versión actual o grupo de control.

2. Define la tasa alternativa
Indica la proporción que te interesa poder distinguir como efecto real.

3. Añade la muestra por grupo
Introduce el mismo número de observaciones para cada grupo; este modelo no ajusta tamaños desiguales.

4. Selecciona alfa
Elige el nivel de significación bilateral. Un alfa más pequeño exige más evidencia y reduce la potencia a igualdad de muestra.

5. Revisa la potencia
Utiliza el porcentaje como una aproximación para comparar diseños, no como garantía del resultado de un experimento concreto.

Se aproxima una prueba bilateral para la diferencia entre dos proporciones independientes:

EE = √(p₁(1−p₁)/n + p₂(1−p₂)/n)
μz = |p₂ − p₁| / EE
Potencia ≈ Φ(−zα/2 − μz) + 1 − Φ(zα/2 − μz)

Φ es la función de distribución normal estándar. La aproximación funciona mejor con muestras moderadas o grandes y tasas no extremadamente cercanas a 0 o 1.

Qué significa el resultado

Una potencia del 80 % indica que, bajo estos supuestos, el diseño detectaría aproximadamente 8 de cada 10 veces una diferencia igual a la especificada usando el umbral alfa elegido.

La potencia real puede cambiar si las observaciones no son independientes, si hay múltiples comparaciones o si el efecto real difiere del supuesto.

Datos: 92 % frente a 95 %, 500 observaciones por grupo y alfa 0,05.

Cálculo: EE = √(0,92×0,08/500 + 0,95×0,05/500) ≈ 0,01557. La diferencia es 0,03, por lo que μz ≈ 1,927. Con z crítico ≈ 1,96, la potencia bilateral aproximada ronda el 48,7 %.

Resultado: potencia aproximada del 49 %.

Interpretación: con estos supuestos, 500 observaciones por grupo ofrecen sensibilidad limitada para detectar una mejora de 3 puntos porcentuales.

¿Qué nivel de potencia debería buscar?

No existe un valor universal para todos los casos. El umbral debe decidirse según el coste de la muestra, el riesgo de pasar por alto un efecto relevante y el contexto del experimento.

¿Por qué la diferencia entre las tasas importa tanto?

Los efectos pequeños son más difíciles de distinguir del ruido muestral. Para mantener la misma potencia al reducir el efecto mínimo, normalmente se necesita una muestra mayor.

¿Puedo usar tamaños de grupo diferentes?

Esta implementación supone tamaños iguales. Para grupos desiguales conviene usar una fórmula o software que modele cada tamaño por separado.

¿Sirve para métricas continuas como latencia media?

No directamente. Esta versión está formulada para proporciones; métricas continuas requieren una prueba basada en medias y una estimación de variabilidad.

¿La potencia calculada garantiza significación estadística?

No. La potencia es una probabilidad bajo supuestos previos; un experimento concreto puede resultar significativo o no significativo.