Calculadora de potencia estadística para precisión de pronósticos

Esta calculadora estima la potencia estadística de una comparación bilateral entre dos medias de una métrica de error de pronóstico. Parte de una diferencia media que se considera relevante, una desviación estándar común aproximada y un mismo número de observaciones por grupo para calcular la probabilidad de detectar esa diferencia.

Puede ayudar a planificar evaluaciones entre modelos, versiones o procesos de forecasting cuando los casos se tratan como dos grupos independientes. La potencia aumenta al crecer la muestra o la diferencia esperada y disminuye cuando la variabilidad es mayor o el nivel alfa es más estricto. Si ambos modelos se evalúan exactamente sobre los mismos periodos, un análisis emparejado suele ser más eficiente; esta herramienta no explota esa correlación y debe interpretarse como una aproximación conservadora o de diseño independiente.

Diferencia, variabilidad y tamaño de evaluación

p.p.
p.p.
Resultado
potencia estadística aproximada
Error estándar de la diferencia
Diferencia estandarizada
z crítico
Error tipo II aproximado

1. Define la mejora relevante
Introduce la diferencia media, en puntos de la métrica, que quieres ser capaz de detectar.

2. Estima la variabilidad
Usa una desviación estándar común representativa de los errores individuales.

3. Indica la muestra por grupo
Introduce el número de observaciones independientes disponibles para cada modelo o escenario.

4. Selecciona alfa
El nivel bilateral determina el umbral crítico. Un alfa menor reduce falsos positivos, pero también la potencia para una muestra fija.

5. Interpreta la potencia
El resultado aproxima la probabilidad de detectar la diferencia especificada si realmente existe con esos parámetros.

Fórmula principal:

SE_dif = σ × √(2/n); δ = Δ / SE_dif; potencia ≈ P(|Z| > zα/2 | media de Z = δ)

Variables:

  • Δ: diferencia media esperada entre los grupos.
  • σ: desviación estándar común de la métrica.
  • n: observaciones por grupo, suponiendo tamaños iguales.
  • δ: diferencia estandarizada en unidades del error estándar.

Supuestos: Se supone una comparación de dos grupos independientes, igual tamaño y desviación estándar común. Para datos emparejados debe utilizarse la desviación estándar de las diferencias.

Qué significa el resultado

La potencia expresa la probabilidad aproximada de superar el umbral estadístico bilateral cuando la diferencia verdadera coincide con la diferencia esperada introducida.

No interpreta si una mejora es útil para el negocio. La significación estadística y la relevancia práctica deben evaluarse por separado.

Datos:

  • Diferencia esperada: 3 puntos
  • Desviación estándar: 10 puntos
  • 100 observaciones por grupo
  • α = 0,05 bilateral

Cálculo:
SE = 10 × √(2/100) ≈ 1,414. δ = 3 / 1,414 ≈ 2,121. Con z crítico 1,96, la potencia bilateral aproximada es cercana al 56 %.

Resultado:
Potencia aproximada ≈ 56 %.

Interpretación:
Con esta muestra y variabilidad, una mejora de 3 puntos todavía tiene una probabilidad moderada, no alta, de ser detectada al 5 % bilateral.

¿Qué diferencia debo introducir?

Usa la mejora mínima que sería relevante para la decisión, no necesariamente la diferencia que esperas observar por optimismo.

¿Puedo usar RMSE, MAE o MAPE?

Sí, siempre que la diferencia y la desviación estándar estén en la misma unidad de la métrica y tenga sentido comparar sus medias.

¿Qué cambia si evalúo ambos modelos sobre los mismos periodos?

Entonces los resultados están emparejados y la correlación entre modelos importa. Una prueba pareada basada en las diferencias suele requerir menos muestra que el diseño independiente modelado aquí.

¿Una potencia alta garantiza una diferencia significativa?

No. La potencia es una probabilidad previa al resultado bajo un efecto supuesto; una realización concreta puede o no resultar significativa.

¿Qué puedo hacer si la potencia es baja?

Aumentar la muestra, reducir la variabilidad mediante un diseño más controlado o replantear cuál es la diferencia mínima relevante. Relajar alfa también aumenta potencia, pero cambia el riesgo de falso positivo.