Calculadora de potencia estadística para calidad de datos

Esta calculadora estima la probabilidad de detectar una diferencia entre dos tasas de calidad de datos cuando esa diferencia existe realmente. Puede emplearse para planificar la comparación de una regla de validación antes y después de una limpieza, una migración, un cambio de proveedor o dos fuentes de datos independientes.

Introduce la tasa de calidad esperada en cada grupo, el tamaño de muestra por grupo y el nivel de significación. La salida ayuda a valorar si la auditoría tiene sensibilidad suficiente para una mejora o deterioro que sea importante para el negocio. El modelo es una aproximación normal para dos proporciones independientes con tamaños iguales y prueba bilateral. Si analizas los mismos registros antes y después, grupos correlacionados o múltiples reglas a la vez, necesitas un diseño estadístico diferente.

Datos de entrada

%
%
Resultado
Potencia estadística aproximada
Diferencia de calidad
Señal estandarizada
Nivel de significación
Registros totales

1. Establece la calidad de referencia
Introduce la proporción esperada de registros que cumplen la regla en el grupo base.

2. Define el cambio relevante
Escribe la tasa alternativa que deseas poder detectar.

3. Indica la muestra por grupo
Usa el número de registros independientes que revisarás en cada condición.

4. Selecciona alfa
El nivel de significación controla el umbral de evidencia para una prueba bilateral.

5. Ajusta el diseño
Si la potencia es baja, prueba una muestra mayor o reconsidera el efecto mínimo que realmente necesitas detectar.

Fórmula principal:

p̄ = (p₁ + p₂) / 2
SE₀ = √[2p̄(1−p̄)/n]
SE₁ = √[(p₁(1−p₁)+p₂(1−p₂))/n]
Potencia ≈ Φ[(|p₂−p₁| − zα/2·SE₀) / SE₁]

Variables:

  • p₁: tasa de calidad del grupo base
  • p₂: tasa de calidad del grupo alternativo
  • n: registros por grupo
  • zα/2: valor crítico bilateral
  • Φ: distribución acumulada normal estándar

Supuestos: Se asumen grupos independientes, tamaños iguales y observaciones independientes dentro de cada grupo. Con tasas extremas, muestras pequeñas o datos agrupados, la aproximación puede ser insuficiente.

Qué significa el resultado

La potencia indica la probabilidad aproximada de obtener un resultado significativo si la diferencia entre las dos tasas introducidas es real.

Una diferencia estadísticamente detectable no siempre es relevante operativamente; define antes el cambio mínimo que justifica actuar.

Datos:

  • Calidad base: 92 %
  • Calidad alternativa: 96 %
  • 600 registros por grupo
  • α = 5 %

Cálculo:
La diferencia absoluta es 0,04. Se calculan los errores estándar bajo hipótesis nula y alternativa y se aplica el umbral bilateral z ≈ 1,96.

Resultado:
Potencia aproximada ≈ 83 % (sujeta a redondeo).

Interpretación:
Con 600 registros por grupo, el diseño tiene una probabilidad relativamente alta de detectar una mejora de 4 puntos porcentuales bajo este modelo.

¿Por qué una mejora pequeña necesita más muestra?

Porque una diferencia pequeña es más difícil de distinguir del ruido de muestreo. Para mantener la misma potencia, normalmente hay que aumentar n.

¿Puedo comparar 99 % frente a 99,5 %?

Sí, pero las proporciones tan cercanas al extremo pueden requerir una muestra grande y la aproximación normal puede ser menos precisa. Considera métodos exactos o simulación si la decisión es crítica.

¿Qué pasa si comparo los mismos registros antes y después?

Los grupos no son independientes. Un análisis pareado puede aprovechar esa relación y tendrá una fórmula de potencia distinta.

¿Reducir alfa siempre es mejor?

Reduce el riesgo de falso positivo, pero también puede disminuir la potencia con el mismo tamaño de muestra. Es un equilibrio que depende del coste de ambos tipos de error.

¿Qué diferencia hay entre esta calculadora y la de tamaño de muestra de calidad?

Esta calcula sensibilidad para detectar una diferencia entre dos tasas. La de tamaño de muestra estima cuántos registros revisar para medir una sola tasa con un margen de error objetivo.