Estimador de tamaño de muestra para calidad de datos

Este estimador calcula un tamaño de muestra para evaluar una proporción de calidad de datos, como registros completos, valores válidos, duplicados ausentes o filas que cumplen una regla concreta. Permite planificar una auditoría cuando revisar toda la población es costoso y necesitas un nivel de precisión estadística definido.

El usuario especifica el tamaño de la población, el margen de error, el nivel de confianza y una proporción esperada. El cálculo aplica la fórmula estándar de una proporción y, cuando la población es finita, reduce la muestra mediante la corrección correspondiente. La cifra solo cubre incertidumbre de muestreo aleatorio simple: si la calidad cambia mucho entre fuentes, países, fechas, tablas o segmentos, conviene estratificar la muestra para no ocultar focos de problemas.

Datos de entrada

%
%
Resultado
Registros que conviene revisar
Muestra sin corrección
Fracción de la población
Fallos esperados en la muestra
Nivel de confianza

1. Delimita la población
Define qué tabla, periodo o conjunto de registros quieres describir y anota su tamaño.

2. Elige un margen de error
Indica la precisión deseada en puntos porcentuales para la tasa de calidad.

3. Aporta una tasa esperada
Usa datos históricos si existen; 50 % es más conservador cuando no tienes ninguna referencia.

4. Selecciona la confianza
Escoge el nivel de confianza que corresponda al uso del resultado.

5. Planifica la selección
Toma la muestra de forma aleatoria o estratificada según la estructura real de los datos.

Fórmula principal:

n₀ = z² × p × (1 − p) / e²
n = n₀ / [1 + (n₀ − 1) / N]

Variables:

  • p: tasa de calidad esperada en forma decimal
  • e: margen de error objetivo en forma decimal
  • z: valor crítico del nivel de confianza
  • N: tamaño de la población
  • n: muestra ajustada y posteriormente redondeada hacia arriba

Supuestos: La fórmula está pensada para una proporción binaria y muestreo aleatorio simple. Si mides varias reglas simultáneamente o existen grupos con calidades muy distintas, el diseño de la auditoría puede necesitar muestras por estrato.

Qué significa el resultado

El tamaño resultante aproxima cuántos registros revisar para estimar la tasa de calidad con la precisión indicada.

No confundas precisión estadística con representatividad: una muestra grande pero sesgada sigue produciendo una estimación sesgada.

Datos:

  • Población: 50.000 registros
  • Tasa esperada: 95 %
  • Margen de error: 2 %
  • Confianza: 95 %

Cálculo:
n₀ = 1,96² × 0,95 × 0,05 / 0,02² ≈ 456,2.
Con corrección por N = 50.000, n ≈ 452,1.

Resultado:
Tamaño recomendado = 453 registros.

Interpretación:
Auditar unos 453 registros permite estimar una tasa cercana al 95 % con un margen aproximado de ±2 puntos porcentuales bajo los supuestos del modelo.

¿Por qué una tasa esperada del 50 % pide más muestra que 95 %?

Porque la varianza p(1−p) es máxima en 50 %. Cuando la proporción esperada está cerca de 0 % o 100 %, el modelo necesita menos observaciones para el mismo margen absoluto.

¿Puedo usar una muestra para varias reglas de calidad?

Sí para exploración, pero cada regla puede tener una prevalencia distinta. Si necesitas precisión garantizada para todas, dimensiona la muestra según la condición más exigente.

¿Qué hago si hay varias fuentes de datos?

Si sospechas diferencias importantes, reparte la muestra por fuente o usa estratificación. Una muestra global puede estar dominada por la fuente con más volumen.

¿Debo redondear el tamaño de muestra?

Sí, siempre hacia arriba. No puedes revisar una fracción de registro y redondear hacia abajo reduciría ligeramente la precisión prevista.

¿Cómo se relaciona con la potencia estadística?

Este cálculo busca estimar una tasa con cierto margen. Una prueba de potencia busca detectar una diferencia específica entre dos tasas o condiciones.