Estimador de tamaño de muestra para canalizaciones de datos

Este estimador calcula cuántos registros conviene revisar para estimar una proporción en una canalización de datos con un margen de error objetivo. Puede aplicarse a controles como registros válidos, transformaciones correctas, entregas completas o eventos que cumplen una regla de calidad, siempre que cada elemento pueda clasificarse como cumple/no cumple.

El cálculo parte del nivel de confianza, el margen de error aceptable y una proporción esperada. También permite indicar el tamaño total de la población para aplicar una corrección por población finita; si la población es muy grande, el resultado converge al tamaño de muestra para población prácticamente infinita. Es una guía estadística y no sustituye un diseño de muestreo: sesgos de selección, agrupaciones por lote o dependencia entre registros pueden exigir un método más específico.

Datos de entrada

%
%
Resultado
Tamaño de muestra recomendado
Muestra sin corrección
Corrección por población
Fracción de muestreo
Nivel de confianza

1. Define la población
Indica cuántos registros forman el universo que quieres auditar. Usa 0 si quieres tratarla como muy grande o desconocida.

2. Fija el margen de error
Introduce la diferencia máxima en puntos porcentuales que aceptarías entre la muestra y la proporción poblacional.

3. Estima la proporción
Si no tienes una referencia previa, 50 % produce el tamaño de muestra más conservador en este modelo.

4. Elige la confianza
Selecciona el nivel de confianza estadística deseado.

5. Redondea hacia arriba
La calculadora devuelve un entero y aplica corrección por población finita cuando has indicado un tamaño de población.

Fórmula principal:

n₀ = z² × p × (1 − p) / e²
n = n₀ / [1 + (n₀ − 1) / N]

Variables:

  • n₀: tamaño de muestra para una población muy grande
  • n: tamaño de muestra ajustado
  • z: valor crítico del nivel de confianza
  • p: proporción esperada, entre 0 y 1
  • e: margen de error en forma decimal
  • N: tamaño de la población; la corrección se omite si se usa 0

Supuestos: El modelo presupone un muestreo aleatorio simple y una variable binaria. Registros agrupados por lotes, particiones o fuentes correlacionadas pueden requerir un efecto de diseño o muestreo estratificado.

Qué significa el resultado

El resultado es el número aproximado de registros que habría que revisar para alcanzar el margen y la confianza indicados bajo los supuestos del modelo.

Aumenta la muestra si esperas exclusiones, registros no evaluables o dependencia importante entre observaciones.

Datos:

  • Población: 100.000 registros
  • Confianza: 95 %
  • Margen de error: 3 %
  • Proporción esperada: 50 %

Cálculo:
n₀ = 1,96² × 0,5 × 0,5 / 0,03² ≈ 1.067,1.
n = 1.067,1 / [1 + (1.066,1 / 100.000)] ≈ 1.055,8.

Resultado:
Tamaño recomendado = 1.056 registros.

Interpretación:
Una revisión aleatoria de unos 1.056 registros permite estimar la proporción con ±3 puntos porcentuales aproximadamente al 95 %.

¿Qué pongo si no conozco la proporción esperada?

Usar 50 % es una opción conservadora para una proporción binaria porque maximiza p(1−p) y, con ello, el tamaño de muestra.

¿Qué significa introducir población 0?

La calculadora omite la corrección por población finita y usa el tamaño de muestra para una población muy grande o no especificada.

¿Puedo muestrear solo los registros que llegan al final del pipeline?

Sí si esa es exactamente la población que quieres describir. Si quieres detectar fallos en etapas anteriores, la muestra debe representar también esos registros o cada etapa por separado.

¿El muestreo aleatorio siempre es suficiente?

No. Si los datos están agrupados por fecha, fuente, cliente o lote, un muestreo estratificado o por conglomerados puede ser más apropiado.

¿En qué se diferencia del cálculo de potencia estadística?

El tamaño de muestra aquí se fija para estimar una proporción con cierto margen de error. La potencia se centra en la probabilidad de detectar una diferencia o efecto concreto.