TEORÍA DE ENCUESTAS · MUESTREO · INFERENCIA
GENERALIDADES SOBRE LA TEORÍA ESTADÍSTICA DE ENCUESTAS POR MUESTREO
Notas conceptuales y técnicas sobre diseño muestral, marcos, probabilidades de inclusión, inferencia basada en el diseño, no respuesta, error total de encuesta y estimación.
La teoría estadística de las encuestas por muestreo suele aprenderse como un conjunto de procedimientos: cómo seleccionar una muestra, cómo estimar un total o una media, cómo calcular un error estándar y cómo decidir un tamaño de muestra. Sin embargo, detrás de cada procedimiento hay una cuestión conceptual previa. ¿Qué es exactamente la población a la cual se pretende inferir? ¿Qué entidad se selecciona en cada etapa? ¿Qué hace que una selección sea probabilística? ¿De dónde proviene la aleatoriedad que permite hablar de precisión? ¿Qué parte del error de una encuesta puede ser cuantificada por el diseño muestral y qué parte procede de cobertura, no respuesta, medición o procesamiento?
Las notas que siguen se organizan a partir de problemas que aparecen en la literatura clásica de muestreo —en particular Cochran (1977), Kish (1965) y Lohr (2021)— y los desarrollan con herramientas de la teoría contemporánea de encuestas. El propósito no es sustituir la lectura de esos autores, sino explicitar las condiciones bajo las cuales sus afirmaciones adquieren sentido y las consecuencias operativas que de ellas se siguen. Cuando se introduce terminología más reciente, se recurre especialmente a Särndal, Swensson y Wretman (1992), Groves et al. (2009), Biemer y Lyberg (2003), las definiciones de AAPOR y las guías de Naciones Unidas, Statistics Canada y U.S. Census Bureau.
· · ·
1. En una encuesta, ¿los costos son altos y la administración es más compleja?
La respuesta depende necesariamente del término de comparación. Frente a un censo, una encuesta por muestreo suele ser más barata y administrativamente menos exigente porque observa sólo una parte de la población. Precisamente una de las razones históricas para el desarrollo del muestreo probabilístico fue obtener información suficientemente precisa con un costo muy inferior al de una enumeración completa.
Pero la comparación cambia si el referente es un procedimiento cualitativo de menor escala, como un grupo focal, una entrevista en profundidad o una observación intensiva. Una encuesta probabilística nacional puede requerir un marco, selección muestral, programación del instrumento, capacitación, supervisión, recontactos, ponderación, control de calidad, estimación de varianzas y documentación. Un grupo focal puede ser mucho menos costoso, pero tampoco cumple la misma función inferencial. La elección no debe hacerse preguntando cuál técnica es «más barata» en abstracto, sino qué técnica permite responder a la pregunta de investigación con el tipo de evidencia que se necesita.
Un grupo focal, por ejemplo, puede ser extraordinariamente útil para comprender vocabularios, categorías de sentido, mecanismos y problemas de comprensión de un cuestionario. No es, sin embargo, un sustituto directo de una encuesta probabilística cuando el objetivo es estimar parámetros de una población definida. El costo debe juzgarse, por tanto, en relación con el objetivo, la precisión requerida y el tipo de inferencia que se pretende realizar.
2. ¿Qué es una pregunta bidimensional o double-barreled?
Es una pregunta que solicita una sola respuesta respecto de dos o más proposiciones que podrían recibir respuestas diferentes. El problema no consiste en que el entrevistado tenga «dos opciones de respuesta»; casi toda pregunta cerrada las tiene. El problema consiste en que la redacción fusiona dos objetos de juicio y obliga al entrevistado a condensarlos en una única respuesta.
Por ejemplo:
¿Está satisfecho con su salario y con las condiciones de trabajo?
Una persona puede estar satisfecha con el salario y disconforme con las condiciones, o a la inversa. Si la escala ofrece una sola respuesta, no existe una interpretación unívoca del dato. La solución es separar los componentes cuando cada uno constituye una dimensión sustantivamente diferenciable.
Este problema muestra algo más general: un cuestionario no es un recipiente neutral al que se le «introducen» variables ya constituidas. La formulación concreta contribuye a determinar qué operación cognitiva realiza el entrevistado y, por consiguiente, qué dato termina registrándose. Por eso el diseño del instrumento forma parte de la medición y no es una tarea puramente editorial.
3. ¿Cuándo un cuestionario es demasiado largo?
No existe un número universal de preguntas o minutos a partir del cual un cuestionario se vuelva demasiado largo. La carga depende del modo de administración, la complejidad cognitiva de las preguntas, la sensibilidad de los temas, la población entrevistada, la necesidad de consultar registros, el número de saltos y la repetición de escalas, entre otros factores.
Una entrevista cara a cara puede tolerar una duración distinta de una entrevista telefónica o un cuestionario autoadministrado en línea. Del mismo modo, veinte preguntas que exigen recordar montos, fechas o episodios pueden imponer mayor carga que cincuenta ítems muy breves y homogéneos.
La prueba piloto es importante, pero conviene distinguirla del pretest cognitivo. Un piloto reproduce a menor escala procedimientos de campo y permite estudiar duración, tasas de contacto, saltos, funcionamiento logístico y problemas de implementación. Una entrevista cognitiva, en cambio, busca comprender cómo interpreta el entrevistado la pregunta, cómo recupera la información y cómo selecciona su respuesta. El U.S. Census Bureau incluye, además, pruebas de usabilidad, codificación de conducta, debriefing y diseños split-panel entre las herramientas de evaluación de cuestionarios.
Por ello, la regla metodológica no es «hacerlo lo más corto posible», sino conservar todo aquello que sea necesario para medir los conceptos definidos y eliminar aquello que introduce carga sin aportar información sustantiva. Brevedad y calidad no son sinónimos.
4. ¿Qué significa que un marco contenga duplicaciones?
Un marco de muestreo es el dispositivo operacional mediante el cual las unidades de muestreo pueden ser identificadas o alcanzadas para realizar la selección. A veces adopta la forma de una lista; otras veces consiste en áreas geográficas, direcciones, registros administrativos, números telefónicos potenciales o procedimientos que permiten generar las unidades seleccionables.
Una duplicación ocurre cuando una misma unidad de la población queda representada más de una vez en el mecanismo de selección. Si se seleccionan registros con igual probabilidad y una persona aparece dos veces, esa persona puede adquirir una probabilidad de inclusión mayor que otra que aparece una sola vez. Pero el problema no debe describirse diciendo que cualquier desigualdad de probabilidades vuelve «no aleatoria» la muestra. Existen diseños probabilísticos deliberadamente desiguales.
Lo importante es distinguir entre desigualdad diseñada y conocida y multiplicidad accidental o desconocida. Un marco puede presentar, entre otros problemas:
- subcobertura: unidades de la población objetivo que no pueden ser alcanzadas por el marco;
- sobrecobertura: registros que no pertenecen a la población objetivo;
- duplicados o multiplicidad;
- registros desactualizados;
- unidades que han cambiado de condición o ubicación;
- relaciones muchos-a-uno o uno-a-muchos entre registros y unidades objetivo.
La consecuencia estadística depende del mecanismo concreto de selección y de si la multiplicidad puede ser medida y corregida en las probabilidades de inclusión o en la ponderación.
5. ¿Qué significa editar datos y qué hacer con la no respuesta?
En el trabajo de encuestas, «editar» no debe entenderse como borrar observaciones que parezcan extrañas. La edición consiste en aplicar reglas explícitas de validez, consistencia y plausibilidad para identificar registros que requieren revisión. Una respuesta improbable no es automáticamente falsa y una respuesta incoherente no debe desaparecer sin dejar rastro.
Un flujo razonable conserva siempre la información bruta y separa etapas:
- dato capturado;
- validación de rango, tipo y estructura;
- verificación de saltos y consistencias lógicas;
- eventual recontacto, cuando sea posible y esté previsto;
- reglas documentadas de edición;
- marcación de valores faltantes;
- eventual imputación;
- producción de la base analítica, sin destruir la base original.
Supóngase que una sección del cuestionario sólo corresponde a hogares que declararon una determinada actividad económica. Si aparecen respuestas en esa sección para hogares que, según la pregunta filtro, no realizan dicha actividad, existen varias posibilidades: el filtro fue capturado incorrectamente, la respuesta posterior fue capturada incorrectamente, el entrevistador omitió el salto, la definición no fue comprendida o existe una situación real que el diseño no previó. El dato debe investigarse; no basta con declararlo «obviamente equivocado».
También es necesario distinguir estados que a menudo se mezclan bajo una sola etiqueta de valor faltante: No aplica, No sabe, No responde, rechazo explícito, ausencia de contacto, salto estructural, error de captura y valor perdido por procesamiento. «No aplica» no es simplemente otra forma de NS/NR: expresa que la pregunta no pertenece al universo lógico de esa unidad.
No respuesta de unidad y no respuesta de ítem
La no respuesta de unidad ocurre cuando no se obtiene información sustantiva de una unidad seleccionada; la no respuesta de ítem ocurre cuando existe entrevista, pero faltan respuestas particulares. La primera suele tratarse mediante ajustes de ponderación y la segunda puede requerir imputación u otros métodos, aunque las técnicas concretas dependen del mecanismo de ausencia y del objetivo analítico (Kalton y Kasprzyk, 1986).
Una tasa alta de no respuesta no implica mecánicamente que una variable sea inutilizable, del mismo modo que una tasa alta de respuesta no demuestra ausencia de sesgo. El sesgo de no respuesta depende de la relación entre la propensión a responder y las variables que se desean estimar.
AAPOR distingue, entre otras medidas, tasa de respuesta, tasa de cooperación, tasa de contacto y tasa de rechazo. No son sinónimos. La tasa de respuesta relaciona entrevistas obtenidas con el conjunto de casos elegibles —con variantes sobre cómo tratar elegibilidad desconocida y entrevistas parciales—; la cooperación condiciona sobre unidades contactadas; la tasa de contacto estudia el éxito del contacto; y la de rechazo cuantifica una forma específica de no respuesta.
Finalmente, el sondeo o probing del entrevistador debe ser estandarizado. El objetivo no es presionar hasta que «nunca quede una encuesta incompleta», sino facilitar una respuesta válida sin inducirla y respetar el consentimiento del participante.
6. Eficiencia, muestreo repetido e intervalos de confianza
Cochran plantea la teoría del muestreo como un problema conjunto de precisión y costo: diseñar procedimientos de selección y estimación que produzcan la exactitud necesaria al menor costo posible. La idea de fondo sigue siendo fundamental. No existe «el mejor» diseño fuera de un objetivo; existe un diseño más o menos eficiente para determinados estimandos, restricciones y costos.
La precisión de un procedimiento se estudia mediante su distribución bajo repeticiones hipotéticas del mecanismo de muestreo. En una perspectiva basada en el diseño, los valores de la población finita pueden considerarse fijos y la aleatoriedad procede del conjunto de muestras que el diseño podría haber seleccionado.
Aquí conviene precisar la interpretación de un intervalo de confianza. Si un procedimiento construye intervalos con nivel de confianza del 95%, eso no significa que 95 de cada 100 muestras producirán «valores similares» al valor observado en nuestra muestra. Significa que, bajo los supuestos del procedimiento y repitiendo hipotéticamente el diseño, aproximadamente el 95% de los intervalos construidos de esa manera contendrían el parámetro poblacional fijo.
Una vez observado un intervalo frecuentista concreto, el parámetro no se vuelve aleatorio por ese hecho. La aleatoriedad pertenece al procedimiento que habría producido otros intervalos bajo otras muestras posibles.
Tamaño de muestra para una proporción
En un planteamiento elemental bajo muestreo aleatorio simple, si se desea un margen de error aproximado \(e\) para una proporción con nivel asociado a \(z_{1-\alpha/2}\), puede partirse de
\[ n_0=\frac{z_{1-\alpha/2}^2\,p(1-p)}{e^2}. \]
Cuando no existe información previa útil sobre \(p\) y se busca un caso conservador, se utiliza \(p=0.5\) porque la función
\[ p(1-p) \]
alcanza su máximo en \(p=0.5\). Ésa es la razón matemática. No es una consecuencia del teorema central del límite.
Si la población es finita y la fracción muestral ya no es despreciable, el tamaño puede ajustarse, en el mismo esquema simple, mediante
\[ n=\frac{Nn_0}{N+n_0-1}. \]
En diseños complejos, el cálculo debe incorporar estratificación, conglomeración, probabilidades desiguales, objetivos por dominios, no respuesta prevista y, cuando sea pertinente, un efecto de diseño esperado. El tamaño de muestra no debe calcularse aislado del diseño.
7. ¿Existen «muestras de tamaño común»?
En la práctica profesional aparecen tamaños recurrentes —400, 800, 1000 entrevistas, por ejemplo— porque ciertas combinaciones de precisión, presupuesto y modalidad se repiten. Pero esos números no constituyen constantes estadísticas.
Para una proporción cercana a 0.5, un muestreo aleatorio simple de alrededor de 1067 unidades produce, por aproximación normal y sin corrección por población finita, un margen de muestreo cercano a tres puntos porcentuales al 95%. De allí proviene parte de la recurrencia de tamaños próximos a mil en sondeos. Sin embargo, ese cálculo no demuestra por sí mismo que una encuesta sea nacionalmente representativa ni que su error total sea ±3 puntos.
Si hay conglomeración, pesos muy variables, dominios pequeños, tasas de respuesta desiguales o cobertura incompleta, el mismo \(n\) puede producir una precisión y una calidad muy distintas. La pregunta correcta no es «¿cuál es el tamaño tradicional?», sino «¿qué precisión necesito para qué estimando, bajo qué diseño y con qué costos?».
8. Dos diferencias entre la teoría clásica y la teoría de encuestas
8.1. Distribuciones, modelos y diseño
Una observación clásica de Cochran contrasta parte de la inferencia estadística basada en modelos con la teoría de encuestas sobre poblaciones finitas. En muchos problemas clásicos se supone que las observaciones proceden de una distribución con forma matemática especificada y se estiman sus parámetros. En el muestreo de encuestas, en cambio, una tradición central desarrolla inferencia a partir del mecanismo de selección sin requerir una distribución paramétrica para los valores poblacionales.
La expresión «pocas mediciones en cada unidad» no se refiere a una muestra con menos de 30 o 50 casos. Se refiere al número y tipo de variables medidas sobre cada unidad. Una gran encuesta puede recoger muchas variables con distribuciones muy diferentes; no existe razón para imponer a todas una misma familia paramétrica simplemente porque el conjunto de datos sea grande.
La capacidad de cómputo no elimina esta diferencia conceptual. Hoy conviven, al menos, tres perspectivas:
- inferencia basada en el diseño: la aleatoriedad se atribuye al mecanismo de selección;
- inferencia asistida por modelos: se utilizan modelos para mejorar estimadores, calibrar o explotar información auxiliar, manteniendo propiedades justificadas por el diseño;
- inferencia basada en modelos: la inferencia descansa de manera más directa en un modelo probabilístico para los valores o mecanismos observados.
Särndal, Swensson y Wretman (1992) desarrollan de forma sistemática la perspectiva asistida por modelos. La distinción no es un vestigio anterior a las computadoras modernas; responde a preguntas diferentes sobre cuál es la fuente de la aleatoriedad y qué supuestos sostienen la inferencia.
8.2. Poblaciones finitas y corrección por población finita
Una población es finita si contiene \(N<\infty\) unidades. Ello no depende de que el investigador conozca \(N\) con exactitud. Puede existir una población finita cuyo tamaño sea desconocido o incierto.
Bajo muestreo aleatorio simple sin reemplazo, para la media poblacional \(\bar Y\), si
\[ S^2=\frac{1}{N-1}\sum_{i=1}^{N}(Y_i-\bar Y)^2, \]
entonces
\[ \operatorname{Var}(\bar y) =\left(1-\frac{n}{N}\right)\frac{S^2}{n}. \]
El factor
\[ 1-f,\qquad f=\frac{n}{N}, \]
es la corrección por población finita en la varianza. Cuando \(f\) es muy pequeño, \(1-f\approx1\) y su efecto puede ser despreciable. Cuando la muestra abarca una proporción grande de la población, ignorarlo puede sobreestimar sustancialmente la varianza de muestreo.
La razón es materialmente sencilla: si se observa sin reemplazo una proporción creciente de una población finita, queda cada vez menos incertidumbre sobre el conjunto que no fue observado. Cuando \(n=N\), se realizó un censo de esa población y la varianza debida al mecanismo de muestreo es cero, aunque puedan seguir existiendo errores de medición, cobertura, procesamiento u otras fuentes.
9. ¿Qué significa ser sensible a las expectativas del entrevistado?
El entrevistador debe mantener una combinación que no siempre es fácil: rapport sin inducción. Debe establecer una relación que facilite la comunicación, explicar el propósito de la entrevista, escuchar y utilizar sondeos permitidos; pero no debe conducir al entrevistado hacia una respuesta que considere socialmente deseable o compatible con las expectativas del investigador.
Empatía no significa abandonar la estandarización. Una entrevista puede ser humana, respetuosa y sensible al contexto sin modificar arbitrariamente el significado de las preguntas. En instrumentos estandarizados, una parte importante del entrenamiento consiste precisamente en aprender qué aclaraciones están permitidas y cómo utilizar sondeos neutrales.
La sensibilidad también tiene una dimensión ética. El entrevistador debe reconocer incomodidad, fatiga, privacidad, riesgos y derecho a no responder. La calidad del dato no puede perseguirse mediante coerción.
10. Cortesía, tono, deseabilidad social, consentimiento y posición
La interacción entre entrevistador y entrevistado puede afectar la medición. El tono de voz, la forma de presentar opciones, las reacciones verbales o gestuales, la percepción de estatus del entrevistador y la sensibilidad del tema pueden modificar la respuesta observada.
Conviene distinguir varios mecanismos:
- deseabilidad social: tendencia a ofrecer una respuesta que se percibe como socialmente aceptable;
- aquiescencia: inclinación a aceptar formulaciones independientemente del contenido;
- efecto del entrevistador: variación sistemática asociada a características o conductas del entrevistador;
- efecto de modo: diferencias asociadas a entrevista presencial, telefónica, web, papel u otras modalidades;
- efecto de contexto y orden: respuestas condicionadas por preguntas precedentes o por la estructura del instrumento.
El consentimiento informado, sin embargo, no es un sesgo. Es una condición ética de la investigación con personas. Otra cuestión es que la decisión de participar pueda producir autoselección o no respuesta diferencial. Esa eventual fuente de sesgo debe estudiarse como parte del proceso de participación, no presentarse como una razón para debilitar el consentimiento.
11. Diseño de la encuesta y tamaño absoluto de la muestra
Lohr insiste en una idea que conviene formular con cuidado: una muestra enorme no rescata un diseño defectuoso. La cantidad relevante en su discusión es el tamaño absoluto de la muestra, no el tamaño absoluto de la población.
Para poblaciones grandes, la precisión de un estimador bajo muestreo aleatorio simple depende fundamentalmente de \(n\); \(N\) aparece en la corrección por población finita y tiene poco efecto cuando \(n/N\) es pequeño. Por ello una muestra de mil personas puede tener un error de muestreo semejante si la población contiene un millón o cien millones de personas, siempre que el mecanismo de selección y los demás supuestos sean comparables.
Pero esta afirmación no significa que cualquier muestra de mil unidades sea adecuada. Una muestra de conveniencia de cien mil personas puede tener un sesgo de selección mayor que una muestra probabilística de mil. Aumentar \(n\) reduce la variabilidad aleatoria bajo el mecanismo asumido; no borra automáticamente errores sistemáticos de cobertura, selección, medición o no respuesta.
De aquí se sigue una regla que debe mantenerse presente en toda lectura de sondeos:
\[ \text{muestra grande}\;\not\Rightarrow\;\text{representatividad}. \]
Y también:
\[ \text{margen de muestreo pequeño}\;\not\Rightarrow\;\text{error total pequeño}. \]
12. Contenido, unidades, extensión y tiempo al definir una población
Una población de estudio debe definirse de manera suficientemente precisa para decidir quién o qué pertenece a ella. Es útil especificar el contenido sustantivo, las unidades que la componen, la extensión espacial y el tiempo o período de referencia.
El contenido no es simplemente la localización espacio-temporal; eso corresponde principalmente a extensión y tiempo. El contenido determina qué clase de entidad y qué condición sustantiva hacen que una unidad pertenezca a la población. Por ejemplo: «personas de 18 años o más residentes habituales en hogares particulares de Costa Rica durante el período de referencia». Allí aparecen una entidad, una condición de edad, una condición de residencia, una delimitación de hogares y una extensión territorial-temporal.
Las distintas unidades
La palabra «unidad» tiene un sentido general —algo que puede ser considerado como una entidad para determinado análisis—, pero en encuestas adquiere funciones técnicas distintas. No conviene confundirlas.
Elemento o unidad objetivo. Entidad de la población sobre la cual se quiere producir información: una persona, un hogar, una empresa, una parcela, una escuela.
Unidad de análisis o de estudio. Entidad a la cual se atribuyen las variables analizadas. Puede coincidir con el elemento objetivo, aunque no siempre.
Unidad de observación. Entidad sobre la cual se realiza directamente la observación o medición.
Unidad informante. Persona o entidad que proporciona la información. En una encuesta de hogares, un adulto puede informar sobre otros miembros; la unidad informante y la unidad analítica no son entonces idénticas.
Unidad de muestreo. Unidad seleccionable en una etapa concreta del diseño. En una primera etapa puede ser un segmento geográfico; en una segunda, una vivienda; en una tercera, una persona.
Unidad primaria de muestreo (UPM). Unidad seleccionada en la primera etapa de un diseño multietápico. No se define por ser «un lugar» ni por contener necesariamente una sola unidad final.
Unidad de listado. Unidad identificada durante una operación de listado para construir o actualizar el marco de una etapa posterior. Su función es operacional.
Una misma entidad puede cumplir varias funciones. Si se dispone de una lista completa de estudiantes y se seleccionan estudiantes directamente para preguntarles sobre sí mismos, el estudiante puede ser elemento, unidad de análisis, unidad de observación, unidad informante y unidad de muestreo. Pero esta coincidencia empírica no vuelve sinónimos los conceptos.
13. Dominio, estrato, clase y subclase
Un dominio de estimación es una subpoblación para la cual se desean estimaciones separadas. Puede estar definido por región, sexo, edad, sector económico u otra condición relevante.
Un estrato, en cambio, es una partición utilizada por el diseño de muestreo antes de seleccionar la muestra. Los estratos suelen buscar control de composición, eficiencia o representación suficiente de grupos relevantes.
Un dominio puede coincidir con un estrato, pero no tiene que hacerlo. Puede atravesar varios estratos o definirse mediante información obtenida después de la selección. Por ejemplo, la población puede estratificarse por provincia y, posteriormente, estimarse un dominio formado por personas ocupadas en determinada rama económica dentro de todas las provincias.
La noción de clase como intervalo de una distribución de frecuencias pertenece a otro problema. No es necesaria para definir un dominio de estimación. Del mismo modo, «subclase» no debe utilizarse como sinónimo general de dominio salvo que una fuente defina explícitamente esa terminología para un esquema particular.
14. ¿Qué representa \(Y_i\)?
Si la población finita es
\[ U=\{1,2,\ldots,N\}, \]
y \(Y\) es una variable de estudio, entonces \(Y_i\) representa el valor que esa variable adopta en la unidad \(i\). No representa «las características» de la unidad en plural, sino una realización concreta de una variable definida.
El total poblacional es
\[ T_Y=\sum_{i=1}^{N}Y_i, \]
y la media poblacional
\[ \bar Y=\frac{1}{N}\sum_{i=1}^{N}Y_i. \]
En inferencia basada en el diseño, una idea particularmente importante es que el vector
\[ (Y_1,\ldots,Y_N) \]
puede tratarse como fijo. La distribución que utilizamos para estudiar un estimador surge del diseño muestral: qué muestras \(s\) podían ser seleccionadas y con qué probabilidades.
Esto evita una confusión frecuente. El hecho de utilizar probabilidades no exige pensar que cada característica material de la población fue «generada» por una distribución paramétrica conocida. La probabilidad puede estar en el acto de selección.
15. ¿Qué significa selección MESIP?
En la terminología utilizada en distintos textos latinoamericanos, MESIP suele designar una selección con igual probabilidad de los elementos. Debe entenderse como una clase particular de diseño probabilístico, no como definición de todo muestreo probabilístico.
Si \(\pi_i\) es la probabilidad de inclusión de la unidad \(i\),
\[ \pi_i=P(i\in s), \]
un diseño de probabilidades iguales satisface, para las unidades comparables del diseño,
\[ \pi_i=\pi_j. \]
Pero un diseño probabilístico general puede tener
\[ \pi_i\neq\pi_j. \]
La desigualdad puede ser deliberada, por ejemplo cuando se selecciona con probabilidad proporcional a una medida de tamaño.
16. ¿Qué significa «muestreo irrestricto aleatorio»?
La expresión se utiliza en parte de la literatura en español para referirse al muestreo aleatorio simple sin reemplazo: de una población de tamaño \(N\) se selecciona una muestra de tamaño fijo \(n\) de tal modo que cada subconjunto posible de \(n\) unidades tenga la misma probabilidad de ser escogido.
Si \(S\) es el conjunto de todas las muestras posibles de tamaño \(n\), entonces para cada \(s\in S\),
\[ P(S=s)=\binom{N}{n}^{-1}. \]
De ello se deriva que cada unidad tiene probabilidad de inclusión
\[ \pi_i=\frac{n}{N}. \]
Es un diseño fundamental precisamente porque permite derivaciones transparentes y sirve como punto de referencia. Pero no es «el muestreo aleatorio tal y como se conoce» en sentido exhaustivo: el muestreo probabilístico incluye diseños estratificados, sistemáticos, por conglomerados, multietápicos y con probabilidades desiguales.
17. Error cuadrático medio, varianza y sesgo
Sea \(\hat\theta\) un estimador del parámetro \(\theta\). Su error cuadrático medio es
\[ \operatorname{ECM}(\hat\theta) =E\left[(\hat\theta-\theta)^2\right]. \]
Puede descomponerse como
\[ \operatorname{ECM}(\hat\theta) =\operatorname{Var}(\hat\theta) +\operatorname{Bias}(\hat\theta)^2, \]
con
\[ \operatorname{Bias}(\hat\theta) =E(\hat\theta)-\theta. \]
La identidad puede verse escribiendo
\[ \hat\theta-\theta =\bigl(\hat\theta-E(\hat\theta)\bigr) +\bigl(E(\hat\theta)-\theta\bigr), \]
elevando al cuadrado y tomando esperanza. El término cruzado desaparece porque
\[ E\left[\hat\theta-E(\hat\theta)\right]=0. \]
El sesgo no es la diferencia entre una realización observada de \(\hat\theta\) y su esperanza. Esa diferencia es una desviación aleatoria de la realización respecto del centro de su distribución. El sesgo es una propiedad del procedimiento de estimación: la diferencia entre la esperanza del estimador y el parámetro que pretende estimar.
La descomposición es conceptualmente importante porque muestra un intercambio posible entre variabilidad y sesgo. Un estimador con varianza ligeramente mayor puede tener menor ECM si reduce suficientemente el sesgo, y viceversa. La «precisión» y la «exactitud» no deberían reducirse a una única intuición coloquial cuando el análisis exige distinguir sus componentes.
18. ¿Qué son los conglomerados y qué relación tienen con las UPM?
Un conglomerado en muestreo es una agrupación de unidades elementales que puede utilizarse como unidad de selección. No debe confundirse con un cluster producido por un algoritmo de aprendizaje automático. En clustering, el agrupamiento suele ser el resultado de un criterio algorítmico de similitud o distancia; en muestreo, el conglomerado pertenece al diseño y puede estar definido por geografía, organización administrativa, viviendas, escuelas, establecimientos u otras estructuras.
Una UPM es, sencillamente, la unidad que se selecciona en la primera etapa. En muchos diseños de hogares la UPM es un conglomerado geográfico —por ejemplo, un segmento censal—, de modo que ambas nociones coinciden empíricamente. No son, sin embargo, sinónimos por definición.
| Diseño | Primera unidad seleccionada | Etapas | ¿Probabilidades iguales obligatorias? |
|---|---|---|---|
| Aleatorio simple | Elemento | 1 | Sí, en el diseño simple clásico |
| Estratificado | Elemento dentro de estrato | 1 | No necesariamente entre estratos |
| Conglomerados, una etapa | Conglomerado | 1 | No |
| Multietápico | UPM; luego unidades secundarias, etc. | 2 o más | No |
| PPS/PPT | Unidad con probabilidad proporcional a tamaño | 1 o más | No |
La conglomeración importa porque las unidades de un mismo conglomerado suelen parecerse entre sí. Si existe correlación intraclase positiva, entrevistar veinte personas dentro del mismo conglomerado puede aportar menos información que entrevistar veinte personas distribuidas entre muchos conglomerados.
Esta pérdida o ganancia relativa de precisión se resume frecuentemente mediante un efecto de diseño,
\[ \operatorname{deff} =\frac{\operatorname{Var}_{\text{diseño}}(\hat\theta)}{\operatorname{Var}_{\text{MAS}}(\hat\theta)}, \]
comparando la varianza bajo el diseño real con una referencia de muestreo aleatorio simple de tamaño comparable. Un \(\operatorname{deff}>1\) indica mayor varianza que la referencia; no constituye un «error» del algoritmo, sino una propiedad que puede surgir del diseño, la correlación intraclase y la variabilidad de pesos.
19. ¿Qué significa el «margen de error»?
En el lenguaje de sondeos, el margen de error suele ser el semiancho de un intervalo de confianza asociado a la incertidumbre de muestreo bajo un diseño y un método de estimación determinados. No es «la cantidad total de error que tiene la encuesta».
Para una estimación \(\hat\theta\), una forma genérica es
\[ \hat\theta\pm z_{1-\alpha/2}\,\widehat{SE}(\hat\theta), \]
de modo que el margen es
\[ MOE=z_{1-\alpha/2}\,\widehat{SE}(\hat\theta). \]
En diseños complejos, \(\widehat{SE}\) debe corresponder al diseño: estratos, conglomerados, probabilidades desiguales, calibración o pesos de réplica, según el caso. Calcular un margen como si la muestra hubiera sido aleatoria simple cuando no lo fue puede subestimar o sobreestimar la incertidumbre.
Margen de muestreo y error total de encuesta
El paradigma de Total Survey Error obliga a separar la variabilidad muestral de otras fuentes de error. Entre ellas se encuentran:
- error de cobertura;
- error de no respuesta;
- error de medición;
- error de especificación del concepto;
- error de procesamiento y codificación;
- errores de edición e imputación;
- errores del marco y de vinculación;
- errores derivados de modelos o ajustes.
Por eso una frase como «la encuesta tiene un margen de error de ±3%» debe entenderse, salvo especificación adicional, como una declaración sobre una componente de incertidumbre. No demuestra que el valor verdadero esté a menos de tres puntos ni que todas las demás fuentes de error sean pequeñas.
20. ¿Por qué se prefiere el muestreo probabilístico? ¿Sólo éste puede ser útil?
Un diseño probabilístico proporciona una distribución conocida de selección y, por ello, permite justificar inferencias basadas en el diseño y estimar la variabilidad de muestreo bajo condiciones explícitas. Ésta es una ventaja enorme cuando el objetivo es inferir a una población definida.
Pero «no probabilístico» no significa automáticamente «inútil». Muestras por conveniencia, juicio, cuotas, redes o autoselección pueden ser adecuadas para exploración, investigación cualitativa, desarrollo de instrumentos, estudios de mecanismos, poblaciones de difícil acceso o preguntas donde la inferencia poblacional basada en el diseño no es el objetivo.
El problema aparece cuando se atribuyen a esas muestras propiedades que el mecanismo de selección no justifica. Si un investigador estudia un grupo localizado porque reúne una característica rara, puede producir conocimiento válido sobre ese grupo o sobre determinados mecanismos. No puede inferir sin supuestos adicionales que la prevalencia de esa característica en el país sea igual a la observada en el grupo.
La palabra representatividad debe usarse con cautela. Una muestra probabilística puede sufrir subcobertura, no respuesta diferencial o error de medición. Por ello es preferible decir exactamente qué propiedad se ha asegurado: marco de cobertura definido, probabilidades conocidas, calibración a determinados totales, balance en variables auxiliares o capacidad de inferencia bajo un diseño especificado.
La ética metodológica exige documentar el método de selección y los límites de la inferencia. Una muestra no probabilística no debe presentarse como probabilística; una muestra probabilística tampoco debe presentarse como libre de los restantes errores de encuesta.
21. «La aleatorización es una operación física»: ¿qué significa?
Kish insiste en que una muestra probabilística requiere algo más que escribir una distribución en un papel. Debe existir un procedimiento efectivo de selección cuya operación sea congruente con el modelo probabilístico especificado.
La palabra «física» no debe entenderse como oposición a lo computacional. Un algoritmo implementado en una computadora puede formar parte perfectamente de la operación material de selección. Lo que Kish contrapone es un mecanismo de azar efectivamente ejecutado frente a una mera creencia, suposición o declaración de que las unidades «son como si hubieran sido aleatorias».
Podemos separar dos niveles:
\[ \text{modelo probabilístico}\neq\text{procedimiento de aleatorización}, \]
pero un diseño probabilístico requiere correspondencia entre ellos. Si el protocolo dice que cada una de \(N\) unidades tiene igual probabilidad de ser seleccionada, el procedimiento real —tabla de números aleatorios, algoritmo pseudoaleatorio auditado, sorteo u otro mecanismo— debe implementar esa propiedad.
Esta distinción tiene interés filosófico. La probabilidad en una encuesta probabilística no es únicamente una propiedad formal del lenguaje con el que describimos la selección; se vincula con una práctica objetiva reproducible. La teoría adquiere capacidad inferencial porque existe una relación controlada entre el mecanismo material y el espacio de muestras definido matemáticamente.
22. ¿Qué significa que el marco incluye «listas físicas» y procedimientos sin listarlas efectivamente?
Kish utiliza marco en un sentido más amplio que «archivo con todos los nombres». Una lista física puede ser un registro de personas, establecimientos, direcciones, parcelas o unidades administrativas. Pero también pueden existir procedimientos que permitan seleccionar unidades sin construir una lista exhaustiva de todos los elementos finales.
Un marco de áreas, por ejemplo, puede dividir un territorio en segmentos seleccionables; dentro de los segmentos escogidos se realiza luego un listado de viviendas. En marcación aleatoria de números telefónicos, el marco puede ser conceptual o algorítmico: se define el espacio de números elegibles y se generan selecciones sin poseer previamente un archivo de todos los abonados.
«Listar efectivamente» significa enumerar explícitamente todas las unidades relevantes en una lista operativa. Evitar ese esfuerzo no quiere decir reemplazar lo físico por «lo informático» en sentido abstracto; quiere decir construir un mecanismo de cobertura y selección que no requiere una enumeración previa exhaustiva de todas las unidades finales.
23. ¿Por qué es tan difícil construir un marco para poblaciones humanas?
Porque población objetivo, marco y localización de campo no son la misma cosa. Un registro electoral, por ejemplo, puede ser excelente para una población de electores inscritos y, al mismo tiempo, ser inadecuado para una población definida como «todas las personas residentes» si excluye menores, no inscritos u otros grupos.
Además, las poblaciones humanas cambian. Las personas nacen, mueren, migran, cambian de vivienda, forman o disuelven hogares, usan varios teléfonos, pierden números, comparten dispositivos y pueden residir temporalmente en lugares diferentes. Un marco perfecto sería costoso no porque necesitemos saber dónde se encuentra cada persona en cada hora, sino porque debe mantener una correspondencia suficientemente buena entre las unidades objetivo y las unidades seleccionables.
Los grandes sistemas estadísticos resuelven este problema con estrategias diversas: marcos de direcciones, registros administrativos integrados, marcos de áreas, listados de viviendas dentro de UPM, marcos duales o múltiples y actualizaciones periódicas. Cada solución distribuye de manera distinta los costos y los riesgos de subcobertura, duplicación y desactualización.
La pregunta metodológica correcta no es «¿existe una lista completa de todos los habitantes?», sino «¿qué marco o combinación de marcos ofrece una vía documentada para que las unidades de la población objetivo tengan probabilidades de inclusión conocidas o modelables conforme al diseño?».
24. ¿Qué es el muestreo polietápico?
Es un diseño en el que la selección se realiza en dos o más etapas. En una encuesta de hogares, por ejemplo, podría seleccionarse:
- UPM o segmentos geográficos;
- viviendas dentro de las UPM;
- una persona dentro de cada vivienda.
Si las selecciones son condicionales, la probabilidad global de inclusión de una persona \(i\) puede expresarse, esquemáticamente, como producto de probabilidades de cada etapa:
\[ \pi_i =\pi_{h}\,\pi_{j\mid h}\,\pi_{i\mid j,h}, \]
según la notación adoptada para UPM, vivienda y persona.
El peso básico de diseño es entonces
\[ w_i=\frac{1}{\pi_i}. \]
En la práctica, ese peso puede modificarse posteriormente por no respuesta, calibración, postestratificación, recorte de pesos u otros procedimientos. Debe distinguirse siempre el peso básico de diseño de los pesos finales analíticos.
El muestreo multietápico permite trabajar con poblaciones enormes sin construir desde el comienzo una lista nacional de todos los elementos finales. Su costo suele ser mucho menor, aunque la concentración geográfica puede aumentar la varianza respecto de un muestreo aleatorio simple del mismo tamaño.
25. Multiplicidad, probabilidades desiguales y estimación de Horvitz-Thompson
Supóngase que un marco telefónico permite que un hogar con dos líneas aparezca dos veces mientras otro hogar con una línea aparece una vez. Si se seleccionan líneas con igual probabilidad y el objetivo final son hogares, las probabilidades de inclusión de hogares pueden ser desiguales. Si esa multiplicidad es desconocida y se ignora, puede producir sesgo.
Pero no se sigue de allí que todo muestreo aleatorio exija igual probabilidad. La teoría de encuestas dispone explícitamente de diseños con probabilidades desiguales. Lo fundamental es que el mecanismo probabilístico esté especificado y que las probabilidades necesarias para la estimación sean conocidas o calculables.
Para una población \(U\) y un total
\[ T_Y=\sum_{i\in U}Y_i, \]
si cada unidad posee probabilidad de inclusión positiva \(\pi_i>0\), el estimador de Horvitz-Thompson es
\[ \widehat T_{HT} =\sum_{i\in s}\frac{Y_i}{\pi_i}. \]
Su lógica es inmediata: una unidad difícil de seleccionar representa más unidades de la población que una unidad con mayor probabilidad de inclusión. Por eso aparece el inverso de \(\pi_i\).
Bajo el diseño apropiado,
\[ E_p\left(\widehat T_{HT}\right)=T_Y, \]
donde \(E_p\) denota esperanza respecto del diseño de muestreo. La importancia histórica del resultado de Horvitz y Thompson (1952) es precisamente que demuestra cómo tratar muestras sin reemplazo con probabilidades desiguales sin convertirlas por ello en muestras «no aleatorias».
Esto permite volver al problema de los duplicados con mayor precisión. Si la multiplicidad modifica \(\pi_i\) de una manera conocida y el estimador la incorpora correctamente, la desigualdad puede ser tratada. Si la multiplicidad es desconocida, se convierte en un problema de marco que impide conocer adecuadamente las probabilidades y puede distorsionar la inferencia.
· · ·
Algunas consecuencias generales
De los problemas anteriores pueden extraerse cuatro principios que atraviesan la teoría de encuestas.
Primero, el diseño y la estimación forman una unidad. No existe un estimador cuyo significado inferencial pueda separarse completamente del modo en que se produjo la muestra. La ponderación, la estimación de varianzas y la interpretación de los intervalos dependen del diseño.
Segundo, aleatoriedad no significa necesariamente igualdad. Un diseño puede ser probabilístico y asignar probabilidades desiguales; lo decisivo es que el mecanismo sea probabilísticamente definido y que sus probabilidades relevantes puedan incorporarse en la inferencia.
Tercero, error de muestreo no es error total de encuesta. Un intervalo estrecho puede coexistir con subcobertura, no respuesta diferencial, medición deficiente o errores de procesamiento. La precisión matemática de una componente no debe confundirse con validez global.
Cuarto, la operación estadística es también una operación material. Marcos, listados, entrevistas, algoritmos de selección, saltos de cuestionario y reglas de edición son prácticas concretas. La teoría no flota por encima de ellas: sus supuestos se realizan —o se violan— en el proceso efectivo de producir el dato.
Referencias
AAPOR. (2023). Standard Definitions: Final Dispositions of Case Codes and Outcome Rates for Surveys (10th ed.). American Association for Public Opinion Research. https://aapor.org/standards-and-ethics/standard-definitions/
Biemer, P. P., & Lyberg, L. E. (2003). Introduction to Survey Quality. Wiley. https://doi.org/10.1002/0471458740
Cochran, W. G. (1977). Sampling Techniques (3rd ed.). Wiley.
Groves, R. M. (1989). Survey Errors and Survey Costs. Wiley. https://doi.org/10.1002/0471725277
Groves, R. M., Fowler, F. J. Jr., Couper, M. P., Lepkowski, J. M., Singer, E., & Tourangeau, R. (2009). Survey Methodology (2nd ed.). Wiley.
Horvitz, D. G., & Thompson, D. J. (1952). A generalization of sampling without replacement from a finite universe. Journal of the American Statistical Association, 47(260), 663-685. https://doi.org/10.1080/01621459.1952.10483446
Kalton, G., & Kasprzyk, D. (1986). The treatment of missing survey data. Survey Methodology, 12(1), 1-16.
Kish, L. (1965). Survey Sampling. Wiley.
Lohr, S. L. (2021). Sampling: Design and Analysis (3rd ed.). CRC Press.
Särndal, C.-E., Swensson, B., & Wretman, J. (1992). Model Assisted Survey Sampling. Springer.
Statistics Canada. (2003). Survey Methods and Practices. Catalogue no. 12-587-X. https://www150.statcan.gc.ca/n1/en/pub/12-587-x/12-587-x2003001-eng.pdf
United Nations Statistics Division. (2008). Designing Household Survey Samples: Practical Guidelines. Studies in Methods, Series F, No. 98. https://unstats.un.org/unsd/publication/seriesf/seriesf_98e.pdf
U.S. Census Bureau. (2021). Questionnaire Testing and Evaluation Methods for Censuses and Surveys. https://www.census.gov/about/policies/quality/standards/appendixa2.html
Sitios de interés adicional
Los siguientes recursos pueden ser útiles para orientación rápida, discusión, ejemplos o navegación bibliográfica. No sustituyen las fuentes metodológicas citadas arriba.
- Cross Validated — etiqueta
survey-sampling: discusiones técnicas de usuarios sobre ponderación, diseños complejos, varianzas y problemas prácticos. https://stats.stackexchange.com/questions/tagged/survey-sampling - Wikipedia — “Survey sampling”: mapa introductorio de conceptos y enlaces bibliográficos para localizar temas. https://en.wikipedia.org/wiki/Survey_sampling
- CRAN — paquete
survey: documentación del ecosistema de R para análisis de muestras complejas; es particularmente útil para conectar la teoría con implementaciones reproducibles. https://cran.r-project.org/package=survey - Statistics Canada — Survey Methodology: revista especializada con investigación teórica y aplicada en muestreo, ponderación, no respuesta, integración y calidad. https://www150.statcan.gc.ca/n1/en/catalogue/12-001-x
- United Nations — colección de manuales de encuestas de hogares: guías sobre diseño, marcos, errores no muestrales y procesamiento. https://unstats.un.org/iswghs/SurveyHandbooksRevision










