1  Introducción

El análisis de encuestas con diseños complejos cuenta con una trayectoria consolidada en la literatura estadística, sustentada en el enfoque de inferencia basado en el diseño de muestreo. Como señalan Särndal, Swensson, y Wretman (2003) y Gutiérrez (2016), este enfoque reconoce a la distribución de probabilidad inducida por el proceso de selección de la muestra como el único mecanismo probabilístico que rige la inferencia. Bajo este paradigma, las propiedades estadísticas de los estimadores (como el insesgamiento, la precisión y la consistencia) se evalúan con respecto a la distribución de todas las posibles muestras que el diseño puede generar, sin imponer supuestos distribucionales sobre la variable de interés.

En este marco, la estimación de varianzas ha ocupado un lugar central y ha evolucionado en torno a tres grandes familias metodológicas complementarias. La primera, el método del último conglomerado (Hansen et al. 1953), simplifica la estructura multietápica de los diseños de muestreo al concentrar la variabilidad del estimador en las unidades primarias de muestreo (UPM), tratando la selección como si se realizara con reemplazo. La segunda, la linealización de Taylor (Woodruff 1971; Binder 1983), extiende este principio a parámetros no lineales (como medias, proporciones y razones) mediante una aproximación de primer orden que reduce el problema de estimación de la varianza al de un total. Finalmente, los métodos de replicación (Rust y Rao 1996) estiman la varianza a partir de la dispersión entre estimaciones obtenidas mediante réplicas sistemáticas de la muestra.

Paralelamente, en el ámbito de la modelización estadística, contribuciones fundamentales como las de Kish y Frankel (1974), Fuller (1975) y Binder (1983) sentaron las bases de la regresión ponderada y de la estimación de varianzas de coeficientes de regresión en diseños estratificados y de múltiples etapas. Sobre este desarrollo, el método de máxima pseudo-verosimilitud (MPV) (Skinner, Holt, y Smith 1989; Pfeffermann 1993) incorporó los pesos muestrales en la función de log-verosimilitud para producir estimadores consistentes bajo el diseño de muestreo, extendiendo así los modelos lineales generalizados de Nelder y Wedderburn (1972) al contexto de encuestas complejas.

Desde una perspectiva socioeconómica, una referencia fundamental para el análisis de encuestas de hogares es el trabajo de Deaton (1997), que establece un puente entre la teoría estadística, el análisis económico y las necesidades de información para el diseño y la evaluación de políticas públicas. En su libro, el autor articula los principios del muestreo con las herramientas de la microeconometría aplicada, explica cómo deben incorporarse las características del diseño muestral en la estimación y la inferencia, y desarrolla métodos para estudiar, a partir de microdatos, el bienestar, la pobreza, la desigualdad, los patrones de consumo, la demanda de los hogares y las decisiones de ahorro.

Heeringa, West, y Berglund (2017) y Valliant, Dever, y Kreuter (2018) han sintetizado estas contribuciones en un marco analítico unificado que integra de manera coherente el diseño muestral, la ponderación y la modelización, constituyéndose en referencias estándar para la práctica contemporánea del análisis de encuestas complejas.

Este documento está dirigido a lectores con formación en estadística o ciencia de datos, o con experiencia profesional equivalente. Está especialmente pensado para quienes cuentan con conocimientos de los fundamentos de la teoría de muestreo, de modelos de regresión lineal y logística, y con un manejo introductorio del lenguaje de programación R. En este contexto, el documento está orientado a profundizar y consolidar estos conocimientos, facilitando su aplicación rigurosa en contextos complejos y de alta exigencia técnica. Su propósito es acompañar al investigador en la transición desde los fundamentos teóricos hacia su implementación adecuada en la producción de estadísticas oficiales.

1.1 Justificación

A pesar de la riqueza metodológica disponible en la literatura especializada, persiste una brecha significativa entre el estado del arte y la práctica cotidiana del análisis de encuestas en la región. Una de las principales manifestaciones de esta brecha se relaciona con el acceso y uso del software estadístico. Algunos textos de referencia ampliamente reconocidos en el análisis de encuestas, como Cochran (1977) y Särndal, Swensson, y Wretman (2003), constituyen fuentes fundamentales desde el punto de vista teórico; sin embargo, no presentan ejemplos de aplicación real con software estadístico. Otros documentos están orientados principalmente hacia software con licencia, como SAS, Stata o SPSS, o bien no logran integrarse plenamente con un ecosistema computacional de software libre como R. En contraste, muchos tutoriales disponibles en línea sobre análisis de encuestas suelen privilegiar los aspectos operativos del software, pero rara vez alcanzan el nivel de profundidad conceptual necesario para un uso adecuado y responsable en la producción de estadísticas oficiales.

Adicionalmente, existe una fragmentación metodológica importante entre los distintos componentes que intervienen en el análisis de encuestas complejas. Con frecuencia, los fundamentos del diseño muestral, la gestión computacional de los datos, la estimación de parámetros descriptivos e inferenciales con corrección por diseño y el tratamiento de la no respuesta son abordados de manera separada, dificultando la construcción de flujos de trabajo integrales y reproducibles. En este contexto, el presente texto propone una integración coherente de estos elementos dentro de un único marco analítico implementado completamente en R.

Otro aspecto relevante corresponde a la contextualización regional de los ejemplos y aplicaciones. Una proporción considerable de los textos de referencia utiliza bases de datos foraneas, lo que limita parcialmente su aplicabilidad inmediata en América Latina. Con el propósito de acercar los contenidos a las realidades estadísticas de la región, este documento emplea una base de datos nativa de R, diseñada para replicar la estructura tradicional de las encuestas de hogares latinoamericanas y, por tanto, proporcionar ejemplos más cercanos a los problemas enfrentados por las oficinas nacionales de estadística y los equipos técnicos de la región.

Finalmente, este documento constituye en sí mismo un ejercicio de investigación reproducible. Todo su contenido, incluyendo tablas, figuras, ecuaciones y resultados numéricos, es generado íntegramente mediante código en R incorporado directamente en los capítulos. De esta manera, el lector no solo puede estudiar los métodos presentados, sino también replicarlos, modificarlos y adaptarlos a sus propios contextos y bases de datos, fortaleciendo así las capacidades analíticas y la transparencia en la producción estadística.

1.2 Uso del software R para el análisis de encuestas

La elección de R como entorno computacional para este documento no es arbitraria. R reúne al menos tres características que lo convierten en una opción idónea para el análisis de encuestas de hogares en el contexto latinoamericano.

En primer lugar, su condición de acceso libre. A diferencia de otros programas con costos de licencia que pueden resultar prohibitivos para muchas oficinas nacionales de estadística en países en desarrollo, R se distribuye bajo licencia GNU, lo que garantiza que los métodos presentados en este documento sean plenamente accesibles y replicables, independientemente de las restricciones presupuestarias que algunas veces aquejan a las instituciones públicas.

En segundo lugar, destaca su ecosistema especializado. El paquete survey (Lumley et al. 2026), en constante evolución, implementa una amplia gama de métodos de estimación para diseños complejos: estimadores de Horvitz–Thompson, técnicas de calibración, linealización de Taylor, métodos de replicación, modelos de regresión ponderados y pruebas de hipótesis ajustadas al diseño, entre otros. A su vez, el paquete srvyr (Freedman Ellis y Schneider 2026) extiende estas capacidades al incorporar la sintaxis del ecosistema tidyverse, facilitando una transición fluida entre el análisis exploratorio y el inferencial. Paquetes complementarios como TeachingSampling (Gutiérrez 2020) y convey (Jacob, Pessoa, y Damico 2024) consolidan un entorno analítico difícil de igualar en otros lenguajes.

Finalmente, R ofrece una sólida integración con herramientas de reproducibilidad científica. En particular, su combinación con Quarto y con el ecosistema de R Markdown, que incluye herramientas como bookdown, permite generar documentos reproducibles en los que los resultados, las tablas y las figuras se generan directamente a partir del código fuente. Esta capacidad resulta especialmente relevante en el ámbito de las estadísticas oficiales, donde la trazabilidad y la transparencia metodológica son requisitos fundamentales.

1.3 Estructura del documento

Este documento está organizado siguiendo una progresión lógica que va desde los fundamentos conceptuales del muestreo hasta aplicaciones más avanzadas del modelamiento estadístico. Esta secuencia no es arbitraria: cada nivel de conocimiento constituye un requisito necesario para comprender el siguiente, de modo que el lector pueda transitar de los principios básicos hacia herramientas analíticas más sofisticadas de manera coherente.

En primer lugar, se abordan los fundamentos del diseño muestral. El análisis adecuado de una encuesta comienza necesariamente con la comprensión de su diseño probabilístico. Antes de estimar cualquier parámetro, el analista debe familiarizarse con tres elementos constitutivos: la población objetivo, entendida como el conjunto de unidades sobre las cuales se desean hacer inferencias; el marco de muestreo, que corresponde al dispositivo que permite ubicar e identificar dichas unidades; y las unidades de muestreo en cada etapa del diseño. Estos componentes determinan tanto la validez como el alcance de las inferencias posteriores. A continuación, se introducen los elementos computacionales que permiten materializar estos conceptos en un entorno aplicado. El documento introduce el manejo y transformación de variables mediante un ambiente de programación adecuado para la incorporación del diseño de muestreo, que constituye el eje central del flujo de análisis y garantiza que todas las operaciones estadísticas respeten dicha estructura.

Con el diseño de muestreo correctamente especificado, el documento avanza hacia la estimación de parámetros descriptivos. Esta sección cubre los estimadores más utilizados en el análisis de encuestas para variables continuas. Asimismo, se presentan sus correspondientes medidas de precisión (varianzas, errores estándar e intervalos de confianza) ajustadas a la complejidad del diseño muestral.

Posteriormente, se desarrolla el análisis de relaciones entre variables a través del modelamiento estadístico, yendo más allá de la estadística descriptiva hacia un enfoque analítico e inferencial. En particular, se abordan los modelos de regresión lineal bajo diseños complejos, donde la incorporación explícita de los pesos muestrales resulta fundamental para obtener estimadores insesgados respecto al diseño. Este contexto pone de manifiesto la discusión entre el enfoque basado en el diseño y el enfoque basado en los modelos. Adicionalmente, se introducen los modelos lineales generalizados y los modelos multinivel, que amplían el alcance del análisis a variables de respuesta no normales, como variables binarias y conteos.

La organización de los capítulos sigue la arquitectura conceptual descrita anteriormente, avanzando desde los fundamentos hacia las aplicaciones más complejas. De esta forma, el capítulo 2 presenta los conceptos básicos para el análisis de encuestas de hogares, se explican los elementos centrales de un diseño de muestreo (estratificación, conglomeración y pesos de muestreo desiguales) y se introduce los principales estimadores de muestreo para totales, desarrollando los fundamentos para estimar su varianza y obtener intervalos de confianza.

En el capítulo 3 se aborda la estimación rigurosa de parámetros descriptivos para variables numéricas bajo diseños de muestreo complejos y se desarrolla la teoría para estimar totales, medias y razones. El capítulo también cubre la estimación de percentiles, y medidas de desigualdad mediante indicadores como el índice de Gini y la curva de Lorenz. Se presentan los elemento principales para realizar pruebas de hipótesis y contrastes, así como la correcta visualización de variables continuas.

En el capítulo 4 se aborda el análisis de variables categóricas bajo diseños complejos. Se desarrollan técnicas para estimar tamaños poblacionales y proporciones. Asimismo, se presentan tablas de contingencia ponderadas con sus respectivas frecuencias y proporciones, así como pruebas de independencia que ajustan la estadística clásica para reflejar el efecto del diseño. El capítulo también cubre la estimación e interpretación de medidas de asociación como la razón de Odds, el análisis de diferencias de proporciones entre subpoblaciones mediante contrastes, y diversas estrategias de visualización, incluyendo gráficos de barras con intervalos de confianza y mapas.

El capítulo 5 se enfoca en analizar relaciones entre variables y construir modelos estadísticos válidos bajo diseños complejos, cuando los supuestos tradicionales de independencia e idéntica distribución no se cumplen. Se presenta la evolución del problema desde los aportes iniciales hasta los desarrollos más recientes, y discute las implicaciones de trabajar con datos de encuestas en el contexto de los modelos de regresión. El capítulo también aborda la realización de pruebas de hipótesis, el diagnóstico de residuales y la identificación de observaciones influyentes.

En el capítulo 6 se extiende la modelación estadística a variables que no siguen una distribución normal (como variables binarias, multinomiales y estrictamente positivas). Para ello, se presenta un marco unificado basado en los modelos lineales generalizados, y se contrasta el enfoque clásico de máxima verosimilitud con el de máxima pseudo-verosimilitud, basado en ecuaciones de estimación ponderadas que incorporan los pesos muestrales.

En el capítulo 7 se revisan los modelos multinivel (también llamados jerárquicos), para analizar datos con estructura anidada, incorporando simultáneamente variables a nivel individual y contextual. A través de ejemplos de regresión (con interceptos y pendientes que varían por estrato), se muestra que ignorar la estructura jerárquica puede llevar a inferencias incorrectas, mientras que modelarla explícitamente permite capturar la heterogeneidad entre grupos.

Adicionalmente, el primer apéndice introduce el manejo de bases de datos en R mediante el entorno tidyverse, con énfasis en el paquete dplyr. A partir de la base de datos BigCity, se presenta un flujo básico de trabajo que incluye la carga de librerías, la inspección inicial de la base, el uso del operador de encadenamiento %>% (pipeline) y la aplicación de los principales verbos de dplyr: filter(), select(), arrange(), mutate(), summarise() y group_by(). El capítulo muestra cómo seleccionar registros y variables, ordenar datos, crear nuevas variables y producir resúmenes descriptivos, explicando tanto la lógica de los códigos como la interpretación de sus salidas.

Finalmente, el segundo apéndice aborda la inferencia en poblaciones finitas y la diferencia entre la inferencia basada en modelos y la inferencia basada en el diseño muestral. A partir de ejemplos de simulación, muestra que en las encuestas complejas la aleatoriedad proviene principalmente de la selección de la muestra y que, por tanto, las estimaciones deben incorporar las probabilidades de inclusión y los pesos muestrales. Se presenta el método de máxima pseudo-verosimilitud como una extensión adecuada para datos de encuestas, donde cada contribución individual se pondera según sus probabilidades de inclusión.

El lector que recorra en orden los capítulos estará en la capacidad de analizar una encuesta de hogares, al entender su diseño, procesar sus datos, estimar los indicadores de interés con la precisión estadística correcta y modelar las relaciones entre variables de manera válida bajo el diseño complejo. Esa capacidad es, en esencia, lo que la producción rigurosa de estadísticas sociales exige.