Espartaco

“Is that to say we are against Free Trade? No, we are for Free Trade, because by Free Trade all economical laws, with their most astounding contradictions, will act upon a larger scale, upon the territory of the whole earth; and because from the uniting of all these contradictions in a single group, where they will stand face to face, will result the struggle which will itself eventuate in the emancipation of the proletariat.”

Karl Heinrich Marx · Marx-Engels Collected Works, Vol. VI, p. 290

26,583 views since December 2020

26,583 visitas desde diciembre de 2020

EnglishEspañol

ENCUESTA NACIONAL SOBRE LOS ASPECTOS DE LA VIRTUALIDAD VINCULADOS CON LA PANDEMIA DEL COVID-19 (ENAVIRPA 2021)

Encuestas por muestreo · Economía · Modelos lineales generalizados · Aprendizaje estadístico

Encuesta Nacional sobre los Aspectos de la Virtualidad Vinculados con la Pandemia del COVID-19 (ENAVIRPA 2021)

Módulo de afectación económica, resultados descriptivos, diseño inferencial y evaluación reproducible


Autoría y alcance. ENAVIRPA 2021 fue un trabajo colectivo del alumnado de Introducción a las Encuestas por Muestreo. La autoría indicada corresponde al módulo de Afectación Económica, a la estrategia analítica desarrollada alrededor de él y a la redacción de este informe. Los restantes módulos se conservan como componentes del trabajo colectivo y se atribuyen a sus respectivos autores.

PRÓLOGO

La Encuesta Nacional sobre los Aspectos de la Virtualidad Vinculados con la Pandemia del COVID-19 (ENAVIRPA 2021) fue un esfuerzo colectivo desarrollado por el alumnado del curso Introducción a las Encuestas por Muestreo de la Universidad de Costa Rica. El levantamiento, la integración del cuestionario y los distintos módulos temáticos pertenecen a ese trabajo colectivo. Este documento se concentra, en lo fundamental, en el módulo de Afectación Económica (AE), cuyo diseño y análisis corresponden a José Mauricio Gómez Julián, y utiliza de manera complementaria preguntas de otros módulos elaborados por otros integrantes del curso. La presencia de esos ítems en el análisis no implica atribuir al autor del módulo económico su construcción.

La finalidad del ejercicio fue doble. Por un lado, realizar un levantamiento telefónico real durante la crisis sanitaria y describir aspectos materiales vinculados con la pandemia. Por otro, utilizar los datos como terreno pedagógico para estudiar qué puede hacerse —y qué no puede hacerse— con una encuesta por muestreo cuando se pasa de la descripción a la inferencia, a los modelos lineales generalizados y a la evaluación predictiva.

El alcance debe fijarse desde el comienzo. Las 235 entrevistas constituyen un conjunto de datos real, pero no basta el número de observaciones para convertir cualquier estadístico muestral en una estimación nacional libre de sesgo. La representatividad depende también del mecanismo de selección, de la cobertura del marco, de las probabilidades de inclusión, de la no respuesta, de la ponderación, del error de medición y de las restricciones del cuestionario. El diseño se realizó bajo limitaciones de tiempo y coordinación propias de un ejercicio académico; además, los módulos no nacieron de un único marco teórico común. Por ello los resultados se interpretan principalmente como resultados de la muestra y como evidencia metodológica acerca de los procedimientos empleados.

Conviene también distinguir encuesta e instrumento psicométrico. Una encuesta es un procedimiento de recolección de información y puede contener variables demográficas, laborales, económicas, actitudinales o escalas psicométricas. No todo cuestionario es, por ese solo hecho, un instrumento psicométrico. Cuando un módulo pretende medir un constructo latente, aparecen además problemas de fiabilidad, validez y error de medición que requieren procedimientos específicos. En ENAVIRPA no se realizó una validación psicométrica global del cuestionario; esto es una limitación sólo para aquellas interpretaciones que pretendan atribuir a conjuntos de ítems la medición de constructos latentes.

El criterio para incorporar módulos complementarios fue estudiar la distribución multidimensional de las pérdidas sociales asociadas a la pandemia: trabajo, ingresos, acceso a virtualidad, alimentación, hidratación, actividad física y otras condiciones de vida. La economía no existe separada de esas determinaciones concretas y, por ello, el módulo AE se analiza también en relación con información sociodemográfica y con variables procedentes de otros módulos.

Una última precisión metodológica atraviesa todo el documento: cuando el cuestionario, la base analítica y una tabla publicada puedan sugerir codificaciones numéricas diferentes, la unidad de interpretación será siempre la categoría sustantiva, no el número arbitrariamente asignado a ella. La base ENAVIRPA2021csv.csv contiene AE3-AE9 como etiquetas textuales —“Aumentó”, “Disminuyó”, “Sin cambios”, “No es una fuente de ingresos/apoyo” y “No responde”—. El análisis reproducible de este informe utiliza directamente esas etiquetas y no depende de una recodificación numérica no documentada.

I. OBJETIVOS

I.1. Objetivo general

Planear, ejecutar y analizar una encuesta por muestreo vinculada con la crisis sanitaria provocada por el COVID-19, con énfasis en la afectación económica asociada a ella.

I.2. Objetivos específicos

  1. Describir los principales resultados del módulo de Afectación Económica.
  2. Integrar, cuando sea conceptualmente pertinente, información procedente de módulos sociodemográficos, de educación virtual, tecnología, teletrabajo y hábitos de salud.
  3. Examinar qué tipos de inferencia pueden plantearse a partir de los datos recolectados y bajo cuáles restricciones.
  4. Estudiar modelos lineales generalizados, en particular probit y logit, como instrumentos de análisis de variables binarias.
  5. Mostrar la complementariedad entre inferencia estadística y aprendizaje supervisado, distinguiendo ajuste, inferencia y generalización fuera de muestra.
  6. Explicitar las restricciones impuestas por el diseño muestral, la no respuesta, la ausencia de ponderación, la codificación, los patrones de salto y el tamaño muestral.

II. METODOLOGÍA DESCRIPTIVA

II.1. Resumen general

Elemento Descripción
Población de estudio Personas de 18 años o más, usuarias de telefonía celular y residentes en Costa Rica.
Marco operativo Bancos de numeración celular activos construidos a partir de prefijos de las operadoras, según la información utilizada por el curso.
Modo de recolección Entrevistas telefónicas asistidas por computador (CATI), con CSPro 7.4.
Procedimiento de selección Muestreo de bancos telefónicos celulares activos tomando como referencia el procedimiento de Waksberg.
Tamaño originalmente planeado 300 entrevistas, 30 por cada uno de los diez estudiantes participantes.
Tamaño final 235 entrevistas completas.
Trabajo de campo Junio-julio de 2021, de acuerdo con la cronología del curso.
Error de muestreo de referencia ±6,39 puntos porcentuales para una proporción bajo el cálculo idealizado de MAS con p=0,5; no es una medida del error total de encuesta.
Ponderación No se dispuso de un sistema completo de pesos de diseño, ajuste por no respuesta y calibración.
Alcance Ejercicio académico con datos reales; los resultados descriptivos se presentan primordialmente como resultados muestrales.

II.2. Descripción general del proceso de investigación

El levantamiento fue realizado por diez estudiantes del programa de posgrado de la Universidad de Costa Rica. El grupo recibió capacitación para utilizar CSPro 7.4; posteriormente se ensamblaron los módulos elaborados por los distintos integrantes, se realizó una prueba piloto de aproximadamente tres entrevistas por estudiante y se procedió al trabajo de campo. La meta colectiva fue de 300 entrevistas. Se completaron 235.

En el caso del trabajo de campo realizado por José Mauricio Gómez Julián, se registraron 332 llamadas y aproximadamente 18 horas de contacto telefónico. El registro resumido indica 34 teléfonos ocupados, 94 llamadas sin respuesta y 183 llamadas luego de descontar números inactivos. A partir de esos tres números puede obtenerse 1-(128/183)=0,300546; sin embargo, esa cantidad no debe denominarse automáticamente “tasa de respuesta”. Los 55 casos residuales no equivalen necesariamente a entrevistas completas y el denominador tampoco clasifica de manera completa elegibilidad, rechazo, contacto y elegibilidad desconocida. Para una tasa de respuesta estandarizada se necesitarían las disposiciones finales de todos los casos según una definición explícita, como las utilizadas por AAPOR.

En consecuencia, este informe conserva los conteos brutos del registro de llamadas, pero no atribuye al 30,0546 % el significado de una tasa de respuesta estandarizada. El dato verificable para el autor del módulo económico es que se completaron las 30 entrevistas que le correspondían; el dato colectivo verificable es que se completaron 235 de las 300 entrevistas planeadas, es decir, 78,3 % de la meta de producción. Ninguna de esas razones es, por sí sola, una tasa de respuesta probabilística.

II.2.1. Cronograma de actividades

Cronograma de actividades del proceso de ENAVIRPA 2021.

II.2.2. Bancos telefónicos

Bancos telefónicos asignados y utilizados durante el trabajo de campo.

II.2.3. Cronología general del trabajo de campo

Cronología colectiva de entrevistas completas.

II.2.4. Registro de llamadas

Ejemplo del registro de llamadas utilizado durante el trabajo de campo.

II.3. Presentación del módulo Afectación Económica (AE)

AFECTACIÓN ECONÓMICA
AE1

¿Recibe o recibió usted algún beneficio o de apoyo financiero del gobierno, nacional o local, desde que inició la emergencia sanitaria/cuarentena causada por el COVID19?

1.SÍ 2. NO (PASE A AE3) 3. NO SABE/NO RESPONDE (PASE A AE3)

AE2

Por favor, indique cuáles de los siguientes beneficios/apoyos usted recibe o recibió (Respuesta múltiple)

  1. Sí, comida/alimentos

  2. Sí, recursos económicos

  1. Sí, suministros médicos para prevención (guantes, mascarillas, desinfectante, etc.)

    1. Sí, suministros de higiene personal (toallas sanitarias, pañales para bebés, etc.)

      1. NO

        1. NO SABE/NO RESPONDE

Resultado de la emergencia sanitaria/cuarentena causada por el COVID, por favor indique, cómo se han visto afectados sus recursos personales: Han aumentado, disminuido o no han tenido cambios. Aumentó Sin cambios Disminuyó No es una fuente de ingresos / apoyo
AE3 Ingresos o ganancias de un trabajo remunerado 4 3 2 1
AE4 Dinero o bienes recibidos de familiares/amigos que viven en otras partes del país. 4 3 2 1
AE5 Dinero o bienes recibidos de familiares/amigos que viven en otro país. 4 3 2 1
AE6 Ingresos de propiedades de alquiler, inversiones o ahorros 4 3 2 1
AE7 Pensiones y/o jubilaciones u otros pagos sociales. 4 3 2 1
AE8 Apoyo del gobierno 4 3 2 1
AE9 Apoyo/donación de organizaciones no gubernamentales, organizaciones de la sociedad civil, fundaciones u otras organizaciones sin fines de lucro 4 3 2 1
AE10

Además de usted ¿algún otro miembro de su hogar ha sufrido algún cambio en el ingreso económico desde que comenzó la emergencia sanitaria/cuarentena causada por el COVID-19?

  1. No hay cambio en el ingreso 2. Incremento de ingresos 3. Ingreso disminuido

AE11

Desde que comenzó la emergencia sanitaria/cuarentena causada por el COVID-19 ¿Usted diría que el salario o ingreso total que su familia recibe mensualmente les alcanza o no les alcanza para vivir? (SONDEE LA MEJOR RESPUESTA)

  1. No les alcanza, tienen grandes dificultades

    1. No les alcanza, tiene dificultades

      1. Les alcanza justo, sin grandes dificultades

        1. Les alcanza bien, pueden ahorrar

          1. NS/NR

II.3.1. Nota sobre la codificación de AE3-AE9

En el instrumento de captura, AE3-AE9 aparecen con los códigos 4 = Aumentó, 3 = Sin cambios, 2 = Disminuyó y 1 = No es una fuente de ingresos/apoyo. Una tabla posterior puede ordenar esas mismas categorías con otra numeración puramente expositiva. Alguien perfectamente podría creer, al comparar ambos lugares, que los datos fueron interpretados con códigos incompatibles. Eso no tiene por qué ser así, porque el número es sólo una etiqueta y puede recodificarse; lo que sí sería un problema es no poder determinar qué categoría sustantiva representa cada valor durante el análisis.

La base analítica disponible elimina esa ambigüedad porque AE3-AE9 están almacenadas directamente como texto. Por ello, todas las tablas y variables construidas aquí utilizan las categorías semánticas y no una secuencia numérica. De esta forma, la reproducibilidad no depende de reconstruir una recodificación intermedia que no quedó documentada.

II.4. Ítems empleados de otros módulos

II.4.1. MÓDULO SOCIODEMOGRÁFICO (SD)

SOCIODEMOGRÁFICAS
SD1

ENTREVISTADOR(A):

ANOTE SEXO DEL ENTREVISTADO

  1. HOMBRE

    1. MUJER

SD2 Por favor, dígame ¿cuál es su edad? AÑOS /____/____/
SD3 ¿Es Usted costarricense? 1. SI 2. NO
SD5

¿Cuál es el ingreso total mensual de este hogar?

(SONDEAR)

  1. MENOS DE 200 MIL COLONES

    1. 200 MIL A MENOS DE 400 MIL

      1. 400 MIL A MENOS DE 600 MIL

        1. 600 MIL A MENOS DE 800 MIL

  1. 800 MIL A MENOS DE 1 MILLÓN

    1. 1 MILLÓN A MENOS DE 1,5 MILLONES

      1. 1,5 MILLONES O MÁS

        1. NO SABE / NO RESPONDE

II.4.2. MÓDULO EDUCACIÓN VIRTUAL (E)

RETOS DE EDUCACIÓN VIRTUAL
E6 ¿Cuál es la razón por la que no ha participado o matriculado algún programa de educación/formación virtual/en línea?

  1. No cuenta con el tiempo suficiente 2. No cuenta con el dinero suficiente

    1. En este momento no está interesado(a) en capacitarse 4. Le faltan destrezas informáticas

      1. Tiene baja motivación 6. El ambiente virtual le resulta aburrido

        1. Falta de organización del tiempo personal 8. Pospone repetidamente la decisión de iniciar

          1. El ambiente virtual le resulta incómodo 10. No desea iniciar solo(a)

            1. La educación en línea es muy cara 88. Otro: ________________________

              99.NS/NR

II.4.3. MÓDULO TECNOLOGÍA (TC)

TECNOLOGÍA – TOD@S
TC1

¿Cuenta usted con servicio de internet fijo/modem en su casa de habitación?

1. SÍ 2. NO TIENE (PASE A TC3) 9. NS/NR (PASE A TC3)

II.4.4. MÓDULO TELETRABAJO (TE)

TELETRABAJO – JORDAN/ CARLOS

Actualmente, durante una semana típica, ¿Cuál es su principal actividad laboral? SE SELECCIONA LA OPCIÓN QUE MEJOR SE ADECÚE

  1. Trabaja para un patrón (ya sea persona, empresa u hogar.

  2. Ayuda en un negocio familiar (sin remuneración)

  3. Tengo mi propio negocio y empleo a otras personas

  4. Tengo mi propio negocio sin emplear a otras personas

  5. No trabaja, es pensionado(a), jubilado(a)

SI RESPONDE DE 5 A 99 PASE A V1

  1. No trabaja, se dedica al hogar

  2. No trabaja, es estudiante de tiempo completo

  3. No trabaja, por una limitación física/mental que me impide trabajar

  4. No trabaja, no busca trabajo y no está disponible para trabajar

  5. No trabaja, pero está buscando trabajo

  1. Otra

  1. NS/NR

II.4.5. MÓDULO DE SALUD FÍSICA Y MENTAL (FN)

HÁBITOS DE SALUD FÍSICA Y NUTRICIÓN – LUIS
FN2

Con respecto a su consumo de agua, ¿durante la pandemia ha incrementado la cantidad de agua que bebe?:

  1. Sí, ha aumentado 2. No, se ha mantenido igual 3. No, ha disminuido 9. NS//NR

Con respecto a los hábitos de los tiempos de comida, comparando la frecuencia actual con respecto a la frecuencia el año previo a la pandemia, usted considera que han aumentado, disminuido o se mantiene igual: Se mantiene igual Aumentó Disminuyó NS/NR
FN6 Desayuno 1 2 3 9
FN7 Almuerzo 1 2 3 9
FN8 Cena 1 2 3 9
Con respecto a los alimentos que le voy a mencionar. Comparando la frecuencia actual con respecto a sus hábitos el año previo a la pandemia, ¿usted considera que han aumentado, disminuido o se mantiene igual el consumo de …. (LEER ALIMENTO)? NO LO HA COMIDO SI NS/NR
Mantenido Igual Aumentado Disminuido
FN9 Frutas y vegetales 0 1 2 3 9
FN10 Leguminosas (frijoles, garbanzos, lentejas) 0 1 2 3 9
FN11 Lácteos (leche, yogurt, queso) 0 1 2 3 9
FN12 Harinas (arroz, pasta) 0 1 2 3 9
FN13 Carnes o huevo (res, cerdo, pollo, pescado, embutidos) 0 1 2 3 9
FN14 Alimentos/dulces/bebidas fuentes de azúcar. (galletas, Gaseosas, Hi-C, Powerade, etc.), golosinas, chocolates, confites, helados) 0 1 2 3 9
FN15 Grasas y Comidas rápidas (mantequilla, natilla, aderezos, mayonesa) (Pollo frito, papas fritas, pizza, hamburguesas, tacos, repostería, empaquetados (papas tostadas, bolitas de queso, tronaditas, etc.). 0 1 2 3 9

III. PRESENTACIÓN DE RESULTADOS DESCRIPTIVOS

III.1. Módulo AE: afectación económica

III.1.1. AE1. Apoyo financiero del gobierno

Respuesta n %
Sí 56 23,8
No 179 76,2
Total 235 100,0

Cincuenta y seis personas, 23,8 % de la muestra, declararon haber recibido algún beneficio o apoyo financiero del gobierno nacional o local desde el inicio de la emergencia; 179, 76,2 %, respondieron que no.

III.1.2. AE2. Tipo de apoyo recibido

AE2 estaba condicionada por AE1: sólo las 56 personas que respondieron “sí” en AE1 debían contestarla. En la base, los otros 179 registros aparecen correctamente como valores ausentes por salto. No son “no sabe/no responde”; son no aplicables. Como AE2 admitía respuesta múltiple, cada porcentaje debe calcularse sobre las 56 personas elegibles y los porcentajes no tienen por qué sumar 100 %.

Tipo de apoyo Sí (n) % de los 56 No (n) % de los 56
Comida/alimentos 23 41,1 33 58,9
Recursos económicos 48 85,7 8 14,3
Suministros médicos para prevención 4 7,1 52 92,9
Suministros de higiene personal 2 3,6 54 96,4

Por tanto, entre quienes recibieron algún apoyo, 41,1 % declaró alimentos y 85,7 % recursos económicos. No es correcto dividir cada selección entre el total de selecciones efectuadas y describir el resultado como porcentaje de personas.

III.1.3. AE3-AE9. Cambios en fuentes de ingreso y apoyo

Ítem/fuente Disminuyó Aumentó Sin cambios No es fuente NR
AE3 — Ingresos o ganancias de trabajo remunerado 87 (37,0 %) 9 (3,8 %) 90 (38,3 %) 43 (18,3 %) 6 (2,6 %)
AE4 — Dinero/bienes de familiares o amigos dentro del país 26 (11,1 %) 3 (1,3 %) 33 (14,0 %) 168 (71,5 %) 5 (2,1 %)
AE5 — Dinero/bienes de familiares o amigos en otro país 11 (4,7 %) 0 (0,0 %) 17 (7,2 %) 202 (86,0 %) 5 (2,1 %)
AE6 — Ingresos de propiedades de alquiler, inversiones o ahorros 13 (5,5 %) 5 (2,1 %) 21 (8,9 %) 192 (81,7 %) 4 (1,7 %)
AE7 — Pensiones, jubilaciones u otros pagos sociales 7 (3,0 %) 0 (0,0 %) 39 (16,6 %) 185 (78,7 %) 4 (1,7 %)
AE8 — Apoyo del gobierno 8 (3,4 %) 18 (7,7 %) 22 (9,4 %) 185 (78,7 %) 2 (0,9 %)
AE9 — Apoyo de ONG, sociedad civil, fundaciones u otras organizaciones sin fines de lucro 4 (1,7 %) 2 (0,9 %) 13 (5,5 %) 214 (91,1 %) 2 (0,9 %)

El trabajo remunerado fue la fuente con mayor presencia y también la que mostró mayor número de contracciones: 87 personas, 37,0 % de toda la muestra, declararon disminución; nueve, 3,8 %, aumento; y 90, 38,3 %, ningún cambio. En AE6, 192 personas, 81,7 %, indicaron que los ingresos de propiedades de alquiler, inversiones o ahorros no constituían una fuente de ingreso/apoyo durante el periodo observado.

Medios de producción en cuanto capital: alcance de AE6

En el sentido específico utilizado en este análisis, la posesión de medios de producción no designa la mera propiedad de instrumentos empleados personalmente por un productor independiente, sino su posesión en cuanto capital, esto es, como propiedad generadora de ingresos separables del trabajo directo del propietario.

La distinción es sustantiva. Un trabajador por cuenta propia puede poseer herramientas, un vehículo o una máquina y reproducirse mediante su propio trabajo, sin que por ello el ingreso observado provenga de capital en el sentido definido. AE6, en cambio, pregunta por ingresos de propiedades de alquiler, inversiones o ahorros y por ello sirve como indicador empírico de la presencia de ingresos patrimoniales o de propiedad. Bajo esta operacionalización, los 192 casos que dicen que AE6 no es una fuente se clasifican como ausencia observada de ingreso asociado a propiedad-capital; los 39 casos con aumento, disminución o estabilidad se clasifican como presencia de esa fuente; cuatro casos quedan indeterminados por no respuesta.

Esto no equivale a una inspección jurídica del patrimonio. Una persona puede poseer un activo que temporalmente no produzca renta o cuyos beneficios se reinviertan. Eso es un límite de observación, no una objeción al concepto. La inferencia debe formularse entonces como ausencia o presencia observada de ingreso indicativo de propiedad-capital dentro de las categorías capturadas por AE6.

TE1 conserva, por separado, información sobre condición laboral y propiedad de un negocio. Es útil para distinguir asalariados, empleadores y productores independientes, pero no debe confundirse mecánicamente con AE6: “tener negocio propio sin empleados” y “recibir ingresos de propiedad-capital” son variables relacionadas, no idénticas.

III.1.4. AE10. Cambio del ingreso en otros miembros del hogar

Respuesta n %
No hay cambio en el ingreso 112 47,7
Incremento de ingresos 8 3,4
Ingreso disminuido 104 44,3
No responde 11 4,7

El 44,3 % indicó que algún otro miembro del hogar había sufrido disminución de ingresos; 47,7 % no reportó cambio y 3,4 % reportó incremento.

III.1.5. AE11. Suficiencia del ingreso familiar

Respuesta n %
No les alcanza, tienen grandes dificultades 24 10,2
No les alcanza, tiene dificultades 57 24,3
Les alcanza justo, sin grandes dificultades 111 47,2
Les alcanza bien, pueden ahorrar 40 17,0
NS/NR 3 1,3

El 34,5 % declaró que el ingreso no alcanzaba para vivir —10,2 % con grandes dificultades y 24,3 % con dificultades—; 47,2 % indicó que alcanzaba justo y 17,0 % que alcanzaba bien y permitía ahorrar. AE11 mide directamente suficiencia subjetiva del ingreso y se mantiene separado de una línea formal de pobreza.

III.2. Módulo TE: trabajo y teletrabajo

III.2.1. TE1. Actividad principal

Actividad n %
Trabaja para un patrón 105 44,7
Ayuda en negocio familiar sin remuneración 5 2,1
Negocio propio con empleados 11 4,7
Negocio propio sin empleados 33 14,0
Pensionado/jubilado 12 5,1
Se dedica al hogar 40 17,0
Estudiante de tiempo completo 17 7,2
No trabaja por limitación física/mental 1 0,4
No trabaja, no busca y no está disponible 2 0,9
No trabaja, busca trabajo 8 3,4
Otra 1 0,4

La muestra contiene 105 trabajadores asalariados, 33 productores con negocio propio sin empleados y 11 propietarios de negocio con empleados. Sólo esta última categoría identifica directamente una relación de empleador con trabajo ajeno; la categoría de negocio propio sin empleados describe producción independiente. Esta distinción evita transformar toda propiedad de instrumentos o de un pequeño negocio en propiedad capitalista en el sentido sustantivo utilizado para AE6.

III.2.2. TE6. Modificación de jornada o remuneración

Respuesta n % entre 38 aplicables
Menor cantidad de horas 2 5,3
Mayor cantidad de horas 16 42,1
Menor remuneración por igual cantidad de trabajo 6 15,8
Menor remuneración por mayor cantidad de trabajo 7 18,4
Mayor remuneración por mayor cantidad de trabajo 1 2,6
Mayor remuneración por menor cantidad de trabajo 1 2,6
Otro 5 13,2
No aplica por flujo del cuestionario 197 —

TE6 produjo 38 respuestas sustantivas y 197 casos no aplicables por el flujo del módulo. Entre las 38 personas expuestas a la pregunta, 16 —42,1 %— declararon trabajar una mayor cantidad de horas. Este porcentaje no debe proyectarse sobre las 235 entrevistas porque la pregunta no fue formulada a todos los participantes.

III.3. Módulo FN: hábitos de salud física y nutrición

III.3.1. FN2. Hidratación

Respuesta n %
Aumentó 87 37,0
Se mantuvo igual 133 56,6
Disminuyó 14 6,0
NS/NR 1 0,4

III.3.2. FN6-FN8. Frecuencia de tiempos de comida

Tiempo de comida Igual Aumentó Disminuyó
Desayuno 183 (77,9 %) 24 (10,2 %) 28 (11,9 %)
Almuerzo 193 (82,1 %) 19 (8,1 %) 23 (9,8 %)
Cena 185 (78,7 %) 18 (7,7 %) 32 (13,6 %)

III.3.3. FN9-FN15. Cambios en grupos alimentarios

Grupo No consume Igual Aumentó Disminuyó NS/NR
Frutas y vegetales 7 158 49 19 2
Leguminosas 10 179 31 14 1
Lácteos 12 166 26 30 1
Harinas 2 176 28 28 1
Carnes o huevo 1 170 38 25 1
Alimentos/bebidas fuente de azúcar 42 109 27 56 1
Grasas y comidas rápidas 33 115 23 63 1

Una variación de frecuencia no posee por sí sola signo nutricional. Disminuir bebidas azucaradas o comida rápida no tiene el mismo significado que disminuir frutas, vegetales o proteínas. Por ello cualquier índice de “deterioro de dieta” debe apoyarse en una regla nutricional explícita y no en la simple operación “disminuyó = empeoró”.

III.3.4. FN17. Horas de sueño durante la pandemia

Cambio n %
Aumentaron 35 14,9
Se mantuvieron igual 134 57,0
Disminuyeron 63 26,8
NS/NR 3 1,3

Los datos no muestran que 57 % durmiera más: 35 personas —14,9 %— reportaron aumento de las horas de sueño, mientras 63 —26,8 %— reportaron disminución y 134 —57,0 %— estabilidad. El 57 % corresponde a “se mantienen igual”.

III.3.5. FN18. Actividad física

Cambio n %
Aumentó 61 26,0
Se mantuvo igual 110 46,8
Disminuyó 57 24,3
NS/NR 7 3,0

La actividad física aumentó para 61 personas —26,0 %— y disminuyó para 57 —24,3 %—.

III.4. Módulo E: educación virtual

E6 presenta 161 respuestas aplicables y 74 casos no aplicables.

Razón n % sobre 161 aplicables
Tiempo insuficiente 27 16,8
Dinero insuficiente 11 6,8
No está interesado en capacitarse 59 36,6
Faltan destrezas informáticas 8 5,0
Baja motivación 6 3,7
Ambiente virtual aburrido 1 0,6
Falta de organización del tiempo 5 3,1
Pospone repetidamente iniciar 1 0,6
Ambiente virtual incómodo 4 2,5
No desea iniciar solo 1 0,6
Educación en línea muy cara 1 0,6
Otro 22 13,7
NS/NR 15 9,3

La falta de dinero fue señalada por 11 personas, 6,8 % de los casos aplicables y 4,7 % de toda la muestra. La falta de tiempo fue señalada por 27, 16,8 % de los casos aplicables y 11,5 % del total. El denominador debe declararse: usar 235 describe prevalencia en toda la muestra; usar 161 describe la composición de quienes efectivamente recibieron E6.

IV. DISEÑO GENERAL DE LA METODOLOGÍA INFERENCIAL

IV.1. Información de interés

El diseño analítico buscó extraer o construir información sobre: edad; acceso a internet; localización geográfica; nacionalidad; barreras a educación virtual; relación con la riqueza social; cambios en alimentación, hidratación, sueño y actividad física; variación del ingreso; sexo; y suficiencia económica del hogar. La intención era estudiar conjuntamente dimensiones que, separadas en el cuestionario por razones operativas, se encuentran materialmente relacionadas.

La transformación de algunas respuestas en variables dicotómicas tiene utilidad para modelos binarios, pero toda dicotomización sacrifica información. Por ello las variables binarias se consideran construcciones analíticas y no sustitutos ontológicos de los fenómenos continuos o multinomiales de los que proceden.

IV.2. Mecanismo de obtención y operacionalización

  1. Edad: SD2, conservada cuantitativamente cuando sea posible; para algunos modelos se construye además edad25 = 1 si la persona tiene 25 años o más.
  2. Nacionalidad: SD3; se distingue costarricense/no costarricense y se trata NS/NR como faltante.
  3. Sexo: SD1.
  4. Internet fijo: TC1.
  5. Localización rural/urbana: el diseño pretendía construirla a partir de SD13 y la clasificación geográfica del INEC. Esa clasificación no se terminó durante el ejercicio y, por tanto, no entra en los modelos efectivamente estimados.
  6. Propiedad-capital observada: AE6, según la definición sustantiva expuesta antes. 1 si la fuente existe —aumentó, disminuyó o se mantuvo—; 0 si la persona declara que no es fuente; NA si no responde.
  7. Posición ocupacional/propiedad de negocio: TE1 se conserva como variable distinta. Empleador, productor independiente y asalariado no se colapsan en un único indicador de “capital”.
  8. Contracción de ingresos: puede definirse como existencia de al menos una disminución en AE3-AE9 o disminución de ingreso de otro miembro del hogar en AE10. AE11 no debe incorporarse mecánicamente a este indicador porque mide suficiencia corriente, no cambio temporal.
  9. Estrés económico mensual: AE11, conservado ordinalmente o dicotomizado sólo cuando el objetivo lo exija.
  10. Barreras de educación virtual: E6 se analiza entre los casos aplicables. No puede convertirse sin más en “acceso/no acceso” para las 235 personas, porque la ausencia por salto posee un significado distinto de una respuesta negativa.
  11. Dieta: FN6-FN15 requieren reglas sustantivas diferenciadas por tipo de alimento. Una disminución no es necesariamente negativa y un aumento no es necesariamente positivo.
  12. Hidratación: FN2.
  13. Sueño: FN17 y nivel de horas en FN16, cuando sea pertinente.
  14. Actividad física: FN18.

IV.3. Variables dicotómicas de trabajo

Para reproducir el núcleo de los modelos se definen:

  • VD1: nacionalidad, 1 = no costarricense, 0 = costarricense.
  • VD2: presencia observada de ingreso de propiedad-capital según AE6.
  • VD4: sexo, 1 = mujer, 0 = hombre.
  • VD7: 1 = edad mayor o igual a 25 años, 0 = menor de 25.
  • VD8: contracción de ingreso bajo la regla explícita definida en IV.2.

La variable de ruralidad se mantiene como propuesta de diseño, no como variable estimada. La barrera a educación virtual se utiliza descriptivamente, salvo que se restrinja el universo analítico a los casos a los que E6 aplica.

IV.4. Análisis combinados planteados

El primer modelo estudia la presencia observada de ingreso de propiedad-capital en función de sexo, edad y nacionalidad:

\[ VD2_i = f(VD4_i,VD7_i,VD1_i). \]

Ruralidad no se incluye porque no se construyó de forma reproducible.

Un segundo análisis puede estudiar contracción de ingresos en relación con sexo, edad, nacionalidad y barreras de virtualidad, pero sólo después de definir con precisión el universo de E6 y la variable de contracción. Por ello se mantiene como extensión analítica y no se confunde con el modelo efectivamente estimado en la sección IX.

IV.5. Correlación y causalidad

La correlación permite describir covariación; no transforma por sí sola una asociación en mecanismo causal. En una investigación social, la interpretación causal requiere teoría sustantiva, temporalidad, diseño y supuestos de identificación que no están contenidos automáticamente en un coeficiente.

Ritchey utiliza ejemplos vinculados con pobreza, composición racial y criminalidad para mostrar cómo una asociación agregada puede reflejar historia institucional, segregación, exclusión económica y variables omitidas. El argumento metodológico no consiste en sustituir una correlación por otra explicación monocausal, sino en recordar que el coeficiente no contiene toda la estructura causal del fenómeno.

La misma precaución se aplica a categorías raciales contemporáneas. Los resultados sobre origen africano de linajes humanos modernos y posteriores hallazgos de mezcla con poblaciones arcaicas no convierten categorías sociales de raza en unidades biológicas discretas capaces de sustituir el análisis histórico y causal. La regresión cuantifica relaciones bajo un modelo; la causalidad requiere una teoría adicional acerca de cómo se produce el fenómeno.

V. FUNDAMENTO DE ENCUESTAS POR MUESTREO

V.1. Estadística matemática, estimación y encuestas

Cochran subraya que la teoría de encuestas adoptó históricamente procedimientos simples y robustos porque un mismo levantamiento puede contener muchos atributos con distribuciones distintas. Esto no implica separación entre teoría de muestreo y regresión: los estimadores de razón y de regresión utilizan información auxiliar para mejorar precisión.

Conviene, sin embargo, distinguir dos objetos:

\[ \text{estimador de regresión en muestreo} \neq \text{modelo de regresión ajustado a variables de encuesta}. \]

El primero utiliza información auxiliar conocida para estimar mejor una media o total poblacional; el segundo representa una relación condicional entre variables y puede tener finalidades inferenciales o predictivas. Que ambos utilicen la palabra “regresión” no vuelve idénticos sus objetivos.

V.2. Tamaño muestral y el verdadero papel del Teorema Central del Límite

Alguien perfectamente podría creer que utilizar p=0,5 en una fórmula de tamaño muestral se justifica porque, al aumentar n, las respuestas originales “se vuelven normales”, terminan repartiéndose simétricamente y por ello la mitad debe caer en cada categoría. Eso no es así.

Para una variable Bernoulli X_i con valores 0 y 1, la proporción muestral es:

\[ \hat p=\frac1n\sum_{i=1}^nX_i, \]

con:

\[ E(\hat p)=p, \qquad \operatorname{Var}(\hat p)=\frac{p(1-p)}n \]

bajo el esquema independiente ideal. En muestreo sin reemplazo de una población finita aparece además la corrección:

\[ \operatorname{Var}(\hat p) =\frac{p(1-p)}n\frac{N-n}{N-1}. \]

El Teorema Central del Límite entra en otro lugar. Bajo condiciones apropiadas, permite aproximar la distribución muestral de la proporción estandarizada mediante una normal:

\[ \frac{\hat p-p}{\sqrt{p(1-p)/n}} \approx N(0,1). \]

Es una afirmación acerca de la distribución de un estadístico a través de muestras repetidas, no acerca de que la distribución original de las respuestas se transforme en normal. Tampoco implica que p tienda a 0,5.

La razón para utilizar p=0,5 cuando la proporción poblacional es desconocida es algebraica. La varianza Bernoulli depende de:

\[ f(p)=p(1-p)=p-p^2. \]

Su derivada es:

\[ f'(p)=1-2p, \]

y el máximo se alcanza en:

\[ p=\frac12, \qquad p(1-p)=\frac14. \]

Por tanto:

\[ p(1-p)\le 0,25. \]

Elegir p=0,5 maximiza la varianza y produce el tamaño muestral más conservador para un margen de error prefijado. Para una población grande o de tamaño desconocido:

\[ n_0=\frac{z_{\alpha/2}^2p(1-p)}{d^2}. \]

Con z=1,96, p=0,5 y d=0,0639:

\[ n_0\approx235,2. \]

Así se obtiene la escala de las 235 entrevistas. El resultado tiene sentido como cálculo idealizado de precisión de muestreo para una proporción bajo MAS. No demuestra, por sí solo, que el diseño real posea error total ±6,39 %.

Si el tamaño muestral se aproximara al tamaño de una población finita, el factor (N-n)/(N-1) tendería a cero. La razón es elemental: al observar casi toda la población queda cada vez menos incertidumbre debida al muestreo. No ocurre una “normalización” de las respuestas originales.

V.3. No respuesta y la fórmula de Birnbaum-Sirken

Birnbaum y Sirken, retomados por Cochran, estudiaron el sesgo de no disponibilidad. La expresión discutida en el trabajo original puede escribirse, bajo la notación empleada allí, como:

\[ n=\frac{t_\alpha^2}{4d(d-W_2)W_1}-1. \]

La propia condición de la fórmula indica que no existe un n admisible cuando W_2>d. Si al sustituir una tasa de no respuesta superior al error tolerado el denominador cambia de signo y aparece n<0, el resultado no es una magnitud física negativa que deba transformarse tomando valor absoluto. Indica que se ha salido del dominio en el cual la fórmula puede satisfacer la garantía planteada.

Una analogía con el valor absoluto de una elasticidad económica no repara esta violación de condiciones. La conclusión correcta es simplemente: esa fórmula no proporciona una solución admisible para esa combinación de no respuesta y error tolerado.

Este punto es además coherente con la advertencia de Cochran: cantidades sustanciales de no respuesta no se neutralizan mecánicamente aumentando el tamaño de la muestra. Si quienes no responden difieren sistemáticamente de quienes responden, puede persistir sesgo aun con un n grande.

V.4. Tipos de no respuesta y disposiciones de llamadas

Cochran distingue problemas como no cobertura, ausencia temporal, incapacidad para responder y rechazo persistente. En una encuesta telefónica moderna conviene separar además entrevista completa, entrevista parcial, rechazo, no contacto, número no residencial, inelegible y elegibilidad desconocida. Sólo con esas disposiciones finales puede construirse una tasa de respuesta estandarizada.

El manual de trabajo de campo de ENAVIRPA distinguía teléfono ocupado, no responde, inactivo, realizada, pendiente, no realizada, incompleta, rechazo, comercio y repetido. El registro bruto es útil para documentar el proceso, pero una tasa estándar exige conocer la disposición final de cada unidad y las reglas del denominador.

V.5. Margen de error y error total de encuesta

Bajo un MAS ideal, n=235, p=0,5 y 95 % de confianza dan:

\[ 1,96\sqrt{\frac{0,25}{235}}\approx0,0639. \]

Es decir, ±6,39 puntos porcentuales. Ese número se refiere al error de muestreo idealizado. No incorpora automáticamente cobertura, no respuesta diferencial, medición, procesamiento, selección telefónica, ponderación ni incertidumbre adicional de modelos posteriores.

V.6. Factor de expansión y ponderación

El peso base de una unidad probabilísticamente seleccionada es el inverso de su probabilidad de inclusión:

\[ w_i=\frac1{\pi_i}. \]

En un diseño de varias etapas, si una unidad geográfica h, un hogar j dentro de h y una persona i dentro del hogar poseen probabilidades condicionales f_h, f_(j|h) y f_(i|jh), la probabilidad conjunta es:

\[ f_{ijh}=f_hf_{(j|h)}f_{(i|jh)}, \]

y el peso básico:

\[ W_{ijh}=\frac1{f_{ijh}} =\frac1{f_h}\frac1{f_{(j|h)}}\frac1{f_{(i|jh)}}. \]

La similitud entre algunas proporciones muestrales y las poblacionales no demuestra que ponderar sea innecesario. La decisión depende de probabilidades de inclusión y de posteriores ajustes por no respuesta y calibración. ENAVIRPA no reconstruyó un sistema completo de pesos; por ello sus estimaciones no se presentan como si cada observación tuviera demostrado el mismo peso poblacional.

VI. MODELOS LINEALES GENERALIZADOS

El modelo lineal generalizado constituye uno de los ejemplos más claros de cómo una teoría estadística puede desarrollarse conservando una estructura anterior y ampliando, al mismo tiempo, su dominio de aplicación. El modelo lineal clásico no desaparece: queda contenido como caso particular dentro de una construcción más general. La idea esencial consiste en conservar un componente sistemático lineal,

\[ \eta_i=x_i^T\beta, \]

pero abandonar la exigencia de que toda variable de respuesta sea gaussiana y de que su media tenga que coincidir directamente con el predictor lineal. La media condicional,

\[ \mu_i=E(Y_i\mid x_i), \]

se vincula con el predictor mediante una función enlace:

\[ g(\mu_i)=\eta_i. \]

De este modo, regresión lineal normal, regresión logística, modelos de conteo de Poisson y determinadas especificaciones gamma pueden estudiarse dentro de un marco común.

VI.1. Conceptos preliminares: variables, escalas y predictores

Una clasificación tradicional de las escalas de medición distingue variables nominales, ordinales, de intervalo y de razón. La distinción entre discreto y continuo, sin embargo, pertenece a un eje diferente. El número de hijos, por ejemplo, es discreto, pero posee un cero significativo y relaciones de proporción interpretables; por ello puede considerarse una variable discreta en escala de razón. No corresponde convertir “discreto/continuo” en niveles adicionales de la jerarquía nominal-ordinal-intervalo-razón.

También conviene precisar la palabra covariable. Algunas tradiciones aplicadas la utilizaron de manera restringida para predictores continuos. En la teoría moderna de regresión resulta más claro emplearla en sentido amplio: una covariable o predictor puede ser continua, discreta, binaria o categórica mediante una codificación apropiada. Esto es distinto de covarianza, que designa una medida de asociación entre variables.

La palabra factor también depende del contexto. En diseño experimental puede designar una variable categórica controlada o explicativa; en análisis factorial designa un constructo latente. Ninguno de esos significados debe deducirse únicamente del nombre que un programa asigna a una columna.

Estas precisiones son importantes porque el modelo no se decide por el formato informático de la variable, sino por la estructura matemática y probabilística del fenómeno que se desea representar.

VI.2. Vínculo genético con la regresión lineal

Gujarati y Porter recuerdan que el término regresión proviene de los trabajos de Galton sobre la estatura de padres e hijos. El sentido contemporáneo es mucho más amplio: interesa representar cómo cambia la distribución de una respuesta —y, muy frecuentemente, su media condicional— cuando cambian uno o varios predictores.

En el modelo lineal simple:

\[ E(Y_i\mid x_i)=\alpha+\beta x_i. \]

En forma matricial:

\[ \mu=X\beta. \]

La recta ajustada no es sólo un objeto geométrico superpuesto a puntos. Sus coordenadas representan magnitudes observadas y sus parámetros reciben significado estadístico de una especificación probabilística. Esta diferencia permite distinguir ajuste geométrico de modelo estadístico aun cuando ambos compartan herramientas matemáticas.

VI.2.1. Regresión y causalidad

La regresión tampoco convierte automáticamente una asociación en causalidad. Un coeficiente puede cuantificar una relación condicional bajo un conjunto de supuestos sin identificar por sí mismo el mecanismo que la produce. Para interpretar causalmente se necesita teoría sustantiva, estructura temporal, diseño, intervenciones o supuestos de identificación adicionales.

Ritchey utiliza ejemplos relacionados con pobreza, composición racial y criminalidad para mostrar que una correlación agregada puede condensar historia institucional, segregación, exclusión económica, selección y variables omitidas. El punto metodológico no consiste en sustituir una asociación bivariada por otra explicación monocausal; consiste en negar que el coeficiente contenga, por sí mismo, la totalidad del proceso causal.

La misma precaución se aplica a categorías raciales contemporáneas. La evidencia genética sobre un origen africano reciente de linajes humanos modernos y sobre mezcla posterior con poblaciones arcaicas no transforma categorías sociales de raza en unidades biológicas discretas que puedan sustituir el análisis histórico. La regresión mide relaciones bajo una representación; la explicación causal exige reconstruir cómo esas relaciones son producidas.

VI.3. Regresión y mínimos cuadrados no son sinónimos

Conviene distinguir tres objetos: modelo, criterio de estimación y algoritmo numérico. En el modelo gaussiano clásico:

\[ Y=X\beta+\varepsilon, \qquad \varepsilon\sim N(0,\sigma^2I), \]

la estimación de máxima verosimilitud de \(\beta\) coincide con minimizar:

\[ S_2(\beta)=\sum_{i=1}^n(y_i-x_i^T\beta)^2 =\|y-X\beta\|_2^2. \]

De ahí proviene la estrecha relación histórica entre regresión lineal y mínimos cuadrados. Pero puede existir regresión con otros criterios —desviaciones absolutas, pérdidas robustas, penalización— y también pueden utilizarse mínimos cuadrados en problemas que no pretenden construir un modelo probabilístico completo. La coincidencia del caso gaussiano no autoriza a identificar ambos conceptos.

VI.4. Digresión geométrica: normas, métricas, convexidad y discrepancia

La geometría ayuda a comprender por qué mínimos cuadrados posee una forma tan natural. Si

\[ e=y-X\beta, \]

OLS minimiza \(\|e\|_2^2\). En un espacio vectorial finito, para \(p\ge1\),

\[ \|x\|_p=\left(\sum_i|x_i|^p\right)^{1/p} \]

es una norma y produce la métrica

\[ d(x,y)=\|x-y\|_p. \]

Sin embargo, la relación no debe invertirse: no toda métrica está inducida por una norma y una topología no determina por sí misma una distancia única. La estructura topológica establece qué conjuntos son abiertos y qué nociones de continuidad se conservan; la estructura métrica incorpora información adicional de distancia.

La convexidad tampoco debe confundirse con subaditividad y homogeneidad positiva. Una función \(F\) es convexa cuando

\[ F(\lambda x+(1-\lambda)y) \le \lambda F(x)+(1-\lambda)F(y), \qquad 0\le\lambda\le1. \]

Las normas son convexas y satisfacen además otras propiedades, pero éstas no constituyen la definición general de convexidad.

McCullagh y Nelder emplean discrepancia en un sentido más amplio que distancia métrica. En mínimos cuadrados la discrepancia posee una interpretación euclidiana inmediata. En un MLG, en cambio, una medida central es la deviance:

\[ D=2\{\ell(\text{modelo saturado})-\ell(\text{modelo ajustado})\}. \]

La deviance surge de log-verosimilitudes y no necesita satisfacer los axiomas de una métrica. La intuición geométrica puede conservarse —buscar dentro de una clase una representación que discrepe lo menos posible de los datos según un criterio—, pero el criterio no tiene por qué ser una norma \(L_p\).

VI.5. Familias exponenciales

Nelder y Wedderburn identificaron una clase de distribuciones suficientemente amplia para contener varios modelos de interés y suficientemente estructurada para permitir una teoría común. Una forma estándar de la familia exponencial de dispersión es:

\[ f(y_i;\theta_i,\phi) = \exp\left\{ \frac{y_i\theta_i-b(\theta_i)}{a(\phi)} +c(y_i,\phi) \right\}. \]

Aquí \(\theta_i\) es el parámetro natural o canónico y \(\phi\) el parámetro de dispersión. Bajo las condiciones regulares habituales:

\[ E(Y_i\mid x_i)=b'(\theta_i)=\mu_i, \]

\[ \operatorname{Var}(Y_i\mid x_i)=a(\phi)b''(\theta_i). \]

En la notación usual de MLG se resume como:

\[ \operatorname{Var}(Y_i\mid x_i)=\phi V(\mu_i), \]

salvo factores de peso conocidos incorporados por determinadas parametrizaciones. La función \(V(\mu)\) es la función de varianza. Esta expresión muestra una generalización esencial: en el modelo normal homocedástico la varianza puede ser constante, mientras en Bernoulli y Poisson depende sistemáticamente de la media.

Por ejemplo:

Familia Media Función de varianza \(V(\mu)\)
Normal \(\mu\in\mathbb R\) \(1\)
Bernoulli \(0<\mu<1\) \(\mu(1-\mu)\)
Poisson \(\mu>0\) \(\mu\)
Gamma \(\mu>0\) \(\mu^2\)

VI.6. Los tres componentes del MLG

VI.6.1. Componente estocástico

La respuesta pertenece a una familia exponencial. Para un MLG estándar se trabaja generalmente con respuestas condicionalmente independientes:

\[ Y_i\mid x_i\sim\mathcal F(\mu_i,\phi). \]

Esto no exige identidad de distribución en el sentido de compartir la misma media, porque

\[ \mu_i=g^{-1}(x_i^T\beta) \]

puede variar de una observación a otra.

Aquí conviene distinguir esa afirmación de una observación histórica diferente de McCullagh y Nelder. Al discutir principios generales de discrepancia, los autores indican que las observaciones han de ser independientes o, al menos, intercambiables de alguna manera que permita un tratamiento imparcial. La formulación pertenece a su marco conceptual y no equivale a imponer igualdad de todas las medias condicionales de una regresión.

VI.6.2. Componente sistemático

Los predictores producen:

\[ \eta_i = \beta_0+\beta_1x_{i1}+\cdots+\beta_px_{ip} = x_i^T\beta. \]

La linealidad relevante es linealidad en los parámetros. Así,

\[ \eta=\beta_0+\beta_1x+\beta_2x^2 \]

es no lineal respecto de \(x\), pero continúa siendo lineal en \(\beta_0,\beta_1,\beta_2\).

VI.6.3. Función enlace

La media y el predictor se conectan mediante:

\[ g(\mu_i)=\eta_i, \qquad \mu_i=g^{-1}(\eta_i). \]

El enlace permite modelar la media en la escala que corresponde a su dominio. Una probabilidad debe permanecer entre 0 y 1; una media Poisson debe ser positiva. La transformación permite que el predictor lineal opere en una escala más conveniente sin violar esas restricciones.

VI.7. Enlace identidad y enlace canónico

El enlace identidad es:

\[ g(\mu)=\mu, \]

y sólo en ese caso:

\[ \mu=\eta. \]

Un enlace canónico significa otra cosa: se escoge \(g\) de manera que el predictor lineal coincida con el parámetro natural de la familia:

\[ \boxed{\eta_i=\theta_i}. \]

Por ello identidad es el enlace canónico de la normal, logit el de la binomial y log el de Poisson. Para Gamma el enlace canónico es inverso, con la convención de signo correspondiente a la parametrización.

Distribución Enlace canónico
Normal \(g(\mu)=\mu\)
Bernoulli/Binomial \(g(\mu)=\log[\mu/(1-\mu)]\)
Poisson \(g(\mu)=\log\mu\)
Gamma \(g(\mu)\propto1/\mu\)

El enlace canónico posee ventajas algebraicas, pero no es obligatorio. Una respuesta binomial puede emplear probit en lugar de logit si la construcción teórica o empírica lo justifica.

VI.8. Máxima verosimilitud

Los parámetros se estiman normalmente maximizando:

\[ \ell(\beta)=\sum_{i=1}^n\ell_i(\beta). \]

En general las ecuaciones del score,

\[ U(\beta)=\frac{\partial\ell}{\partial\beta}=0, \]

no admiten una solución algebraica cerrada. Esto conduce a procedimientos iterativos.

VI.9. IRLS: distinguir dos algoritmos que comparten nombre

Existe una familia de algoritmos denominada iteratively reweighted least squares utilizada para pérdidas \(L_p\), aproximaciones a mínimos absolutos y regresión robusta. Allí pueden aparecer pesos del tipo

\[ w_i\propto|e_i|^{p-2}. \]

La formulación discutida por Burrus pertenece a ese contexto. Es un IRLS legítimo, pero no explica el IRLS utilizado ordinariamente para ajustar MLG.

En los MLG, IRLS aparece al aplicar Fisher scoring a la log-verosimilitud; con enlaces canónicos existe una relación especialmente estrecha con Newton-Raphson. El recorrido conceptual es:

\[ \text{familia exponencial} \rightarrow \text{log-verosimilitud} \rightarrow \text{score} \rightarrow \text{información de Fisher} \rightarrow \text{Fisher scoring} \rightarrow \text{IRLS}. \]

VI.9.1. Score e información de Fisher

Sea

\[ \eta_i=x_i^T\beta, \qquad \mu_i=g^{-1}(\eta_i). \]

El score puede escribirse, omitiendo detalles de parametrización que no alteran la idea central, como:

\[ U(\beta) = X^T \operatorname{diag}\left( \frac{d\mu_i/d\eta_i}{\phi V(\mu_i)} \right) (y-\mu). \]

La información esperada adopta la forma:

\[ \mathcal I(\beta)=X^TWX, \]

con pesos de trabajo:

\[ \boxed{ w_i = \frac1\phi \frac{(d\mu_i/d\eta_i)^2}{V(\mu_i)} }. \]

Cuando \(1/\phi\) es un factor común puede omitirse para actualizar \(\beta\).

VI.9.2. Respuesta de trabajo

En la iteración \(t\):

\[ \eta_i^{(t)}=x_i^T\beta^{(t)}, \qquad \mu_i^{(t)}=g^{-1}(\eta_i^{(t)}). \]

La aproximación lineal de primer orden conduce a la respuesta de trabajo:

\[ \boxed{ z_i^{(t)} = \eta_i^{(t)} + g'(\mu_i^{(t)})(y_i-\mu_i^{(t)}) }. \]

Como \(g'(\mu)=d\eta/d\mu\), también puede escribirse:

\[ z_i^{(t)} = \eta_i^{(t)} + \frac{y_i-\mu_i^{(t)}}{d\mu_i/d\eta_i}. \]

VI.9.3. Paso ponderado

La actualización se obtiene resolviendo:

\[ \boxed{ \beta^{(t+1)} = (X^TW^{(t)}X)^{-1}X^TW^{(t)}z^{(t)} }. \]

De ahí el nombre del algoritmo: en cada iteración se resuelve un problema de mínimos cuadrados ponderados, pero los pesos y la variable de trabajo cambian porque dependen de la media estimada en la iteración corriente.

El procedimiento puede resumirse así:

  1. elegir valores iniciales admisibles;
  2. calcular \(\eta^{(t)}\);
  3. obtener \(\mu^{(t)}=g^{-1}(\eta^{(t)})\);
  4. construir \(W^{(t)}\);
  5. construir \(z^{(t)}\);
  6. resolver el problema ponderado;
  7. repetir hasta satisfacer un criterio de convergencia.

Tres casos muestran la unidad del método:

Modelo \(d\mu/d\eta\) \(V(\mu)\) Peso salvo escala
Normal + identidad \(1\) \(1\) constante
Poisson + log \(\mu\) \(\mu\) \(\mu\)
Binomial + logit \(\mu(1-\mu)\) \(\mu(1-\mu)\) \(\mu(1-\mu)\)

El caso normal revela el vínculo con OLS: al ser constantes los pesos, la iteración se reduce al problema lineal ordinario.

VI.10. Qué no explica la convergencia de IRLS

Puede resultar tentador pensar que la reponderación “acerca” las observaciones, reduce la varianza de los predictores y que el Teorema Central del Límite hace converger el algoritmo hacia una normal. Eso no ocurre. Los pesos dependen de la varianza condicional y de la derivada del enlace; no desplazan físicamente los valores de \(X\) ni fuerzan \(\operatorname{Var}(X)\to0\).

El TCL aparece en otra parte de la teoría: bajo condiciones regulares contribuye a la aproximación normal asintótica de estimadores de máxima verosimilitud. Ésa es una propiedad inferencial de secuencias de estimadores, no el mecanismo numérico de IRLS.

Tampoco basta escribir

\[ \beta^{(t+1)}=F(\beta^{(t)}) \]

para invocar el teorema del punto fijo de Banach. Ese teorema exige demostrar que \(F\) es una contracción sobre un espacio completo apropiado. La mera existencia de una iteración no prueba contractividad. En la práctica, los MLG pueden presentar problemas de convergencia por mala condición numérica, colinealidad, separación, soluciones de frontera o especificaciones problemáticas.

VI.11. Estadísticos suficientes bajo enlace canónico

Cuando

\[ \theta_i=\eta_i=x_i^T\beta, \]

la parte de la log-verosimilitud que vincula simultáneamente \(y\) y \(\beta\) contiene:

\[ \frac1{a(\phi)}\beta^TX^Ty. \]

Para dispersión fijada y bajo las condiciones habituales de una familia exponencial, la dependencia relevante de la muestra respecto de \(\beta\) aparece a través de \(X^Ty\). Esto explica la estructura de estadísticos suficientes destacada en la teoría clásica de MLG. En modelos log-lineales canónicos con factores, las ecuaciones del score pueden conducir además a igualdades entre determinados márgenes observados y ajustados; se trata de una propiedad de esas especificaciones, no de una regla universal para cualquier enlace.

La unidad conceptual puede condensarse finalmente en:

\[ \boxed{ \text{familia probabilística} + \text{predictor lineal} + \text{función enlace} }. \]

La generalización no consiste en borrar las diferencias entre distribuciones, sino en identificar qué estructura puede permanecer mientras cambian sistemáticamente sus determinaciones particulares.

VII. MODELOS PROBIT Y LOGIT

Los modelos probit y logit aparecen cuando la respuesta es binaria y el objeto inmediato es modelar una probabilidad condicional:

\[ p_i=P(Y_i=1\mid x_i). \]

El problema del modelo lineal de probabilidad es que \(x_i^T\beta\) puede tomar cualquier valor real, mientras una probabilidad debe permanecer en \([0,1]\). Los enlaces probit y logit resuelven esta incompatibilidad transformando la probabilidad a una escala no restringida.

VII.1. Modelo probit

El probit utiliza la función de distribución normal estándar:

\[ \Phi^{-1}(p_i)=x_i^T\beta, \]

de donde:

\[ p_i=\Phi(x_i^T\beta). \]

La respuesta observada continúa siendo Bernoulli; la normal aparece en la función enlace o, en una interpretación equivalente, en un modelo latente donde una variable normal no observada atraviesa un umbral y produce la respuesta 0/1. No debe afirmarse, por tanto, que la variable binaria observada sea normal.

Puede imaginarse:

\[ Y_i^*=x_i^T\beta+u_i, \qquad u_i\sim N(0,1), \]

\[ Y_i=1\quad\text{si}\quad Y_i^*>0, \]

lo que produce precisamente \(P(Y_i=1\mid x_i)=\Phi(x_i^T\beta)\).

VII.2. Modelo logit

El logit utiliza:

\[ \operatorname{logit}(p_i) = \log\left(\frac{p_i}{1-p_i}\right) = x_i^T\beta. \]

Los odds satisfacen:

\[ \frac{p}{1-p}\in(0,\infty), \]

mientras su logaritmo recorre toda la recta real. Invirtiendo el enlace:

\[ p_i = \frac{1}{1+\exp(-x_i^T\beta)}. \]

La función logística general puede escribirse:

\[ f(x)=\frac{L}{1+e^{-k(x-x_0)}}, \]

con asíntotas 0 y \(L\) y simetría central alrededor de \((x_0,L/2)\). En regresión binaria usual se toma \(L=1\).

VII.2.1. Interpretación de los coeficientes

En logit, un coeficiente \(\beta_j\) representa el cambio en log-odds ante una unidad adicional de \(x_j\), manteniendo constantes las demás covariables. Por tanto:

\[ e^{\beta_j} \]

es la razón multiplicativa de odds asociada a ese cambio. Un odds ratio mayor que 1 implica incremento de odds; menor que 1, reducción; igual a 1, ausencia de cambio multiplicativo.

Esto no debe confundirse con un efecto marginal constante sobre la probabilidad. Como

\[ p(x)=\Lambda(x^T\beta), \]

el efecto marginal de una covariable continua es:

\[ \frac{\partial p}{\partial x_j} = \beta_jp(1-p), \]

por lo que depende de la posición del individuo sobre la curva logística.

VII.3. Probit y logit: semejanzas y diferencias

Ambos enlaces son sigmoidales, monotónicos y producen probabilidades admisibles. Sus resultados suelen ser cualitativamente similares en muchas aplicaciones; sus coeficientes no se encuentran, sin embargo, en la misma escala. Logit posee una interpretación particularmente cómoda mediante odds ratios; probit se relaciona naturalmente con una formulación latente normal.

La elección no debe reducirse a costumbre. Puede depender de tradición disciplinar, interpretabilidad, supuestos sustantivos, comparación de ajuste o conveniencia computacional.

VII.4. Inferencia

La máxima verosimilitud produce \(\hat\beta\). Bajo condiciones regulares, la matriz inversa de información proporciona la aproximación de la covarianza de los estimadores. Una prueba Wald individual utiliza:

\[ z_j=\frac{\hat\beta_j}{SE(\hat\beta_j)}. \]

Las pruebas de razón de verosimilitudes comparan modelos anidados mediante:

\[ LR=2\{\ell(\hat\beta_1)-\ell(\hat\beta_0)\}. \]

El criterio AIC es:

\[ AIC=-2\ell(\hat\beta)+2k. \]

Estas cantidades responden a preguntas distintas. Un valor p individual no resume capacidad predictiva; un AIC no prueba causalidad; y un modelo que clasifica razonablemente no convierte automáticamente todos sus coeficientes en parámetros bien identificados.

VII.5. Separación y estimaciones inestables

En regresión binaria puede existir separación completa si una combinación de predictores clasifica perfectamente los casos, o cuasicompleta si la separación ocurre salvo algunas coincidencias. En esas condiciones la máxima verosimilitud ordinaria puede empujar determinados coeficientes hacia magnitudes muy grandes; los errores estándar de Wald crecen y la inferencia convencional deja de ser fiable.

Por ello coeficientes enormes acompañados de errores estándar enormes no deben interpretarse simplemente como “efectos muy grandes no significativos”: pueden ser un síntoma geométrico de separación o de celdas extremadamente escasas. Entre las respuestas posibles están revisar codificaciones, simplificar categorías cuando sea sustantivamente defendible, obtener más observaciones, penalizar o utilizar correcciones de sesgo como la de Firth.

VIII. TEORÍA DEL APRENDIZAJE ESTADÍSTICO

VIII.1. Definición general

Siguiendo a James, Witten, Hastie y Tibshirani, una forma elemental de representar aprendizaje supervisado es:

\[ Y=f(X)+\varepsilon. \]

El problema consiste en estimar la función desconocida \(f\) a partir de los datos. En algunos problemas interesa principalmente predecir nuevas observaciones; en otros, comprender qué variables están asociadas con la respuesta y cómo; en muchos casos ambos objetivos coexisten.

La expresión aprender de los datos no significa prescindir de teoría. Toda elección de variables, representación, clase funcional, pérdida y procedimiento de validación contiene decisiones acerca de qué regularidades se consideran posibles y relevantes.

Históricamente, la estadística desarrolló una tradición particularmente preocupada por modelos probabilísticos, estimación, incertidumbre e inferencia, mientras el aprendizaje automático nació con fuerte influencia de la informática, los algoritmos y el rendimiento predictivo. Esa diferencia ayuda a explicar énfasis culturales, pero no establece una frontera esencial. La estadística predice y el aprendizaje automático utiliza probabilidad e inferencia.

Tampoco es correcto afirmar que los métodos de aprendizaje automático “hacen pocas suposiciones” en sentido absoluto. Muchos desplazan supuestos desde una forma paramétrica explícita hacia un sesgo inductivo: clase de hipótesis, arquitectura, función de pérdida, regularización, invariancias y reglas de entrenamiento.

Un espacio o clase de hipótesis puede escribirse:

\[ \mathcal H=\{h:X\rightarrow Y\}. \]

No es el mismo objeto que las hipótesis \(H_0\) y \(H_1\) de Neyman-Pearson. Existe un parentesco lógico muy general —delimitar posibilidades—, pero los objetos matemáticos y problemas inferenciales son diferentes.

VIII.2. Paradigmas de aprendizaje

En la clasificación elemental:

  • aprendizaje supervisado: se observan pares \((x_i,y_i)\) y se desea aprender una relación que permita predecir \(y\) a partir de \(x\);
  • aprendizaje no supervisado: se observan \(x_i\) sin una respuesta supervisora explícita y se buscan patrones o representaciones;
  • aprendizaje por refuerzo: un agente interactúa con un entorno mediante estados, acciones y recompensas.

El aprendizaje en línea pertenece a otro eje. Describe un procedimiento que actualiza el modelo conforme llegan observaciones. Puede existir aprendizaje supervisado en línea, no supervisado en línea, etc.

En aprendizaje no supervisado, agrupamiento es sólo una posibilidad. También aparecen reducción de dimensionalidad, estimación de densidad, detección de anomalías, reglas de asociación y aprendizaje de representaciones.

VIII.3. Clasificación binaria

Si la clase positiva es el acontecimiento de interés, existen cuatro posibilidades:

  • verdadero positivo (TP): real positivo, predicho positivo;
  • falso positivo (FP): real negativo, predicho positivo;
  • verdadero negativo (TN): real negativo, predicho negativo;
  • falso negativo (FN): real positivo, predicho negativo.

La matriz de confusión organiza esos casos:

Predicho negativo Predicho positivo
Real negativo TN FP
Real positivo FN TP

La matriz puede calcularse sobre entrenamiento, validación, prueba o datos externos. Cuando se calcula sobre los mismos casos utilizados para estimar el modelo, describe rendimiento in-sample.

VIII.4. Métricas de clasificación

La exactitud es:

\[ Accuracy=\frac{TP+TN}{TP+TN+FP+FN}. \]

La tasa de error es su complemento:

\[ Error=\frac{FP+FN}{N}=1-Accuracy. \]

La sensibilidad o recall es:

\[ Sensitivity=\frac{TP}{TP+FN}, \]

y mide la proporción de positivos reales detectados.

La especificidad es:

\[ Specificity=\frac{TN}{TN+FP}. \]

La precision de clasificación, también valor predictivo positivo, es:

\[ Precision=\frac{TP}{TP+FP}. \]

El valor predictivo negativo es:

\[ NPV=\frac{TN}{TN+FN}. \]

Debe evitarse una ambigüedad terminológica: la precision de clasificación no es la precisión metrológica entendida como baja dispersión de mediciones repetidas. Son conceptos distintos que comparten una palabra.

La exactitud puede ser engañosa ante clases desbalanceadas. Si 90 % de los casos pertenece a la clase negativa, un clasificador que siempre responda “negativo” obtiene 90 % de exactitud y, sin embargo, sensibilidad cero. Por ello toda evaluación debe compararse con un baseline y con métricas coherentes con el coste científico de los errores.

VIII.5. Error de entrenamiento y error de generalización

Para un clasificador \(\hat f\), el error observado sobre los datos de entrenamiento es:

\[ \widehat{Err}_{train} = \frac1n\sum_{i=1}^nI(y_i\ne\hat y_i). \]

Pero el objetivo predictivo no es memorizar los datos ya observados. Interesa el rendimiento sobre una observación nueva \((X_0,Y_0)\):

\[ Err_{test} = E\left[I\{Y_0\ne\hat f(X_0)\}\right]. \]

La diferencia es fundamental. Un modelo muy flexible puede ajustarse extraordinariamente bien al entrenamiento y fallar en nuevas observaciones. Este fenómeno es el sobreajuste. Para estimar generalización se reservan conjuntos de prueba, se utiliza validación cruzada u otros procedimientos que impidan evaluar al algoritmo sólo con los casos que ya utilizó para aprender.

VIII.6. Probabilidades, umbrales y clasificación

Un modelo probabilístico como logit produce \(\hat p_i\), no una clase por necesidad lógica. Para clasificar debe elegirse un umbral \(c\):

\[ \hat Y_i=I\{\hat p_i>c\}. \]

Cambiar \(c\) cambia la matriz de confusión. Reducir el umbral suele detectar más positivos y elevar sensibilidad, pero también puede generar más falsos positivos y reducir especificidad. Por ello 0,5 no es un valor sagrado y 0,25 tampoco puede adoptarse sin explicación. La elección debe responder a costes, prevalencia, objetivo del estudio o una regla definida en datos de validación, no a cuál valor produce una apariencia más favorable en el entrenamiento.

Las curvas ROC examinan sensibilidad frente a tasa de falsos positivos a través de todos los umbrales. En problemas de clase positiva escasa, las curvas precision-recall pueden resultar especialmente informativas porque muestran directamente el compromiso entre detección positiva y pureza de las predicciones positivas.

VIII.7. GLM y aprendizaje supervisado

Los MLG son históricamente modelos estadísticos. No obstante, cuando se ajustan a pares \((X,Y)\) para predecir nuevas respuestas funcionan también como procedimientos de aprendizaje supervisado. No es el uso de Bayes lo que produce esta condición: un MLG frecuentista, bayesiano o penalizado puede emplearse predictivamente.

La regresión logística constituye el ejemplo más claro. Modela:

\[ \log\left( \frac{P(Y=1\mid X)}{1-P(Y=1\mid X)} \right) =X\beta. \]

Es, por su estructura, un modelo de regresión probabilística. Pero sus probabilidades pueden convertirse legítimamente en clases mediante un umbral. No existe contradicción:

\[ \boxed{ \text{regresión logística = modelo probabilístico de regresión} } \]

y simultáneamente:

\[ \boxed{ \text{puede utilizarse como clasificador supervisado} }. \]

El origen histórico del método explica su construcción, pero no agota todos sus usos científicos posteriores.

VIII.8. Inferencia y predicción no son dos modelos distintos

Con un mismo logit pueden plantearse preguntas diferentes. Desde una perspectiva inferencial: ¿cuánto cambia la asociación condicional con cada covariable?, ¿qué incertidumbre posee el coeficiente?, ¿qué modelo es compatible con los datos? Desde una perspectiva predictiva: ¿qué probabilidad asigna a un caso no observado?, ¿discrimina mejor que un baseline?, ¿qué errores comete fuera de muestra?

Estas preguntas requieren diagnósticos diferentes, pero no convierten automáticamente al logit en dos algoritmos. El mismo ajuste puede ser estudiado bajo propiedades inferenciales y predictivas. Precisamente por ello es posible que un coeficiente individual sea impreciso y, sin embargo, una combinación de predictores tenga cierta utilidad predictiva; o, a la inversa, que un modelo contenga asociaciones estadísticamente detectables pero discrimine pobremente casos nuevos.

La evaluación de ENAVIRPA que sigue mantiene deliberadamente separadas ambas preguntas.

IX. RESULTADOS INFERENCIALES REPRODUCIBLES

IX.1. Base analítica y auditoría de codificación

La base ENAVIRPA2021csv.csv contiene 235 filas y 161 variables. En AE1 hay 56 “SÍ” y 179 “NO”. En AE2A-AE2D los 179 casos excluidos por el salto de AE1 aparecen como NA, lo que confirma que deben clasificarse como no aplica y no como NS/NR.

AE3-AE9 ya aparecen en la base como etiquetas textuales. Por ello la discrepancia visible entre los códigos 4-3-2-1 del cuestionario y el orden 1-2-3-4 de algunas tablas de presentación deja de afectar la reproducción del análisis: las categorías se procesan por su nombre.

IX.2. Variable principal: ingreso de propiedad-capital

AE6 contiene:

  • 192 casos “No es una fuente de ingresos/apoyo”;
  • 21 “Sin cambios”;
  • 13 “Disminuyó”;
  • 5 “Aumentó”;
  • 4 “No responde”.

La variable binaria principal se define entonces con 39 casos positivos, 192 negativos y cuatro faltantes. Tras eliminar además cuatro edades no respondidas y una nacionalidad NS/NR, la muestra completa para el modelo queda en 227 observaciones: 39 positivas y 188 negativas.

IX.3. Correlaciones entre variables binarias del modelo

Con capital=1 para presencia de la fuente AE6, mujer=1, adulto25=1 y extranjero=1, la matriz de correlaciones de Pearson —equivalente al coeficiente phi cuando ambas variables son binarias— es:

Variable capital adult25 female foreign
capital 1.000 0.011 -0.070 -0.011
adult25 0.011 1.000 0.145 0.056
female -0.070 0.145 1.000 0.009
foreign -0.011 0.056 0.009 1.000

Las asociaciones son pequeñas en magnitud. Esto anticipa que un modelo con esos tres predictores tendrá poca capacidad para explicar la variación del indicador AE6 dentro de esta muestra.

IX.4. Modelo logit

Se estima:

\[ \operatorname{logit}[P(VD2_i=1)] =\beta_0+\beta_1Mujer_i+\beta_2Adulto25_i+\beta_3Extranjero_i. \]

Término Coef. EE z p OR IC 95 % OR
Intercepto -1.5250 0.5578 -2.734 0.006 0.218 [0.073, 0.649]
Mujer (1 = mujer) -0.3893 0.3563 -1.093 0.275 0.678 [0.337, 1.362]
Edad ≥ 25 años 0.1895 0.5838 0.324 0.746 1.209 [0.385, 3.795]
Extranjero (1 = no costarricense) -0.1149 0.6576 -0.175 0.861 0.891 [0.246, 3.235]

El modelo contiene 227 observaciones, log-verosimilitud de -103,51, log-verosimilitud nula de -104,13, pseudo-R² de McFadden de 0,0060 y prueba conjunta de razón de verosimilitudes p=0,740. Ninguno de los tres predictores presenta evidencia estadística individual de asociación distinta de cero a niveles convencionales en esta especificación.

A diferencia de la operacionalización basada en propiedad de negocio de TE1, el indicador AE6 no produce aquí coeficientes explosivos ni errores estándar de miles de unidades. Esa diferencia confirma que la especificación del constructo y la distribución de celdas pueden modificar radicalmente el comportamiento numérico del modelo.

IX.5. Modelo probit

Término Coef. EE z p IC 95 % coef.
Intercepto -0.9099 0.3095 -2.940 0.003 [-1.517, -0.303]
Mujer (1 = mujer) -0.2161 0.1988 -1.087 0.277 [-0.606, 0.174]
Edad ≥ 25 años 0.0952 0.3200 0.297 0.766 [-0.532, 0.722]
Extranjero (1 = no costarricense) -0.0653 0.3631 -0.180 0.857 [-0.777, 0.646]

El probit conduce a la misma conclusión sustantiva: el conjunto de sexo, edad dicotomizada y nacionalidad posee muy poca capacidad explicativa sobre el indicador de ingreso de propiedad-capital observado en AE6. Logit y probit difieren en escala del enlace, por lo que sus coeficientes no deben compararse uno a uno en magnitud.

IX.6. Ruralidad y otros predictores previstos

La ruralidad figuraba en el diseño conceptual, pero no se construyó durante el periodo disponible. No es metodológicamente correcto incluirla fingiendo que una localidad textual es ya una clasificación rural/urbana. El INEC clasifica unidades geográficas mediante criterios específicos; hasta que esa clasificación se aplique reproduciblemente a SD13, la variable debe permanecer fuera del modelo.

De manera similar, E6 no proporciona una variable universal de “acceso a educación virtual”: sólo fue formulada a 161 casos según el flujo del cuestionario. Puede analizarse como barrera entre casos aplicables o incorporarse a un modelo restringido a ese universo, pero no imputarse como “sí” o “no” a los 74 casos omitidos por salto.

X. EVALUACIÓN PREDICTIVA: QUÉ DEMUESTRA Y QUÉ NO DEMUESTRA

Una misma regresión logística puede estudiarse desde dos perspectivas. En inferencia preguntamos qué indican los coeficientes y su incertidumbre acerca de una relación modelada. En predicción preguntamos qué tan bien las probabilidades estimadas generalizan a observaciones que el algoritmo no vio durante el ajuste. No son dos modelos necesariamente diferentes: pueden ser dos evaluaciones del mismo modelo.

Alguien podría creer que basta ajustar el logit a las 235 observaciones y calcular después una matriz de confusión sobre esas mismas observaciones. Eso sólo responde: “¿qué tan bien reproduce el modelo los datos con los que fue estimado?”. No responde: “¿qué tan bien predecirá nuevos casos?”. Es la diferencia entre rendimiento in-sample y generalización.

En la operacionalización AE6 utilizada aquí, las probabilidades ajustadas por el logit se encuentran aproximadamente entre 0,129 y 0,208. Con el umbral c=0,25, ninguna observación supera el corte. El clasificador resultante predice “sin ingreso de propiedad-capital” para las 227 personas:

Métrica con umbral 0,25 Resultado
Verdaderos positivos 0
Verdaderos negativos 188
Falsos positivos 0
Falsos negativos 39
Exactitud 82,8 %
Sensibilidad 0,0 %
Especificidad 100,0 %

La exactitud de 82,8 % no es una victoria predictiva: coincide con la proporción de la clase mayoritaria —82,8 %— y se obtiene a costa de sensibilidad igual a cero. El modelo no identifica ningún caso positivo con ese umbral.

Esto muestra por qué accuracy no debe evaluarse aisladamente en clases desbalanceadas. Un algoritmo que predice siempre la clase mayoritaria puede obtener una exactitud alta y, sin embargo, ser inútil para detectar la clase minoritaria.

El umbral tampoco es una constante matemática universal. Elegir 0,25, 0,5 u otro valor altera el compromiso entre sensibilidad y especificidad. Debe definirse por una función de costes, una necesidad sustantiva o un procedimiento de validación; no por inspección posterior de la misma muestra.

Finalmente, una validación cruzada estratificada de cinco pliegues sobre estos tres predictores produce, como referencia, un AUC ROC aproximado de 0,485 y una precisión promedio (average precision) cercana a 0,167. Son resultados compatibles con una capacidad discriminatoria prácticamente nula en esta especificación. El objetivo pedagógico no es “hacer ganar” a la estadística clásica o al aprendizaje automático, sino mostrar que una afirmación predictiva exige evaluación fuera de muestra.

XI. LIMITACIONES

XI.1. Carácter colectivo del diseño

Los módulos fueron diseñados por diferentes integrantes del curso y ensamblados para un levantamiento común. No existió un único marco teórico que determinara desde el inicio todas las preguntas. Esto limita construcciones posteriores que requieren combinar ítems nacidos con objetivos distintos.

XI.2. Cantidad de entrevistas

Se planificaron 300 entrevistas y se completaron 235. La diferencia reduce precisión y, sobre todo, limita análisis de subgrupos y modelos con muchas categorías. El problema no consiste en que 235 sea intrínsecamente “pequeño”; depende de prevalencias, número de parámetros y estructura de celdas.

XI.3. Diseño, cobertura y ponderación

El marco telefónico excluye a personas fuera de la cobertura operativa y puede introducir diferencias de inclusión. No se reconstruyeron pesos de diseño completos ni ajustes por no respuesta/calibración. Por ello los resultados no se presentan como estimaciones nacionales plenamente ponderadas.

XI.4. No respuesta

Los datos agregados del registro de llamadas no permiten calcular una tasa AAPOR completa. Además, no respuesta y no contacto pueden relacionarse con condiciones socioeconómicas, por lo que no basta aumentar n para garantizar ausencia de sesgo.

XI.5. Ruralidad

La variable rural/urbana fue concebida pero no construida. El INEC asigna grados de urbanización a unidades geográficas específicas; el trabajo necesario para enlazar SD13 con esa clasificación no se completó.

Ejemplo de criterios de clasificación geográfica utilizados por el INEC.

XI.6. Patrones de salto y universos de análisis

AE2, TE6 y E6 muestran por qué NA no posee un único significado. Puede significar no aplicación por salto, no respuesta o dato perdido. El denominador correcto depende del universo de cada pregunta. Tratar todos los ausentes como NS/NR altera porcentajes y puede sesgar variables derivadas.

XI.7. Variables dicotómicas

Dicotomizar edad, dieta, ingreso o estrés económico simplifica la modelización pero sacrifica gradientes. Siempre que sea posible deben conservarse las variables originales y utilizar la dicotomía sólo cuando el modelo o la pregunta sustantiva la justifiquen.

XI.8. Capital como variable observada

AE6 es un indicador de ingreso de propiedad-capital, no un censo patrimonial. Permite distinguir presencia/ausencia observada de esa fuente en el periodo, pero no verificar jurídicamente todos los activos de una persona ni detectar capital sin flujo observado. Éste es un límite de observación.

XI.9. Ingreso y pobreza

SD5 registra tramos de ingreso bruto mensual del hogar, no ingreso disponible equivalizado continuo. Por ello no permite implementar directamente la metodología del 60 % de la mediana de ingreso disponible equivalizado utilizada en el indicador europeo/UNECE de riesgo de pobreza.

XI.10. Causalidad

El estudio es observacional y transversal. Las asociaciones de regresión no identifican por sí solas efectos causales de sexo, edad, nacionalidad u otras variables.

XI.11. Evaluación predictiva

El rendimiento de entrenamiento no es una medida de generalización. Cualquier afirmación predictiva debe apoyarse en datos de prueba independientes o en validación cruzada apropiada y considerar desbalance de clases y selección del umbral.

XII. CONCLUSIONES

  1. Apoyo gubernamental. Cincuenta y seis personas, 23,8 % de la muestra, reportaron haber recibido apoyo. Entre ellas, 85,7 % declaró recursos económicos y 41,1 % alimentos. Como AE2 es de respuesta múltiple, esos porcentajes se calculan sobre personas elegibles y pueden sumar más de 100 %.

  2. Ingreso laboral. El ingreso o ganancia de trabajo remunerado disminuyó para 37,0 % de toda la muestra, aumentó para 3,8 % y se mantuvo sin cambios para 38,3 %.

  3. Ingreso del hogar. En AE10, 44,3 % reportó disminución del ingreso de otro miembro del hogar. En AE11, 34,5 % indicó que el ingreso familiar no alcanzaba para vivir y 47,2 % que alcanzaba justo; 17,0 % afirmó que alcanzaba bien y permitía ahorrar.

  4. Propiedad-capital observada. Para 81,7 % de las personas, AE6 no constituía una fuente de ingreso/apoyo. En el sentido específico utilizado en este análisis, esto indica ausencia observada de ingresos provenientes de propiedad-capital en las categorías preguntadas. No significa que se haya efectuado una inspección jurídica exhaustiva de patrimonio.

  5. Negocio propio y productor independiente. TE1 muestra 33 personas con negocio propio sin empleados y 11 con negocio propio que emplea a otras personas. Esas posiciones no deben colapsarse entre sí ni confundirse automáticamente con AE6.

  6. Organizaciones civiles. Para 91,1 % de la muestra, el apoyo de ONG, fundaciones u organizaciones sin fines de lucro no constituía una fuente de apoyo en AE9.

  7. Remesas del exterior. AE5 era una fuente efectiva para 28 personas —17 sin cambios y 11 con disminución— más cinco no respuestas; 202 declararon que no era fuente. Entre las 28 personas con una respuesta sustantiva que confirma la fuente, 39,3 % reportó disminución.

  8. Trabajo. 44,7 % trabajaba para un patrón. TE6 sólo fue aplicable a 38 personas; dentro de ese universo, 42,1 % señaló mayor cantidad de horas.

  9. Salud y hábitos. La hidratación aumentó para 37,0 %. Las horas de sueño se mantuvieron iguales para 57,0 %, disminuyeron para 26,8 % y aumentaron para 14,9 %. La actividad física aumentó para 26,0 % y disminuyó para 24,3 %.

  10. Educación virtual. Entre los 161 casos aplicables en E6, 6,8 % indicó falta de dinero y 16,8 % falta de tiempo. Sobre las 235 entrevistas, equivalen a 4,7 % y 11,5 %, respectivamente.

  11. Tamaño muestral. El valor p=0,5 se usa porque maximiza p(1-p) y genera un cálculo conservador, no porque el TCL obligue a que las respuestas se distribuyan 50/50. El ±6,39 % es un error de muestreo de referencia bajo MAS ideal, no una garantía del error total de ENAVIRPA.

  12. No respuesta. El 30,0546 % calculado a partir de ocupados y no contestados no constituye por sí solo una tasa de respuesta estandarizada. La fórmula Birnbaum-Sirken no puede repararse tomando valor absoluto cuando sus condiciones producen un n inadmisible.

  13. Inferencia sobre capital. Con la operacionalización AE6, el logit y el probit no encuentran evidencia de asociación sustantiva entre la presencia observada de ingreso de propiedad-capital y sexo, edad ≥25 o nacionalidad en la muestra analítica de 227 casos.

  14. Predicción. Con esos mismos predictores, el modelo posee escasa capacidad discriminatoria. Un umbral 0,25 clasifica todos los casos como negativos y obtiene 82,8 % de accuracy únicamente porque ésa es la clase mayoritaria. La evaluación fuera de muestra es indispensable.

  15. Pobreza. No se presenta una “tasa UNECE de pobreza” a partir de 60 % del ingreso medio bruto del hogar. El estándar relativo requiere mediana del ingreso disponible equivalizado; SD5 no contiene esa variable en la forma necesaria.

  16. Alcance. ENAVIRPA 2021 es especialmente valiosa como ejercicio de metodología aplicada: muestra que diseño, saltos, codificación, no respuesta, operacionalización y criterio de evaluación determinan lo que puede afirmarse con los datos. La corrección técnica no disminuye el valor empírico del levantamiento; delimita con mayor precisión su contenido informativo.

XIII. ANEXO A. DISTANCIAS TOPOLÓGICAS, MÉTRICAS Y COMPORTAMIENTO COLECTIVO

En teoría de grafos, un grafo es un par G=(V,E). Un isomorfismo entre G_1 y G_2 es una biyección f:V(G_1)→V(G_2) que preserva adyacencias:

\[ \{u,v\}\in E(G_1) \Longleftrightarrow \{f(u),f(v)\}\in E(G_2). \]

Ejemplo elemental de grafo.

La preservación de adyacencia implica que se conserva la distancia de grafo, definida como el número mínimo de aristas de un camino entre dos vértices. No implica conservar las distancias euclidianas de una representación gráfica particular.

Dos representaciones de grafos isomorfos.
Ejemplo numérico de isomorfismo de grafos.

Deben separarse tres ideas: isomorfismo de grafos; invariancia topológica bajo homeomorfismos en topología general; y “distancia topológica” en estudios de comportamiento colectivo. Un homeomorfismo no conserva en general distancias métricas —eso corresponde a una isometría—. Por tanto, no es correcto definir una distancia topológica simplemente como una distancia que permanece invariante ante perturbaciones.

En los trabajos de Ballerini y colaboradores sobre bandadas de estorninos, “distancia topológica” significa orden de vecindad: primer vecino, segundo, tercero, etc. La evidencia empírica indicó interacción con aproximadamente seis o siete vecinos, relativamente independiente de la densidad métrica. La diferencia conceptual es:

  • regla métrica: se conserva un radio físico y cambia la cantidad de vecinos contenidos;
  • regla topológica: se conserva aproximadamente el número/orden de vecinos y cambia el radio físico que los contiene.

La anisotropía de la distribución angular de vecinos permitió estimar hasta qué orden persistía la interacción; para una distribución isotrópica el valor esperado del factor pertinente es 1/3. Estudios posteriores con grajillas mostraron además que el régimen puede cambiar con el contexto, apareciendo interacciones topológicas durante tránsito y métricas en otras situaciones. La lección metodológica es material: la estructura relevante debe determinarse empíricamente y puede cambiar con las condiciones concretas del sistema.

XIV. ANEXO B. DISTRIBUCIÓN DEL INGRESO Y CRITERIO DE POBREZA

SD5 registró tramos de ingreso mensual total del hogar. La base contiene:

Tramo declarado n % del total
NS/NR 55 23,4
200 mil a menos de 400 mil 53 22,6
Menos de 200 mil colones 42 17,9
400 mil a menos de 600 mil 24 10,2
1 millón a menos de 1,5 millones 18 7,7
600 a menos de 800 mil 17 7,2
1,5 millones o más 14 6,0
800 a menos de 1 millón 12 5,1

El problema no consiste en que sea imposible estudiar pobreza con una encuesta, sino en aplicar a la variable disponible una definición que corresponda a lo que efectivamente mide. Alguien podría creer que basta tomar 60 % del ingreso medio nacional y comparar ese monto con el ingreso bruto mensual del hogar. Eso no es el criterio relativo utilizado por Eurostat/UNECE.

La medida habitual de riesgo de pobreza utiliza 60 % de la mediana del ingreso disponible equivalizado. Hay tres diferencias importantes:

  1. mediana, no media;
  2. ingreso disponible, no ingreso bruto sin ajustes;
  3. equivalizado, es decir, ajustado por tamaño y composición del hogar.

SD5 registra intervalos de ingreso total del hogar y una categoría de no respuesta. Sin información suficiente para reconstruir ingreso disponible equivalizado individual y su mediana poblacional, no es metodológicamente lícito denominar “tasa UNECE de pobreza” a un porcentaje obtenido aplicando 60 % del ingreso medio bruto.

Sí puede describirse cuántos hogares de la muestra se encuentran en cada tramo y puede utilizarse AE11 como indicador de suficiencia subjetiva del ingreso. También podría diseñarse en el futuro una medición compatible con el estándar relativo recolectando ingreso disponible, composición del hogar y los elementos requeridos para equivalización.

XV. CÓDIGO R PARA REPRODUCCIÓN

El siguiente código está diseñado para ejecutarse con ENAVIRPA2021csv.csv en el mismo directorio que este .Rmd. La base está codificada en Windows-1252.

“`{r carga-datos, message=FALSE, warning=FALSE} datos <- read.csv( “ENAVIRPA2021csv.csv”, fileEncoding = “Windows-1252”, stringsAsFactors = FALSE, check.names = FALSE )

stopifnot(nrow(datos) == 235) stopifnot(all(c(“AE1”,“AE2A”,“AE2B”,“AE2C”,“AE2D”, “AE3”,“AE4”,“AE5”,“AE6”,“AE7”,“AE8”,“AE9”, “AE10”,“AE11”) %in% names(datos)))


## XV.1. Verificación de AE1-AE2 y saltos

```{r ae1-ae2}
table(datos$AE1, useNA = "ifany")
table(datos$AE2A, useNA = "ifany")
table(datos$AE2B, useNA = "ifany")
table(datos$AE2C, useNA = "ifany")
table(datos$AE2D, useNA = "ifany")

# Deben existir 179 NA en AE2A-AE2D porque AE1=NO salta a AE3.
stopifnot(sum(is.na(datos$AE2A)) == 179)
stopifnot(sum(is.na(datos$AE2B)) == 179)
stopifnot(sum(is.na(datos$AE2C)) == 179)
stopifnot(sum(is.na(datos$AE2D)) == 179)

XV.2. Tablas AE3-AE9 usando etiquetas, no códigos numéricos

{r ae3-ae9} vars_ae <- paste0("AE", 3:9) lapply(datos[vars_ae], table, useNA = "ifany")

XV.3. Construcción del indicador de propiedad-capital observada

“`{r capital} datos\(capital <- ifelse( datos\)AE6 == “No es una fuente de ingresos/apoyo”, 0, ifelse( datos$AE6 %in% c(“Disminuyó”, “Aumentó”, “Sin cambios”), 1, NA ) )

table(datos$capital, useNA = “ifany”)


## XV.4. Covariables y muestra del modelo

```{r covariables}
datos$edad <- suppressWarnings(as.numeric(datos$SD2))
datos$adulto25 <- ifelse(is.na(datos$edad), NA, as.integer(datos$edad >= 25))
datos$mujer <- ifelse(datos$SD1 == "Mujer", 1,
                      ifelse(datos$SD1 == "Hombre", 0, NA))
datos$extranjero <- ifelse(datos$SD3 == "No", 1,
                           ifelse(datos$SD3 == "Sí", 0, NA))

modelo <- na.omit(datos[c("capital","mujer","adulto25","extranjero")])
stopifnot(nrow(modelo) == 227)
table(modelo$capital)
cor(modelo)

XV.5. Logit y probit

“`{r modelos-binarios} fit_logit <- glm( capital ~ mujer + adulto25 + extranjero, family = binomial(link = “logit”), data = modelo )

fit_probit <- glm( capital ~ mujer + adulto25 + extranjero, family = binomial(link = “probit”), data = modelo )

summary(fit_logit) summary(fit_probit)

Odds ratios e intervalos Wald aproximados del logit

b <- coef(fit_logit) se <- sqrt(diag(vcov(fit_logit))) OR <- exp(b) IC_OR <- cbind(exp(b – 1.96 * se), exp(b + 1.96 * se)) cbind(Coeficiente = b, EE = se, OR = OR, IC_OR)


## XV.6. Evaluación in-sample con umbral 0,25

```{r clasificacion-insample}
p_hat <- predict(fit_logit, type = "response")
y_hat <- ifelse(p_hat > 0.25, 1, 0)
y <- modelo$capital

TP <- sum(y == 1 & y_hat == 1)
TN <- sum(y == 0 & y_hat == 0)
FP <- sum(y == 0 & y_hat == 1)
FN <- sum(y == 1 & y_hat == 0)

accuracy <- (TP + TN) / length(y)
sensitivity <- TP / (TP + FN)
specificity <- TN / (TN + FP)
precision <- if ((TP + FP) == 0) NA else TP / (TP + FP)
npv <- TN / (TN + FN)

c(TP=TP,TN=TN,FP=FP,FN=FN,
  accuracy=accuracy,sensitivity=sensitivity,
  specificity=specificity,precision=precision,npv=npv)

# Baseline de clase mayoritaria
mean(y == 0)
range(p_hat)

XV.7. Validación cruzada estratificada de cinco pliegues

“`{r validacion-cruzada} set.seed(2021) K <- 5 fold <- rep(NA_integer_, nrow(modelo))

Asignación estratificada simple por clase

for (cl in sort(unique(modelo\(capital))) { idx <- which(modelo\)capital == cl) fold[idx] <- sample(rep(1:K, length.out = length(idx))) }

p_cv <- rep(NA_real_, nrow(modelo)) for (k in 1:K) { train <- modelo[fold != k, ] test <- modelo[fold == k, ] fit_k <- glm(capital ~ mujer + adulto25 + extranjero, family = binomial(link=“logit”), data=train) p_cv[fold == k] <- predict(fit_k, newdata=test, type=“response”) }

Función AUC sin paquetes adicionales (Mann-Whitney / rangos)

auc_rank <- function(y, p) { pos <- y == 1; neg <- y == 0 r <- rank(p, ties.method=“average”) (sum(r[pos]) – sum(seq_len(sum(pos)))) / (sum(pos) * sum(neg)) }

auc_cv <- auc_rank(modelo$capital, p_cv) auc_cv

Matriz de confusión al mismo umbral, sólo como ejemplo.

y_cv <- ifelse(p_cv > 0.25, 1, 0) table(Real=modelo$capital, Predicho=y_cv)


## XV.8. Contracción de ingresos sin mezclarla con suficiencia de AE11

```{r contraccion}
vars_ingreso <- paste0("AE", 3:9)
disminucion_fuente <- apply(
  datos[vars_ingreso], 1,
  function(x) any(x == "Disminuyó", na.rm = TRUE)
)

datos$contraccion_ingreso <- as.integer(
  disminucion_fuente | datos$AE10 == "Ingreso disminuido"
)

# AE11 se mantiene separado como indicador de suficiencia/estrés económico.
table(datos$contraccion_ingreso, useNA="ifany")
table(datos$AE11, useNA="ifany")

XVI. REFERENCIAS

Aldrich, J. H., & Nelson, F. D. (1984). Linear Probability, Logit, and Probit Models. Sage.

American Association for Public Opinion Research. (2016). Standard Definitions: Final Dispositions of Case Codes and Outcome Rates for Surveys (9th ed.). AAPOR.

Ballerini, M., Cabibbo, N., Candelier, R., Cavagna, A., Cisbani, E., Giardina, I., et al. (2008). Interaction ruling animal collective behavior depends on topological rather than metric distance: Evidence from a field study. Proceedings of the National Academy of Sciences, 105(4), 1232-1237.

Birnbaum, Z. W., & Sirken, M. G. (1950). Bias due to non-availability in sampling surveys. Journal of the American Statistical Association, 45(249), 98-111.

Bishop, C. M. (2006). Pattern Recognition and Machine Learning. Springer.

Cann, R. L., Stoneking, M., & Wilson, A. C. (1987). Mitochondrial DNA and human evolution. Nature, 325, 31-36.

Cochran, W. G. (1991). Técnicas de muestreo. Compañía Editorial Continental.

Departamento Administrativo Nacional de Estadística. (2003). Documentación metodológica sobre factores de expansión y diseño muestral. DANE.

Greene, W. H. (2012). Econometric Analysis (7th ed.). Pearson.

Gujarati, D. N., & Porter, D. C. (2010). Econometría (5.ª ed.). McGraw-Hill.

Hastie, T., Tibshirani, R., & Friedman, J. (2009). The Elements of Statistical Learning: Data Mining, Inference, and Prediction (2nd ed.). Springer.

Instituto Nacional de Estadística y Censos de Costa Rica. (2016). Manual de Clasificación Geográfica con Fines Estadísticos de Costa Rica. INEC.

Instituto Nacional de Estadística y Censos de Costa Rica. (2019). ENIGH 2018: Cuadros sobre ingresos de los hogares. INEC.

James, G., Witten, D., Hastie, T., & Tibshirani, R. (2013). An Introduction to Statistical Learning with Applications in R. Springer.

Kolmogórov, A. N., & Fomin, S. V. (1978). Elementos de la teoría de funciones y del análisis funcional. MIR.

Ling, H., Mclvor, G. E., van der Vaart, K., Vaughan, R. T., Thornton, A., & Ouellette, N. T. (2019). Local interactions and their group-level consequences in flocking jackdaws. Nature Communications, 10, 5174.

Lohr, S. L. (2019). Sampling: Design and Analysis (2nd ed.). CRC Press.

McCullagh, P., & Nelder, J. A. (1989). Generalized Linear Models (2nd ed.). Chapman & Hall.

Nelder, J. A., & Wedderburn, R. W. M. (1972). Generalized Linear Models. Journal of the Royal Statistical Society, Series A, 135(3), 370-384.

Reich, D., Green, R. E., Kircher, M., Krause, J., Patterson, N., Durand, E. Y., et al. (2010). Genetic history of an archaic hominin group from Denisova Cave in Siberia. Nature, 468, 1053-1060.

Ritchey, F. J. (2002). Estadística para las ciencias sociales: el potencial de la imaginación estadística. McGraw-Hill.

United Nations Economic Commission for Europe. (2017). Guide on Poverty Measurement. United Nations.

Vapnik, V. N. (1998). Statistical Learning Theory. Wiley.

Waksberg, J. (1978). Sampling methods for random digit dialing. Journal of the American Statistical Association, 73(361), 40-46.

Wooldridge, J. M. (2010). Econometric Analysis of Cross Section and Panel Data (2nd ed.). MIT Press.


Descubre más de Marxist Philosophy of Science

Suscríbete para recibir las últimas entradas en tu correo electrónico.

Follow the blogSeguí al blog

Comments

Leave a Comment/Deja un Comentario

Descubre más de Marxist Philosophy of Science

Suscríbete ahora para seguir leyendo y obtener acceso al archivo completo.

Continuar leyendo