Estadística matemática · Regresión · Máxima verosimilitud
Modelos lineales generalizados
Del modelo lineal clásico a una teoría unificada para respuestas normales, binarias, de conteo y otras familias exponenciales
El modelo lineal generalizado constituye uno de los ejemplos más claros de cómo una teoría científica puede desarrollarse no mediante la negación absoluta de una estructura anterior, sino conservando aquello que ésta posee de general y modificando las restricciones que limitan su campo de aplicación. El modelo lineal clásico no desaparece: queda contenido como un caso particular dentro de una estructura más amplia.
La idea central es sorprendentemente económica. Se conserva un componente sistemático lineal,
pero ya no se exige que la variable de respuesta sea gaussiana ni que su media deba coincidir directamente con el predictor lineal. La media \(\mu_i=E(Y_i\mid x_i)\) se relaciona con \(\eta_i\) mediante una función enlace:
A partir de esta modificación relativamente simple puede construirse una teoría común para la regresión lineal normal, la regresión logística, los modelos de conteo de Poisson, ciertos modelos gamma y otras distribuciones pertenecientes a la familia exponencial.
Lo que se generaliza no es la ausencia de estructura lineal. Se generaliza el modo en que esa estructura lineal se relaciona con la distribución probabilística de la respuesta.
1. Conceptos preliminares
Antes de estudiar el modelo conviene distinguir varias clasificaciones que con frecuencia aparecen mezcladas en la exposición elemental de la estadística.
Una clasificación tradicional de las escalas de medición distingue variables nominales, ordinales, de intervalo y de razón. La distinción entre discreto y continuo, sin embargo, pertenece a otro eje clasificatorio. No debe entenderse como un quinto nivel de la misma jerarquía.
El número de hijos es una variable discreta, pero posee además un cero sustantivo y relaciones de proporción interpretables. Por ello es natural describirla como una variable discreta en escala de razón, y no simplemente como una variable de intervalo.
Algo semejante ocurre con la palabra covariable. Algunos textos aplicados han utilizado el término en un sentido estrecho para referirse a predictores continuos. En la teoría moderna de regresión y de modelos lineales generalizados resulta más útil emplearlo en sentido amplio: una covariable o predictor puede ser continua, discreta, binaria o categórica debidamente codificada.
Un factor, por su parte, puede designar una variable categórica independiente en el lenguaje del diseño experimental, mientras que en análisis factorial designa un constructo latente. El significado debe establecerse por el contexto y no únicamente por la palabra.
Estas precisiones terminológicas no son accesorias. Un modelo estadístico debe construirse de acuerdo con las propiedades matemáticas de la respuesta y de los predictores, y no a partir del nombre que un programa estadístico adjudique a una columna de datos.
2. El vínculo genético con la regresión lineal
2.1. De Galton a la formulación moderna
Gujarati y Porter recuerdan que el término regresión proviene de los trabajos de Francis Galton sobre la estatura de padres e hijos. El significado moderno del análisis de regresión se amplió considerablemente: interesa estudiar cómo cambia la distribución —y en particular algún parámetro de ésta, normalmente su media— de una variable de respuesta cuando cambian una o más variables explicativas.
En el caso lineal simple:
La recta no constituye meramente un objeto geométrico colocado sobre un conjunto de puntos. Sus coordenadas representan magnitudes del problema empírico y sus parámetros poseen una interpretación estadística condicionada por la especificación del modelo.
En forma matricial:
donde \(\mu=E(Y\mid X)\), \(X\) es la matriz del modelo y \(\beta\) el vector de parámetros desconocidos.
3. Regresión, correlación y causalidad
Hay aquí una primera advertencia que no conviene perder. Gujarati y Porter, apoyándose en Kendall y Stuart, insisten en que una asociación estadística, por fuerte que sea, no establece por sí sola una conexión causal. La información causal requiere contenido externo al coeficiente: teoría, diseño, conocimiento histórico, temporalidad, intervenciones o supuestos identificadores adicionales.
Ritchey ilustra esta distinción mediante correlaciones observadas entre composición racial, pobreza y criminalidad en determinadas comunidades estadounidenses. El valor pedagógico del ejemplo no consiste en sustituir una correlación bivariada por otra explicación monocausal, sino en mostrar que una asociación agregada puede reflejar variables omitidas, selección, historia institucional y mecanismos sociales que el coeficiente original no identifica.
La argumentación que aquí se sostiene es más general: ni una categoría racial, ni la pobreza, ni cualquier otra variable adquieren estatus causal por aparecer asociadas a un resultado. La interpretación causal debe establecer el mecanismo y distinguir entre relaciones biológicas, económicas, históricas e institucionales.
Esto importa particularmente en el caso de las categorías raciales. Los estudios de ADN mitocondrial de Cann, Stoneking y Wilson aportaron evidencia importante en favor de un origen africano reciente de linajes maternos humanos. La investigación genómica posterior mostró, además, que las poblaciones humanas modernas fuera de África experimentaron cierto grado de mezcla con poblaciones humanas arcaicas, entre ellas neandertales y denisovanos. Ninguno de estos resultados convierte las categorías raciales sociales contemporáneas en unidades biológicas discretas capaces de sustituir el análisis causal.
La regresión puede cuantificar una relación condicional. Convertir esa relación en una explicación causal exige información que no está contenida automáticamente en la pendiente estimada.
4. Regresión y mínimos cuadrados no son sinónimos
Conviene distinguir el modelo, el criterio de ajuste y el algoritmo utilizado para encontrar una solución. Una regresión lineal especifica una estructura estadística; mínimos cuadrados constituye un criterio particular de estimación.
En el modelo gaussiano clásico:
la estimación por máxima verosimilitud de \(\beta\) es equivalente a minimizar:
De esta equivalencia proviene la extraordinaria importancia de mínimos cuadrados en la regresión lineal clásica. Pero la equivalencia depende de la estructura probabilística especificada. No significa que «regresión» y «mínimos cuadrados» sean la misma cosa.
Puede utilizarse, por ejemplo, un criterio de desviaciones absolutas:
o métodos robustos, penalizados y otros procedimientos de estimación. La elección del criterio cambia las propiedades estadísticas y geométricas del ajuste.
El ajuste geométrico de una función a puntos y la inferencia estadística pueden compartir herramientas matemáticas, pero sólo en la segunda los puntos son observaciones generadas bajo una especificación probabilística acerca de un fenómeno.
5. Las familias exponenciales
La generalización de Nelder y Wedderburn parte de una clase de distribuciones lo suficientemente amplia como para contener numerosos modelos de uso habitual y, al mismo tiempo, conservar una estructura matemática común.
Una forma estándar de escribir una familia exponencial de dispersión es:
Aquí \(\theta_i\) es el parámetro natural o canónico y \(\phi\) un parámetro de dispersión. De esta forma se obtiene:
En la notación habitual de los MLG se escribe:
salvo factores de peso conocidos que pueden introducirse según la parametrización. La función \(V(\mu)\) es la función de varianza.
Esta expresión contiene una de las generalizaciones esenciales. En el modelo normal homocedástico la varianza puede ser constante; en otros MLG cambia sistemáticamente con la media.
6. Los tres componentes del modelo lineal generalizado
Nelder y Wedderburn organizaron la teoría mediante tres componentes.
6.1. Componente aleatorio
La respuesta procede de una distribución perteneciente a una familia exponencial. Para \(n\) observaciones se trabaja usualmente con respuestas condicionalmente independientes:
Que las observaciones pertenezcan a una misma familia no obliga a que posean la misma media. Precisamente:
puede cambiar de una observación a otra. En ese sentido, en un modelo de regresión las respuestas condicionadas son típicamente independientes pero no idénticamente distribuidas en el sentido de compartir todos sus parámetros.
Esta precisión no invalida una observación diferente de McCullagh y Nelder. Al discutir principios generales para medir discrepancias entre observaciones, los autores señalan que éstas deben ser independientes o, al menos, intercambiables en algún sentido que justifique un tratamiento imparcial. Ésa es una condición conceptual sobre la comparabilidad de las contribuciones; no debe confundirse con exigir que todas las medias condicionales de un modelo de regresión sean idénticas.
6.2. Componente sistemático
Las covariables producen el predictor lineal:
Las \(x_{ij}\) son covariables, predictores o variables explicativas, no «covarianzas». Pueden representar cantidades continuas, variables binarias, niveles de factores correctamente codificados, transformaciones e interacciones.
6.3. Función enlace
La media y el predictor se conectan mediante:
Equivalentemente:
La función enlace permite que el predictor continúe tomando valores sobre una escala lineal no restringida mientras la media permanezca dentro del dominio permitido por la distribución de respuesta.
7. Funciones enlace y enlaces canónicos
Es importante separar dos conceptos. El enlace identidad es:
por lo que sólo en ese caso:
Un enlace canónico significa algo diferente. Se elige \(g\) de forma que el predictor lineal coincida con el parámetro natural de la familia exponencial:
Por ello, la identidad es el enlace canónico para el modelo normal, pero no para todas las familias.
| Distribución | \(\mu\) | \(V(\mu)\) | Enlace canónico |
|---|---|---|---|
| Normal | \(\mu\in\mathbb{R}\) | \(1\) | \(g(\mu)=\mu\) |
| Bernoulli / Binomial | \(0<\mu<1\) | \(\mu(1-\mu)\) | \(\log[\mu/(1-\mu)]\) |
| Poisson | \(\mu>0\) | \(\mu\) | \(\log\mu\) |
| Gamma | \(\mu>0\) | \(\mu^2\) | Proporcional a \(1/\mu\) |
El enlace canónico tiene propiedades algebraicas particularmente convenientes, pero no es el único enlace permitido. Para una respuesta binomial, por ejemplo, logit es el enlace canónico, mientras probit constituye una alternativa perfectamente legítima si la estructura científica o empírica la justifica.
Enlace canónico no significa «media igual a predictor». Significa que el predictor lineal modela directamente el parámetro natural de la familia exponencial.
8. Discrepancia, normas y geometría del ajuste
La geometría proporciona una intuición útil para comprender algunos criterios de ajuste. Si definimos el vector de residuos de un modelo lineal:
la estimación ordinaria por mínimos cuadrados minimiza su longitud euclidiana al cuadrado:
En un espacio vectorial finito, las normas:
inducen métricas mediante:
La desigualdad triangular, positividad y homogeneidad de las normas hacen posible esta construcción. Pero conviene no invertir la relación lógica: no toda métrica proviene de una norma, y una estructura topológica tampoco determina por sí sola una distancia particular.
8.1. Convexidad
Otra noción importante es la convexidad. Para una función real \(F\):
Las propiedades de subaditividad y homogeneidad que aparecen al estudiar normas y funcionales sublineales están estrechamente relacionadas con este contexto, pero no deben confundirse con la definición general de función convexa.
8.2. Discrepancia no significa necesariamente distancia métrica
McCullagh y Nelder utilizan el concepto de discrepancia en un sentido más amplio que el de distancia métrica. La idea general es medir cuánto se aparta un modelo de los datos bajo un criterio apropiado. En mínimos cuadrados ese criterio posee una representación euclidiana particularmente directa. En un MLG, el criterio natural nace de la verosimilitud.
La deviance de un modelo puede escribirse como:
La deviance es una medida de discrepancia basada en log-verosimilitudes; no necesita satisfacer los axiomas de una métrica y no debe ser identificada sin más con una norma \(L_p\).
Ajustar un modelo continúa siendo, en un sentido amplio, buscar dentro de una clase teórica una representación que discrepe lo menos posible de las observaciones según un criterio definido. Lo que cambia de un método a otro es precisamente la naturaleza matemática de ese criterio.
9. Máxima verosimilitud e IRLS
Los parámetros de un MLG se estiman normalmente por máxima verosimilitud. Para observaciones independientes:
Excepto en casos especiales, las ecuaciones:
no poseen una solución algebraica cerrada. Nelder y Wedderburn mostraron que podían resolverse mediante un procedimiento iterativo que en cada paso tiene la forma de una regresión de mínimos cuadrados ponderados.
9.1. Dos algoritmos distintos pueden llamarse IRLS
Aquí es necesaria una distinción que evita una confusión frecuente. Existe una familia de algoritmos de iteratively reweighted least squares utilizada para minimizar pérdidas \(L_p\), aproximar mínimos absolutos o construir estimadores robustos. En esos algoritmos los pesos pueden depender de potencias de los residuos, por ejemplo mediante expresiones relacionadas con:
Éste es el contexto de la formulación presentada por Burrus. Es un IRLS legítimo, pero no es la derivación que explica el ajuste ordinario de los modelos lineales generalizados.
En los MLG, IRLS aparece al aplicar Fisher scoring —y, bajo enlaces canónicos, estrechamente Newton-Raphson— a la log-verosimilitud.
9.2. Score e información
Si:
el vector score puede escribirse, salvo la parametrización del factor de dispersión, como:
La información esperada de Fisher adopta la forma:
con pesos de trabajo:
El factor común \(1/\phi\) puede omitirse durante la estimación de \(\beta\) cuando no afecta la solución.
9.3. La respuesta de trabajo
En la iteración \(t\) se calcula:
y:
Se construye entonces la respuesta de trabajo:
Equivalentemente, puesto que \(g'(\mu)=d\eta/d\mu\):
9.4. El paso de mínimos cuadrados ponderados
Dados \(W^{(t)}\) y \(z^{(t)}\), la actualización es:
Por ello el procedimiento recibe su nombre: en cada iteración se resuelve un problema de mínimos cuadrados ponderados, pero los pesos y la respuesta de trabajo cambian porque dependen de la estimación corriente de la media.
- Elegir valores iniciales admisibles para \(\mu^{(0)}\) o \(\beta^{(0)}\).
- Calcular \(\eta^{(t)}=X\beta^{(t)}\).
- Calcular \(\mu^{(t)}=g^{-1}(\eta^{(t)})\).
- Construir los pesos \(W^{(t)}\).
- Construir la respuesta de trabajo \(z^{(t)}\).
- Resolver la regresión ponderada para obtener \(\beta^{(t+1)}\).
- Repetir hasta satisfacer un criterio de convergencia.
9.5. Tres casos reveladores
| Modelo | \(d\mu/d\eta\) | \(V(\mu)\) | Peso, salvo escala |
|---|---|---|---|
| Normal + identidad | \(1\) | \(1\) | Constante |
| Poisson + log | \(\mu\) | \(\mu\) | \(\mu\) |
| Binomial + logit | \(\mu(1-\mu)\) | \(\mu(1-\mu)\) | \(\mu(1-\mu)\) |
El primer caso muestra de manera particularmente clara el vínculo genético entre el modelo lineal clásico y el MLG. Con respuesta normal, enlace identidad y varianza constante, los pesos no cambian entre observaciones y el problema vuelve al ajuste ordinario por mínimos cuadrados.
IRLS convierte localmente un problema no lineal de máxima verosimilitud en una sucesión de problemas lineales de mínimos cuadrados ponderados.
10. Convergencia: qué hacen y qué no hacen el TCL y Banach
La naturaleza iterativa del algoritmo invita a relacionarlo con resultados generales sobre convergencia, pero conviene hacerlo con precisión.
El Teorema Central del Límite no explica la convergencia mecánica de IRLS. Los pesos del algoritmo no actúan acercando físicamente los valores de \(X\) ni haciendo que:
El TCL sí reaparece en otro nivel: bajo condiciones regulares, forma parte del aparato asintótico que ayuda a justificar la aproximación normal de estimadores de máxima verosimilitud cuando el tamaño muestral aumenta. Ése es un problema inferencial, distinto de la convergencia numérica de las iteraciones.
El teorema del punto fijo de Banach ofrece, por su parte, una condición suficiente muy poderosa: si un operador es contractivo sobre un espacio métrico completo y deja invariante el conjunto pertinente, existe un punto fijo único y las iteraciones convergen hacia él.
Pero de:
no se deduce automáticamente que \(F\) sea una contracción. Por tanto, Banach no garantiza por sí solo que cualquier implementación de IRLS deba converger.
En la práctica pueden aparecer dificultades debidas a mala condición numérica, colinealidad, valores iniciales inadecuados, separación en modelos logísticos, parámetros en la frontera o modelos mal especificados.
Fisher scoring / Newton: explica la actualización de IRLS.
Banach: ofrece un teorema general de convergencia cuando se
demuestra contractividad.
TCL: pertenece principalmente a la teoría asintótica de la
inferencia, no al mecanismo que repondera las observaciones.
11. Enlaces canónicos y estadísticos suficientes
El enlace canónico produce una simplificación adicional. Si:
la parte de la log-verosimilitud que depende simultáneamente de \(y\) y de \(\beta\) puede escribirse:
Para dispersión fijada y bajo las condiciones habituales de la familia exponencial, la dependencia de los datos respecto de \(\beta\) aparece así a través de:
Ésta es la razón por la que, en los MLG canónicos, determinadas combinaciones lineales de las observaciones constituyen estadísticos suficientes para los parámetros de regresión.
En modelos log-lineales con factores categóricos, las ecuaciones del score conducen además, bajo las especificaciones correspondientes, a igualdades entre ciertos totales marginales observados y ajustados. Es una propiedad particular de la estructura canónica, no una característica universal de cualquier enlace o cualquier MLG.
12. Síntesis
La importancia de los modelos lineales generalizados puede comprenderse ahora con mayor nitidez. Nelder y Wedderburn no sustituyeron el modelo lineal por una colección desconectada de procedimientos particulares. Identificaron una estructura común.
Cambiar la familia modifica la relación entre media y varianza. Cambiar el enlace modifica la forma en que la media se relaciona con el predictor. Lo que permanece es la estructura lineal del componente sistemático.
Desde este punto de vista, la regresión lineal normal, la regresión logística y la regresión de Poisson no son técnicas sin parentesco. Son manifestaciones particulares de una misma construcción:
+
diferentes leyes probabilísticas
+
diferentes funciones enlace
Y también se hace visible una enseñanza metodológica más general. El carácter unificado de una teoría no proviene de borrar las diferencias entre sus objetos, sino de encontrar la estructura que permanece válida mientras se modifican sistemáticamente sus determinaciones particulares.
Ése es precisamente el papel del modelo lineal generalizado: conservar la parte lineal allí donde sigue siendo útil, abandonar las restricciones que no corresponden al fenómeno y ofrecer un mecanismo común de estimación basado en la verosimilitud.
Referencias
Cann, R. L., Stoneking, M., & Wilson, A. C. (1987). Mitochondrial DNA and human evolution. Nature, 325, 31–36.
Green, R. E., et al. (2010). A draft sequence of the Neandertal genome. Science, 328(5979), 710–722.
Gujarati, D. N., & Porter, D. C. (2010). Econometría (5.ª ed.). México: McGraw-Hill.
Kolmogórov, A. N., & Fomin, S. V. (1978). Elementos de la teoría de funciones y del análisis funcional. Moscú: MIR.
Lipschutz, S. (1992). Álgebra lineal. Madrid: McGraw-Hill.
McCullagh, P., & Nelder, J. A. (1989). Generalized Linear Models (2nd ed.). London: Chapman & Hall.
Nelder, J. A., & Wedderburn, R. W. M. (1972). Generalized Linear Models. Journal of the Royal Statistical Society, Series A, 135(3), 370–384.
Reich, D., et al. (2010). Genetic history of an archaic hominin group from Denisova Cave in Siberia. Nature, 468, 1053–1060.
Ritchey, F. J. (2002). Estadística para las ciencias sociales: el potencial de la imaginación estadística. México: McGraw-Hill.


Leave a Comment/Deja un Comentario