Espartaco

“Is that to say we are against Free Trade? No, we are for Free Trade, because by Free Trade all economical laws, with their most astounding contradictions, will act upon a larger scale, upon the territory of the whole earth; and because from the uniting of all these contradictions in a single group, where they will stand face to face, will result the struggle which will itself eventuate in the emancipation of the proletariat.”

Karl Heinrich Marx · Marx-Engels Collected Works, Vol. VI, p. 290

26,548 views since December 2020

26,548 visitas desde diciembre de 2020

EnglishEspañol

SOBRE LA DISTRIBUCIÓN BINOMIAL NEGATIVA 2

Probabilidad · Datos de Conteo · Modelos Jerárquicos

Cuando los conteos se niegan a comportarse: comprendiendo la Distribución Binomial Negativa II como instrumento de medición

Una lectura guiada de Algunas reflexiones sobre la distribución binomial negativa II como instrumento de medición, de José Mauricio Gómez Julián: desde la serie geométrica y las mixturas de probabilidad hasta la sobredispersión, la heterogeneidad latente y la simulación en R.

Mauricio Gómez Julián · Probabilidad Teórica y Aplicada · Lectura aproximada de 15 minutos
Nota de lectura. Este ensayo explica el trabajo en sus propios términos procurando, al mismo tiempo, mantener la precisión matemática. Cuando resulta necesaria alguna puntualización técnica —especialmente en el paso de una distribución exponencial de mezcla a la Distribución Binomial Negativa II general— se indica explícitamente en lugar de modificar silenciosamente el argumento del artículo.

La pregunta que organiza el trabajo

Los datos de conteo aparecen en todas partes. Un economista cuenta quiebras empresariales, huelgas, impagos, patentes, accidentes o entradas a un mercado. Un politólogo cuenta protestas, cambios de gabinete, episodios de violencia, vetos legislativos o disputas internacionales. Un biólogo cuenta organismos supervivientes, mutaciones, infecciones o descendientes. El modelo elemental para muchos de estos problemas es la distribución de Poisson. Pero los conteos reales suelen fluctuar más de lo que permite un modelo de Poisson. Su varianza es mayor que su media: los datos presentan sobredispersión.

La Distribución Binomial Negativa II —habitualmente abreviada como NB2— constituye uno de los principales instrumentos estadísticos para estudiar precisamente este tipo de situaciones. Pero el trabajo de Gómez Julián no se conforma con presentar la función de masa de probabilidad de la NB2, enumerar sus momentos y seguir adelante. La pregunta que lo organiza es más amplia: ¿qué clase de objeto es una distribución de probabilidad, de dónde proviene, qué otras distribuciones contiene o presupone y qué ganamos al comprender su proceso de construcción en lugar de limitarnos a observar su fórmula terminada?

El trabajo posee, por ello, dos ejes explícitos. El primero —y al que se concede mayor importancia— estudia la NB2 como resultado de una estructura teórica más amplia constituida por modelos jerárquicos y mixturas de probabilidad. El segundo estudia la NB2 como distribución individual: su forma, interpretación, momentos y utilización práctica, incluyendo cálculos manuales y aplicaciones en R. La unidad buscada entre ambos ejes es filosófica además de matemática: las distribuciones de probabilidad se conciben como instrumentos para medir fenómenos naturales y sociales bajo condiciones de incertidumbre, y el trabajo sostiene que su historia, estructura formal, interpretación científica y aplicación no deberían separarse artificialmente.

Una distribución resulta más fácil de comprender cuando observamos no sólo la fórmula terminada, sino también el proceso que la produce.
· · ·

¿Por qué comenzar con la serie geométrica?

El trabajo comienza sorprendentemente lejos de la regresión para datos de conteo: con la serie geométrica, sus raíces históricas y su relación con el teorema binomial. Esto es deliberado. Gómez Julián quiere que el lector contemple la Distribución Binomial Negativa II como parte de una genealogía matemática, en lugar de verla como una fórmula que simplemente apareció ya terminada.

El recorrido puede resumirse aproximadamente así: la serie geométrica proporciona una expansión infinita sencilla; su diferenciación revela un patrón combinatorio recurrente; ese patrón permite motivar la expansión binomial; y la introducción de un exponente negativo conduce a la serie binomial negativa. El interés no es únicamente algebraico. El trabajo hace énfasis repetidamente en el tránsito desde estructuras relativamente simples hacia otras más generales y en las relaciones mediante las cuales una familia de objetos matemáticos conduce a otra.

1 + x + x2 + x3 + ··· = 1 / (1 − x),   |x| < 1 expansión binomial serie binomial negativa La genealogía algebraica del trabajo, en forma comprimida

Para el lector no técnico, la idea importante es sencilla: una distribución de probabilidad puede comprenderse a través de las transformaciones y relaciones que la generan. El trabajo refuerza posteriormente esta idea mediante un gran diagrama de redes de distribuciones de probabilidad, reproducido a partir de ProbOnto, donde las distintas distribuciones aparecen conectadas mediante transformaciones, relaciones límite y casos particulares. La NB2 se presenta así como un nodo dentro de una densa ecología matemática y no como una técnica aislada.

La probabilidad como problema de medición

Antes de construir la NB2, el trabajo se detiene a preguntar qué significa «probabilidad». No se trata de una digresión filosófica ornamental. La posición de Gómez Julián es que el cálculo formal de probabilidades y su interpretación filosófica no pueden divorciarse completamente, porque las conclusiones estadísticas dependen de qué creemos que están midiendo las probabilidades y de cómo se conceptualiza científicamente el fenómeno estudiado.

El trabajo adopta una orientación explícitamente objetiva y dialéctico-materialista. El azar es tratado principalmente como una condición epistemológica: los acontecimientos aparecen como aleatorios porque sus causas son desconocidas, demasiado numerosas o demasiado complejas para poder representarlas de manera completa. Al mismo tiempo, los axiomas de Kolmogórov proporcionan la estructura matemática formal que hace coherente el cálculo de probabilidades. El trabajo recurre asimismo al bayesianismo objetivo para sostener que los grados de creencia deberían estar restringidos por la evidencia, la teoría científica y el cálculo de probabilidades, en lugar de reducirse a opiniones personales arbitrarias.

Por qué esto importa estadísticamente

Un modelo no se escoge únicamente porque su fórmula resulte conveniente. La descripción científica del proceso determina cuáles variables aleatorias, relaciones condicionales, cantidades latentes y parametrizaciones poseen significado. Este principio se vuelve concreto cuando el trabajo introduce los modelos jerárquicos.

Una familia, no una fórmula aislada

El trabajo introduce a continuación las distribuciones necesarias para su construcción: Bernoulli, Binomial, Poisson y Exponencial. Cada una desempeña un papel diferente.

Distribución Función intuitiva Papel dentro del trabajo
Bernoulli Un ensayo con dos resultados posibles. La unidad elemental a partir de la cual se construyen experimentos repetidos de éxito y fracaso.
Binomial Cuenta éxitos en un número fijo de ensayos de Bernoulli. Constituye el primer nivel de la construcción jerárquica.
Poisson Cuenta ocurrencias cuando los eventos aparecen con determinada tasa media. Permite que el número de oportunidades o acontecimientos sea él mismo aleatorio.
Exponencial Modela tiempos de espera o variación continua positiva asociada a un proceso de Poisson. Introduce variabilidad en la tasa de Poisson entre distintas unidades observacionales.

Esta sucesión contiene ya la intuición metodológica del artículo. Un fenómeno complejo puede descomponerse en etapas probabilísticas relativamente simples, cada una de las cuales corresponde a un aspecto diferente de la historia científica que se intenta representar. En lugar de obligar a que toda la incertidumbre quede contenida en una sola fórmula plana, un modelo jerárquico permite que la incertidumbre ingrese en diferentes niveles.

Jerarquías, mixturas y variables latentes

Un modelo jerárquico especifica variables y parámetros mediante diferentes etapas. Una mixtura de probabilidad aparece cuando un parámetro de una distribución de probabilidad es tratado a su vez como una cantidad aleatoria gobernada por otra distribución. El parámetro que parecía fijo en el nivel inferior se convierte en variable en un nivel superior.

Éste es el movimiento conceptual decisivo del trabajo. También explica por qué Gómez Julián introduce el lenguaje de las variables latentes: algunas de las fuerzas responsables de producir la variabilidad observada pueden no observarse directamente, pero sus consecuencias todavía pueden representarse probabilísticamente. En investigación aplicada esta idea resulta familiar. Dos fábricas, municipios, empresas, hospitales o individuos pueden enfrentar tasas subyacentes de ocurrencia distintas, aunque inicialmente escribamos para todos ellos una misma ecuación de Poisson.

El artículo conecta esta construcción matemática con la distinción hegeliana entre Ser en sí y Ser para sí. Si eliminamos momentáneamente el vocabulario filosófico, su significado estadístico resulta bastante intuitivo. Estudiar la NB2 «en sí» significa estudiar el proceso más amplio y la red de relaciones de la cual emerge. Estudiar la NB2 «para sí» significa tomar la distribución ya marginalizada como objeto específico y analizar su propia fórmula, parámetros, momentos y aplicaciones.

La primera mixtura: una Binomial dentro de una Poisson

La primera gran construcción emplea un ejemplo biológico. Imaginemos un insecto que deposita una gran cantidad de huevos. Condicionado a que una madre haya puesto Y huevos, cada huevo sobrevive independientemente con probabilidad p. El número de huevos supervivientes, X, sigue entonces una distribución Binomial. Pero en lugar de fijar el número de huevos Y, el trabajo permite que éste varíe conforme a una distribución de Poisson con media λ.

X | Y ~ Binomial(Y, p)
Y ~ Poisson(λ) Primer modelo jerárquico

Marginalizar significa preguntarnos cuál es la distribución de X después de eliminar mediante suma la variable intermedia Y. Algebraicamente, combinamos todos los valores posibles de Y, ponderándolos por la probabilidad correspondiente a cada uno. El resultado es elegante:

X ~ Poisson(λp) Después de marginalizar Y

En el lenguaje moderno de la probabilidad, estamos ante una variante del proceso conocido como Poisson thinning o adelgazamiento de Poisson. Si el número total de oportunidades sigue una distribución de Poisson y cada una sobrevive independientemente con probabilidad p, entonces el número de supervivientes también sigue una distribución de Poisson, pero su media se reduce de λ a λp. El trabajo llega asimismo a la misma conclusión utilizando esperanzas iteradas:

E[X] = E{E[X | Y]} = E[pY] = pλ

Para el artículo, esto representa algo más que un truco computacional. Muestra cómo un proceso jerárquico que aparentemente contiene dos capas aleatorias puede «comprimirse» en una ley marginal más sencilla sin borrar la interpretación científica que originalmente motivó la jerarquía.

Cuando la tasa de Poisson también varía

El paso siguiente introduce un nivel adicional de heterogeneidad. Supongamos ahora que existen muchas madres insecto y que la media de Poisson no es idéntica para cada una de ellas. El trabajo trata entonces la propia tasa como una variable aleatoria:

X | Y ~ Binomial(Y, p)
Y | Λ ~ Poisson(Λ)
Λ ~ Exponencial(β) Jerarquía de tres etapas planteada en el trabajo

La intuición estadística es importante. La variación no se encuentra únicamente en el conteo observado; también puede existir en la tasa subyacente que genera ese conteo. Cuando la tasa difiere entre unidades observacionales, la distribución final puede encontrarse mucho más dispersa que la producida por un modelo de Poisson con una única tasa. Es precisamente este tipo de heterogeneidad latente lo que vuelve tan útil a la familia binomial negativa en Economía, Epidemiología, Demografía, Ciencia Política y muchos otros ámbitos donde se analizan datos de conteo.

El trabajo muestra que la media de toda la jerarquía puede calcularse condicionando y promediando sucesivamente, hasta obtener E[X] = pβ bajo su parametrización. Posteriormente integra la tasa aleatoria de Poisson y vincula la expresión resultante con la forma binomial negativa.

Precisión técnica añadida

Conviene introducir aquí una distinción importante. Una distribución Exponencial es una distribución Gamma cuyo parámetro de forma es igual a 1. Por ello, una mixtura Poisson–Exponencial produce la distribución geométrica, que constituye el caso particular de la binomial negativa con r = 1. La NB2 general, con un parámetro de dispersión r arbitrario, surge de una mixtura Poisson–Gamma. Por tanto, la intuición central del trabajo —que la heterogeneidad aleatoria en la tasa de Poisson genera sobredispersión de tipo binomial negativo— se conserva, pero la NB2 completamente general requiere la familia Gamma como distribución de mezcla, y no únicamente la distribución Exponencial.

Esta precisión refuerza, de hecho, el mensaje más general del trabajo. La distribución geométrica, la distribución exponencial, la familia Gamma, los procesos de Poisson y la distribución binomial negativa no son objetos matemáticos inconexos. Forman parte de una red de casos especiales y relaciones de mixtura. La distribución Gamma más general conserva la misma lógica jerárquica, pero permite extender el modelo más allá del caso r = 1.

· · ·

La NB2 «para sí»: qué nos dice la distribución ya terminada

Una vez «comprimida» la jerarquía, el trabajo pasa a estudiar la Distribución Binomial Negativa II como objeto por derecho propio. Una de sus parametrizaciones habituales expresa la probabilidad de observar x fracasos antes de alcanzar el r-ésimo éxito de la siguiente manera:

P(X = x) = Γ(x + r) / [Γ(r) Γ(x + 1)] · pr · (1 − p)x,   x = 0, 1, 2, …

Aquí, p representa la probabilidad de éxito y r el número de éxitos que se pretende alcanzar. La distribución responde a una pregunta inversa a la que suele formular la Binomial ordinaria. La Binomial pregunta: ¿cuántos éxitos se producen dentro de un número fijo de ensayos? La binomial negativa pregunta: ¿cuántos fracasos se producen antes de alcanzar un número fijo de éxitos?

La propiedad estadística más importante destacada por el trabajo aparece en sus dos primeros momentos. Si q = 1 − p:

μ = E[X] = rq / p
Var(X) = rq / p2 = μ + μ2/r

Esta última igualdad constituye el puente hacia la econometría moderna para datos de conteo. La distribución de Poisson impone Var(X) = μ. La NB2 permite:

Var(X) = μ + αμ2,   donde α = 1/r

Dicho de otra manera, la varianza puede crecer más rápidamente que la media. Cuanto menor sea r —o, de manera equivalente, cuanto mayor sea el parámetro de heterogeneidad α— mayor dispersión permite el modelo. Cuando la heterogeneidad desaparece, la NB2 se aproxima al punto de referencia constituido por Poisson. Ésta es la razón por la cual el trabajo presenta la NB2 como un instrumento más flexible para datos de conteo cuando la igualdad entre media y varianza impuesta por Poisson resulta demasiado restrictiva.

Característica Poisson Binomial Negativa II
Media μ μ
Varianza μ μ + αμ²
Heterogeneidad adicional No se modela separadamente Se recoge mediante α (o r)
Uso característico Conteos equidispersos Conteos sobredispersos

Para un econometrista, esta función de varianza constituye posiblemente el camino más rápido para comprender la NB2. Para un lector más general basta una traducción intuitiva: la NB2 espera que el mundo sea más desigual que un proceso simple de Poisson. Algunas unidades poseen tasas de ocurrencia persistentemente mayores que otras; existen condiciones no observadas que varían; aparecen agrupamientos; y una misma media puede coexistir con una dispersión considerablemente mayor.

El ejemplo del mantenimiento: contar fracasos antes de la cuarta alarma

El trabajo proporciona una interpretación industrial concreta. Imaginemos un capital fijo —una máquina— que produce piezas. Cada pieza puede ser óptima o defectuosa. Un sistema de monitoreo trata la producción de una pieza defectuosa como el evento de interés porque sirve como señal de la necesidad de mantenimiento. Supongamos ensayos de Bernoulli independientes y una probabilidad constante de defecto.

Gómez Julián establece r = 4, p = 0.005 y pregunta cuál es la probabilidad de observar exactamente x = 100 fracasos antes del cuarto éxito, utilizando la función de masa de la binomial negativa. La sustitución produce:

P(X = 100 | r = 4, p = 0.005) ≈ 0.000067

El número es extremadamente pequeño: aproximadamente 6,7 posibilidades entre 100.000. La interpretación estadística no consiste en que primero «ocurren 100 fracasos y después cuatro éxitos» como si se tratara de dos bloques separados. Lo que significa es que, dentro de una sucesión continua de ensayos independientes, se producen exactamente 100 no-eventos antes de que aparezca el cuarto evento de interés.

El trabajo comprueba el resultado manualmente, con una calculadora Texas Instruments y mediante R. Posteriormente representa gráficamente la distribución correspondiente, mostrando cómo una probabilidad de éxito muy pequeña desplaza una cantidad considerable de masa de probabilidad hacia conteos relativamente elevados antes de acumular el número requerido de éxitos.

Qué intenta mostrar la simulación en R

La última parte aplicada del cuerpo principal del trabajo abandona momentáneamente la evaluación de una probabilidad concreta y pasa a la generación de datos pseudoaleatorios. El artículo construye un experimento personalizado basado en una baraja: extraer repetidamente una carta de una baraja de 52 cartas hasta que aparezca determinado rango, registrar cuántas extracciones fueron necesarias y repetir el experimento muchas veces. A continuación compara el histograma producido mediante ese procedimiento de conteo «desde primeros principios» con un histograma generado mediante la función incorporada rnbinom de R.

Las figuras correspondientes a 50, 100, 150 y 200 repeticiones muestran el mismo patrón cualitativo: una distribución de conteos marcadamente asimétrica hacia la derecha, con numerosos valores pequeños y una larga cola. El propósito pedagógico es claro. El software no es magia. Un generador aleatorio incorporado está implementando una estructura probabilística que también puede aproximarse mediante una sucesión explícita de ensayos elementales.

Una convención de R que conviene tener presente

La función rnbinom de R utiliza la convención de contar el número de fracasos anteriores a un número especificado de éxitos. Una rutina construida manualmente que cuente el número total de extracciones, incluyendo la extracción exitosa, difiere en una unidad cuando size = 1. Para realizar una comparación exactamente uno a uno, el procedimiento manual y la función del programa deben adoptar la misma convención de conteo. Esto no elimina el valor pedagógico de la simulación, pero sí importa cuando se busca equivalencia numérica exacta.

La enseñanza más general desborda ampliamente el programa R. La simulación permite observar qué significa operacionalmente una distribución: no solamente cuál es la apariencia de su fórmula, sino también qué clase de mecanismo repetido podría producir datos con esa forma.

NB1, Bayes y los anexos: por qué el trabajo sigue ampliando el marco

Los anexos extienden el mismo enfoque relacional. El artículo diferencia la NB2 de la NB1, subrayando que distintas parametrizaciones de la binomial negativa responden a preguntas de conteo ligeramente diferentes. En la presentación de la NB1 utilizada allí, la variable aleatoria representa el número total de ensayos de Bernoulli necesarios para alcanzar r eventos del tipo escogido; en la presentación de la NB2, la variable aleatoria queda restringida al número de fracasos anteriores a esos r éxitos.

El trabajo vuelve asimismo sobre la probabilidad condicional, la probabilidad total, la probabilidad inversa y el bayesianismo objetivo. Esto podría parecer muy alejado del problema de la sobredispersión en datos de conteo, pero cumple la misma función dentro de la tesis filosófica general: las fórmulas estadísticas deben comprenderse por medio de las relaciones que expresan. La probabilidad condicional no constituye simplemente un cociente; representa una dependencia estructurada entre eventos. La actualización bayesiana no es únicamente álgebra; conecta conocimiento previo, evidencia y valoración posterior.

Finalmente, el artículo presenta una expresión más general de la NB2 formulada mediante la función Gamma y recoge estimadores basados en los dos primeros momentos muestrales. Una vez más, esto conecta la distribución abstracta con el trabajo empírico: los parámetros poblacionales adquieren significado aplicado porque la información muestral proporciona una vía para estimarlos.

¿Con qué deberíamos quedarnos?

El trabajo de Gómez Julián se comprende mejor como un argumento prolongado contra la idea de tratar la Distribución Binomial Negativa II como una fórmula de caja negra. Su rasgo distintivo no consiste en proponer un nuevo estimador de NB2 ni un nuevo algoritmo de regresión. Consiste en intentar reconstruir la distribución mediante diferentes dimensiones simultáneamente: histórica, algebraica, probabilística, computacional, aplicada y filosófica.

Para el lector no técnico, la enseñanza estadística central puede resumirse en una sola frase: cuando los conteos varían más de lo que permite un modelo de Poisson con una única tasa, esa variabilidad adicional puede interpretarse frecuentemente como heterogeneidad en la tasa subyacente de ocurrencia, y la familia binomial negativa proporciona una manera natural de representarla.

Para el econometrista, la característica fundamental es la función de varianza de la NB2, Var(Y) = μ + αμ². Para el matemático, el trabajo constituye una invitación a seguir las transformaciones que conectan series geométricas, expansiones binomiales, funciones Gamma, distribuciones condicionales y marginalización. Para el filósofo de la ciencia, su afirmación principal es metodológica: el instrumento formal, el objeto científico, la historia del instrumento y la interpretación de la incertidumbre deberían estudiarse en relación y no de forma aislada.

Y para el investigador aplicado, quizá la pregunta más útil sea también la más sencilla: ¿qué proceso tendría que estar operando para que esta distribución fuese un instrumento de medición razonable? Una vez formulada esa pregunta, la NB2 deja de ser simplemente una corrección conveniente frente a la sobredispersión. Se convierte en una hipótesis acerca de cómo ingresa la heterogeneidad en el proceso generador de los datos.

Una distribución resulta más informativa cuando su ley de probabilidad y la historia de su mecanismo generador cuentan la misma historia científica.
En un mapa compacto

Bernoulli proporciona el ensayo elemental de éxito o fracaso; la Binomial agrega esos ensayos para un tamaño fijo; Poisson convierte en estocástico el número o la tasa de ocurrencias; la heterogeneidad Gamma permite que dicha tasa de Poisson varíe entre unidades; al marginalizar la tasa latente aparece la Distribución Binomial Negativa II, cuya varianza puede superar a su media.

Esta explicación sigue la arquitectura y los objetivos sustantivos del trabajo de Gómez Julián, distinguiendo al mismo tiempo el marco filosófico propio del artículo de las precisiones técnicas añadidas aquí con fines de exactitud matemática.

Leer el artículo original ↗
Diseño editorial-académico · Playfair Display · Lora · DM Mono


Descubre más de Marxist Philosophy of Science

Suscríbete para recibir las últimas entradas en tu correo electrónico.

Follow the blogSeguí al blog

Comments

Leave a Comment/Deja un Comentario

Descubre más de Marxist Philosophy of Science

Suscríbete ahora para seguir leyendo y obtener acceso al archivo completo.

Continuar leyendo