Espartaco

“Is that to say we are against Free Trade? No, we are for Free Trade, because by Free Trade all economical laws, with their most astounding contradictions, will act upon a larger scale, upon the territory of the whole earth; and because from the uniting of all these contradictions in a single group, where they will stand face to face, will result the struggle which will itself eventuate in the emancipation of the proletariat.”

Karl Heinrich Marx · Marx-Engels Collected Works, Vol. VI, p. 290

26,559 views since December 2020

26,559 visitas desde diciembre de 2020

EnglishEspañol

GENERALIDADES DE LA TEORÍA DEL APRENDIZAJE ESTADÍSTICO

Estadística · Aprendizaje automático · Clasificación

Teoría del aprendizaje estadístico

Predicción, clasificación, error de generalización y el vínculo entre estadística y aprendizaje automático


El aprendizaje estadístico hace referencia, en términos generales, a un conjunto de métodos mediante los cuales se intenta estimar una función desconocida a partir de datos. Siguiendo la formulación utilizada por James, Witten, Hastie y Tibshirani, podemos imaginar que una variable de respuesta \(Y\) se relaciona con un conjunto de variables de entrada \(X\) mediante:

\[ Y=f(X)+\varepsilon, \]

donde \(f\) representa una relación sistemática desconocida y \(\varepsilon\) recoge aquella variación que el modelo no explica. El problema consiste entonces en obtener, a partir de las observaciones disponibles, una estimación \(\hat f\) suficientemente útil para el objetivo de la investigación.

Ese objetivo puede ser predictivo, inferencial o descriptivo. En algunas aplicaciones interesa principalmente predecir nuevas observaciones; en otras, comprender qué variables se relacionan con la respuesta y de qué forma; y en muchas investigaciones ambos propósitos aparecen simultáneamente.

Aprender de los datos no significa eliminar la teoría: significa utilizar la información contenida en las observaciones para estimar regularidades que puedan describirse, contrastarse o utilizarse para predecir.

1. Aprendizaje estadístico y aprendizaje automático

Hastie, Tibshirani y Friedman emplean el término statistical learning para describir un conjunto amplio de métodos destinados al análisis de datos, incluyendo problemas de predicción, inferencia, clasificación, selección de variables, regularización, agrupamiento y otras formas de extracción de estructura.

El aprendizaje automático surgió históricamente con una fuerte influencia de la informática y del diseño de algoritmos. La estadística, en cambio, desarrolló durante mucho tiempo una tradición particularmente preocupada por los modelos probabilísticos, la estimación, la incertidumbre y la inferencia.

Esta diferencia histórica explica ciertos énfasis, pero no constituye una frontera lógica rígida. La estadística también construye predictores y el aprendizaje automático también utiliza modelos probabilísticos, estimación, regularización e inferencia. Durante las últimas décadas ambas tradiciones han convergido de manera creciente porque, en gran medida, enfrentan problemas comunes.

Una distinción de énfasis, no de esencia

Puede decirse que buena parte del aprendizaje automático moderno enfatiza el rendimiento predictivo y la generalización fuera de muestra, mientras la estadística clásica enfatizó con frecuencia la estimación y la inferencia. Pero ninguna de las dos disciplinas se reduce exclusivamente a uno de esos fines.

Tampoco es correcto afirmar que los métodos de aprendizaje automático carecen de supuestos. En numerosos casos poseen menos supuestos paramétricos explícitos sobre la distribución de los datos, pero incorporan un sesgo inductivo a través de la clase de funciones permitidas, la arquitectura del algoritmo, la función de pérdida, la regularización, las invariancias impuestas o las restricciones de la representación.

En este contexto, un espacio de hipótesis es el conjunto de funciones o reglas candidatas entre las cuales el procedimiento de aprendizaje puede seleccionar:

\[ \mathcal H = \{h:X\rightarrow Y\}. \]

La expresión no debe confundirse con las hipótesis \(H_0\) y \(H_1\) de la teoría clásica de pruebas de hipótesis de Neyman y Pearson. Existe una analogía general en cuanto ambas delimitan conjuntos de posibilidades, pero se trata de objetos matemáticos y problemas inferenciales distintos.

2. Paradigmas de aprendizaje

Una clasificación elemental permite distinguir varios paradigmas.

Paradigma Información disponible Objetivo típico
Aprendizaje supervisado Pares \((x_i,y_i)\) Predecir una variable objetivo o etiqueta
Aprendizaje no supervisado Sólo \(x_i\) Encontrar estructura sin una respuesta supervisora explícita
Aprendizaje por refuerzo Estados, acciones y señales de recompensa Aprender una política de decisión

El aprendizaje en línea pertenece a otra dimensión de la clasificación. Describe procedimientos que actualizan el modelo a medida que llegan nuevas observaciones. Por ello puede existir aprendizaje supervisado en línea, aprendizaje no supervisado en línea, etc.

Entre los métodos no supervisados se encuentran, por ejemplo, el agrupamiento, la reducción de dimensionalidad, la detección de anomalías, la estimación de densidad y ciertas técnicas de aprendizaje de representaciones.

3. Positivos y negativos en clasificación binaria

En un problema de clasificación binaria existen dos valores posibles para la clase real y dos para la predicción. Si denominamos «positivo» al acontecimiento de interés, aparecen cuatro combinaciones:

  • Verdadero positivo (TP): el caso es positivo y el modelo lo clasifica como positivo.
  • Falso positivo (FP): el caso es negativo y el modelo lo clasifica como positivo.
  • Verdadero negativo (TN): el caso es negativo y el modelo lo clasifica como negativo.
  • Falso negativo (FN): el caso es positivo y el modelo lo clasifica como negativo.

En medicina, por ejemplo, «positivo» podría representar la presencia de una enfermedad. Un falso positivo correspondería entonces a diagnosticar como enferma a una persona que no presenta la condición, mientras que un falso negativo correspondería a no detectarla en una persona que sí la presenta.

4. La matriz de confusión

La matriz de confusión organiza esas cuatro posibilidades y permite visualizar el desempeño de un clasificador.

Clase real Clase predicha
Negativa Positiva
Negativa TN
Verdadero negativo
FP
Falso positivo
Positiva FN
Falso negativo
TP
Verdadero positivo

Los elementos de la diagonal principal corresponden a clasificaciones correctas; los elementos fuera de la diagonal corresponden a errores.

Una matriz de confusión puede calcularse sobre los datos utilizados para entrenar el modelo, pero también sobre conjuntos de validación, conjuntos de prueba o nuevas observaciones externas. Esta última distinción es fundamental cuando el objetivo es evaluar la capacidad de generalización.

5. Métricas de clasificación

5.1. Exactitud

La exactitudaccuracy— es la proporción total de predicciones correctas:

\[ \operatorname{Accuracy} = \frac{TP+TN} {TP+TN+FP+FN}. \]

Su complemento es la tasa de error de clasificación:

\[ \operatorname{Error} = \frac{FP+FN} {TP+TN+FP+FN} = 1-\operatorname{Accuracy}. \]

La exactitud es intuitiva, pero puede resultar engañosa cuando las clases están muy desbalanceadas. Si el 99 % de las observaciones pertenece a una sola clase, un clasificador trivial que siempre prediga esa clase puede alcanzar 99 % de exactitud sin aprender prácticamente nada acerca de la clase minoritaria.

5.2. Sensibilidad

La sensibilidad, también denominada recall o tasa de verdaderos positivos, responde a la pregunta: ¿qué proporción de los positivos reales fue identificada correctamente?

\[ \operatorname{Sensitivity} = \frac{TP}{TP+FN}. \]

5.3. Especificidad

La especificidad o tasa de verdaderos negativos mide la proporción de negativos reales correctamente identificados:

\[ \operatorname{Specificity} = \frac{TN}{TN+FP}. \]

5.4. Precisión o valor predictivo positivo

En el lenguaje del aprendizaje automático, precision es la proporción de predicciones positivas que realmente son positivas:

\[ \operatorname{Precision} = \frac{TP}{TP+FP}. \]

En epidemiología y diagnóstico clínico esta cantidad se denomina habitualmente valor predictivo positivo.

Una ambigüedad terminológica importante

La palabra inglesa precision utilizada en clasificación no debe confundirse con la precisión metrológica, donde «precisión» se refiere a la baja dispersión de mediciones repetidas. Son conceptos distintos que comparten una traducción habitual al español.

5.5. Valor predictivo negativo

El valor predictivo negativo es la proporción de predicciones negativas que son realmente negativas:

\[ \operatorname{NPV} = \frac{TN}{TN+FN}. \]

5.6. Sumario

Métrica Fórmula Pregunta que responde
Exactitud \((TP+TN)/N\) ¿Qué proporción total se clasificó correctamente?
Error \((FP+FN)/N\) ¿Qué proporción total se clasificó incorrectamente?
Sensibilidad \(TP/(TP+FN)\) ¿Cuántos positivos reales detectamos?
Especificidad \(TN/(TN+FP)\) ¿Cuántos negativos reales detectamos?
Precision / VPP \(TP/(TP+FP)\) ¿Cuántos positivos predichos eran realmente positivos?
VPN \(TN/(TN+FN)\) ¿Cuántos negativos predichos eran realmente negativos?

6. Error de entrenamiento y error de generalización

Si \(\hat f\) es un clasificador construido a partir de \(n\) observaciones de entrenamiento, su tasa de error sobre esas mismas observaciones es:

\[ \widehat{\operatorname{Err}}_{\mathrm{train}} = \frac{1}{n} \sum_{i=1}^{n} I(y_i\neq\hat y_i), \]

donde \(I(\cdot)\) es la función indicatriz.

Esta cantidad describe qué tan bien el procedimiento reproduce los datos utilizados para ajustarlo, pero no responde necesariamente a la pregunta más importante en un problema predictivo: ¿qué ocurrirá con observaciones nuevas?

El objetivo de generalización puede representarse conceptualmente mediante:

\[ \operatorname{Err}_{\mathrm{test}} = E\left[ I\left( Y_0\neq\hat f(X_0) \right) \right], \]

donde \((X_0,Y_0)\) representa una nueva observación procedente del mismo problema poblacional, pero no utilizada en el entrenamiento.

Un modelo aprende correctamente no cuando memoriza los datos conocidos, sino cuando la regularidad estimada conserva poder predictivo sobre observaciones que no participaron en el ajuste.

Por ello se emplean conjuntos de validación, conjuntos de prueba, validación cruzada y otros procedimientos destinados a estimar el rendimiento fuera de muestra.

Un error de entrenamiento extremadamente pequeño puede incluso ser una señal de sobreajuste si viene acompañado de un deterioro considerable en datos nuevos.

7. Estadística y aprendizaje automático

La relación entre estadística y aprendizaje automático no puede reducirse a una oposición simple. Ambos campos utilizan funciones, optimización, probabilidad, geometría, regularización y métodos computacionales para extraer estructura de los datos.

Una diferencia histórica importante radica en el grado en que la forma funcional del modelo se especifica explícitamente antes de estimar sus parámetros.

En una regresión podemos escribir:

\[ Y = \beta_0+\beta_1X_1+\beta_2X_2+\beta_3X_3+\varepsilon. \]

Si existen razones teóricas o empíricas para suponer una relación no lineal respecto de \(X_2\), podemos especificar:

\[ Y = \beta_0+\beta_1X_1+\beta_2X_2^2+\beta_3X_3+\varepsilon. \]

La relación es ahora no lineal respecto de \(X_2\), pero el modelo continúa siendo lineal en los parámetros \(\beta_0,\beta_1,\beta_2,\beta_3\).

Otros métodos, como árboles de decisión, bosques aleatorios, máquinas de soporte vectorial o redes neuronales, utilizan clases funcionales diferentes y pueden construir relaciones altamente no lineales sin que el investigador tenga que escribir de antemano una ecuación polinómica concreta.

Pero esto no significa que «no tengan estructura». La estructura se encuentra en la clase de hipótesis, la arquitectura del algoritmo, el criterio de optimización y la regularización.

estadística  ↔  modelos probabilísticos  ↔  optimización  ↔  aprendizaje automático

8. Modelos lineales generalizados como aprendizaje supervisado

Los modelos lineales generalizados constituyen un ejemplo especialmente claro de la intersección entre estadística y aprendizaje automático.

Histórica y teóricamente son modelos estadísticos. Se especifica una distribución para la respuesta, un predictor lineal:

\[ \eta_i=x_i^\top\beta, \]

y una función enlace:

\[ g(\mu_i)=\eta_i. \]

Sin embargo, cuando un MLG se ajusta sobre pares:

\[ \{(x_i,y_i)\}_{i=1}^{n} \]

con el propósito de predecir \(Y\) para nuevos valores de \(X\), constituye también un procedimiento de aprendizaje supervisado.

No es el tratamiento bayesiano el que produce esta condición. Un GLM puede utilizarse para aprendizaje supervisado mediante estimación frecuentista, bayesiana o penalizada. Lo determinante es el problema de aprendizaje y la utilización del modelo.

8.1. La regresión logística sigue siendo regresión

La regresión logística ofrece un ejemplo especialmente ilustrativo. Para una respuesta binaria:

\[ \log \left( \frac{P(Y=1\mid X)} {1-P(Y=1\mid X)} \right) = X\beta. \]

El objeto modelado es una probabilidad condicional. En este sentido, la regresión logística es inequívocamente un modelo de regresión.

Pero una probabilidad estimada puede convertirse legítimamente en una regla de clasificación:

\[ \widehat Y = I\left\{ \widehat P(Y=1\mid X)>c \right\}, \]

donde \(c\) es un umbral de decisión elegido según el problema.

No existe contradicción

La regresión logística es un modelo de regresión probabilística y, al mismo tiempo, puede emplearse como clasificador supervisado. «Regresión» describe la estructura estadística del modelo; «clasificación» describe uno de los usos que pueden darse a sus probabilidades estimadas.

8.2. El criterio elemental de supervisión

En la clasificación más sencilla, un problema es supervisado cuando durante el entrenamiento disponemos de pares de entrada y respuesta:

\[ (x_i,y_i). \]

La variable \(y_i\) proporciona la señal respecto de la cual puede evaluarse la predicción.

En un problema no supervisado disponemos, en cambio, de:

\[ x_1,\ldots,x_n \]

sin una variable objetivo asociada a cada observación. Esto no obliga a realizar agrupamiento: clustering es sólo una de las numerosas tareas no supervisadas posibles.

· · ·

La teoría del aprendizaje estadístico se sitúa precisamente en este territorio común entre estadística, matemática y computación. Su interés no radica en sustituir una disciplina por otra, sino en estudiar de forma sistemática cómo se extrae información generalizable de los datos.

El problema fundamental puede condensarse en una secuencia:

datos

clase de hipótesis

criterio de aprendizaje

modelo estimado

predicción, clasificación o inferencia

La calidad del aprendizaje no puede evaluarse únicamente preguntando qué tan bien el modelo reproduce los datos utilizados para construirlo. Lo decisivo es si la estructura aprendida representa una regularidad suficientemente estable como para conservar validez cuando se enfrenta a información nueva.

Nota terminológica
En este texto se utiliza precision para la métrica de clasificación \(TP/(TP+FP)\), también conocida como valor predictivo positivo. Esta acepción no debe confundirse con la precisión metrológica de mediciones repetidas. Asimismo, «aprendizaje supervisado» designa problemas en los que se dispone durante el entrenamiento de una variable objetivo asociada a las entradas.

Referencias

Hastie, T., Tibshirani, R., & Friedman, J. (2009). The Elements of Statistical Learning: Data Mining, Inference, and Prediction (2nd ed.). New York: Springer.

James, G., Witten, D., Hastie, T., & Tibshirani, R. (2013). An Introduction to Statistical Learning with Applications in R. New York: Springer.

McCullagh, P., & Nelder, J. A. (1989). Generalized Linear Models (2nd ed.). London: Chapman & Hall.

Vapnik, V. N. (1998). Statistical Learning Theory. New York: Wiley.

Bishop, C. M. (2006). Pattern Recognition and Machine Learning. New York: Springer.


Descubre más de Marxist Philosophy of Science

Suscríbete para recibir las últimas entradas en tu correo electrónico.

Follow the blogSeguí al blog

Comments

Leave a Comment/Deja un Comentario

Descubre más de Marxist Philosophy of Science

Suscríbete ahora para seguir leyendo y obtener acceso al archivo completo.

Continuar leyendo