Estadística · Aprendizaje automático · Clasificación
Teoría del aprendizaje estadístico
Predicción, clasificación, error de generalización y el vínculo entre estadística y aprendizaje automático
El aprendizaje estadístico hace referencia, en términos generales, a un conjunto de métodos mediante los cuales se intenta estimar una función desconocida a partir de datos. Siguiendo la formulación utilizada por James, Witten, Hastie y Tibshirani, podemos imaginar que una variable de respuesta \(Y\) se relaciona con un conjunto de variables de entrada \(X\) mediante:
donde \(f\) representa una relación sistemática desconocida y \(\varepsilon\) recoge aquella variación que el modelo no explica. El problema consiste entonces en obtener, a partir de las observaciones disponibles, una estimación \(\hat f\) suficientemente útil para el objetivo de la investigación.
Ese objetivo puede ser predictivo, inferencial o descriptivo. En algunas aplicaciones interesa principalmente predecir nuevas observaciones; en otras, comprender qué variables se relacionan con la respuesta y de qué forma; y en muchas investigaciones ambos propósitos aparecen simultáneamente.
Aprender de los datos no significa eliminar la teoría: significa utilizar la información contenida en las observaciones para estimar regularidades que puedan describirse, contrastarse o utilizarse para predecir.
1. Aprendizaje estadístico y aprendizaje automático
Hastie, Tibshirani y Friedman emplean el término statistical learning para describir un conjunto amplio de métodos destinados al análisis de datos, incluyendo problemas de predicción, inferencia, clasificación, selección de variables, regularización, agrupamiento y otras formas de extracción de estructura.
El aprendizaje automático surgió históricamente con una fuerte influencia de la informática y del diseño de algoritmos. La estadística, en cambio, desarrolló durante mucho tiempo una tradición particularmente preocupada por los modelos probabilísticos, la estimación, la incertidumbre y la inferencia.
Esta diferencia histórica explica ciertos énfasis, pero no constituye una frontera lógica rígida. La estadística también construye predictores y el aprendizaje automático también utiliza modelos probabilísticos, estimación, regularización e inferencia. Durante las últimas décadas ambas tradiciones han convergido de manera creciente porque, en gran medida, enfrentan problemas comunes.
Puede decirse que buena parte del aprendizaje automático moderno enfatiza el rendimiento predictivo y la generalización fuera de muestra, mientras la estadística clásica enfatizó con frecuencia la estimación y la inferencia. Pero ninguna de las dos disciplinas se reduce exclusivamente a uno de esos fines.
Tampoco es correcto afirmar que los métodos de aprendizaje automático carecen de supuestos. En numerosos casos poseen menos supuestos paramétricos explícitos sobre la distribución de los datos, pero incorporan un sesgo inductivo a través de la clase de funciones permitidas, la arquitectura del algoritmo, la función de pérdida, la regularización, las invariancias impuestas o las restricciones de la representación.
En este contexto, un espacio de hipótesis es el conjunto de funciones o reglas candidatas entre las cuales el procedimiento de aprendizaje puede seleccionar:
La expresión no debe confundirse con las hipótesis \(H_0\) y \(H_1\) de la teoría clásica de pruebas de hipótesis de Neyman y Pearson. Existe una analogía general en cuanto ambas delimitan conjuntos de posibilidades, pero se trata de objetos matemáticos y problemas inferenciales distintos.
2. Paradigmas de aprendizaje
Una clasificación elemental permite distinguir varios paradigmas.
| Paradigma | Información disponible | Objetivo típico |
|---|---|---|
| Aprendizaje supervisado | Pares \((x_i,y_i)\) | Predecir una variable objetivo o etiqueta |
| Aprendizaje no supervisado | Sólo \(x_i\) | Encontrar estructura sin una respuesta supervisora explícita |
| Aprendizaje por refuerzo | Estados, acciones y señales de recompensa | Aprender una política de decisión |
El aprendizaje en línea pertenece a otra dimensión de la clasificación. Describe procedimientos que actualizan el modelo a medida que llegan nuevas observaciones. Por ello puede existir aprendizaje supervisado en línea, aprendizaje no supervisado en línea, etc.
Entre los métodos no supervisados se encuentran, por ejemplo, el agrupamiento, la reducción de dimensionalidad, la detección de anomalías, la estimación de densidad y ciertas técnicas de aprendizaje de representaciones.
3. Positivos y negativos en clasificación binaria
En un problema de clasificación binaria existen dos valores posibles para la clase real y dos para la predicción. Si denominamos «positivo» al acontecimiento de interés, aparecen cuatro combinaciones:
- Verdadero positivo (TP): el caso es positivo y el modelo lo clasifica como positivo.
- Falso positivo (FP): el caso es negativo y el modelo lo clasifica como positivo.
- Verdadero negativo (TN): el caso es negativo y el modelo lo clasifica como negativo.
- Falso negativo (FN): el caso es positivo y el modelo lo clasifica como negativo.
En medicina, por ejemplo, «positivo» podría representar la presencia de una enfermedad. Un falso positivo correspondería entonces a diagnosticar como enferma a una persona que no presenta la condición, mientras que un falso negativo correspondería a no detectarla en una persona que sí la presenta.
4. La matriz de confusión
La matriz de confusión organiza esas cuatro posibilidades y permite visualizar el desempeño de un clasificador.
| Clase real | Clase predicha | |
|---|---|---|
| Negativa | Positiva | |
| Negativa | TN Verdadero negativo |
FP Falso positivo |
| Positiva | FN Falso negativo |
TP Verdadero positivo |
Los elementos de la diagonal principal corresponden a clasificaciones correctas; los elementos fuera de la diagonal corresponden a errores.
Una matriz de confusión puede calcularse sobre los datos utilizados para entrenar el modelo, pero también sobre conjuntos de validación, conjuntos de prueba o nuevas observaciones externas. Esta última distinción es fundamental cuando el objetivo es evaluar la capacidad de generalización.
5. Métricas de clasificación
5.1. Exactitud
La exactitud —accuracy— es la proporción total de predicciones correctas:
Su complemento es la tasa de error de clasificación:
La exactitud es intuitiva, pero puede resultar engañosa cuando las clases están muy desbalanceadas. Si el 99 % de las observaciones pertenece a una sola clase, un clasificador trivial que siempre prediga esa clase puede alcanzar 99 % de exactitud sin aprender prácticamente nada acerca de la clase minoritaria.
5.2. Sensibilidad
La sensibilidad, también denominada recall o tasa de verdaderos positivos, responde a la pregunta: ¿qué proporción de los positivos reales fue identificada correctamente?
5.3. Especificidad
La especificidad o tasa de verdaderos negativos mide la proporción de negativos reales correctamente identificados:
5.4. Precisión o valor predictivo positivo
En el lenguaje del aprendizaje automático, precision es la proporción de predicciones positivas que realmente son positivas:
En epidemiología y diagnóstico clínico esta cantidad se denomina habitualmente valor predictivo positivo.
La palabra inglesa precision utilizada en clasificación no debe confundirse con la precisión metrológica, donde «precisión» se refiere a la baja dispersión de mediciones repetidas. Son conceptos distintos que comparten una traducción habitual al español.
5.5. Valor predictivo negativo
El valor predictivo negativo es la proporción de predicciones negativas que son realmente negativas:
5.6. Sumario
| Métrica | Fórmula | Pregunta que responde |
|---|---|---|
| Exactitud | \((TP+TN)/N\) | ¿Qué proporción total se clasificó correctamente? |
| Error | \((FP+FN)/N\) | ¿Qué proporción total se clasificó incorrectamente? |
| Sensibilidad | \(TP/(TP+FN)\) | ¿Cuántos positivos reales detectamos? |
| Especificidad | \(TN/(TN+FP)\) | ¿Cuántos negativos reales detectamos? |
| Precision / VPP | \(TP/(TP+FP)\) | ¿Cuántos positivos predichos eran realmente positivos? |
| VPN | \(TN/(TN+FN)\) | ¿Cuántos negativos predichos eran realmente negativos? |
6. Error de entrenamiento y error de generalización
Si \(\hat f\) es un clasificador construido a partir de \(n\) observaciones de entrenamiento, su tasa de error sobre esas mismas observaciones es:
donde \(I(\cdot)\) es la función indicatriz.
Esta cantidad describe qué tan bien el procedimiento reproduce los datos utilizados para ajustarlo, pero no responde necesariamente a la pregunta más importante en un problema predictivo: ¿qué ocurrirá con observaciones nuevas?
El objetivo de generalización puede representarse conceptualmente mediante:
donde \((X_0,Y_0)\) representa una nueva observación procedente del mismo problema poblacional, pero no utilizada en el entrenamiento.
Un modelo aprende correctamente no cuando memoriza los datos conocidos, sino cuando la regularidad estimada conserva poder predictivo sobre observaciones que no participaron en el ajuste.
Por ello se emplean conjuntos de validación, conjuntos de prueba, validación cruzada y otros procedimientos destinados a estimar el rendimiento fuera de muestra.
Un error de entrenamiento extremadamente pequeño puede incluso ser una señal de sobreajuste si viene acompañado de un deterioro considerable en datos nuevos.
7. Estadística y aprendizaje automático
La relación entre estadística y aprendizaje automático no puede reducirse a una oposición simple. Ambos campos utilizan funciones, optimización, probabilidad, geometría, regularización y métodos computacionales para extraer estructura de los datos.
Una diferencia histórica importante radica en el grado en que la forma funcional del modelo se especifica explícitamente antes de estimar sus parámetros.
En una regresión podemos escribir:
Si existen razones teóricas o empíricas para suponer una relación no lineal respecto de \(X_2\), podemos especificar:
La relación es ahora no lineal respecto de \(X_2\), pero el modelo continúa siendo lineal en los parámetros \(\beta_0,\beta_1,\beta_2,\beta_3\).
Otros métodos, como árboles de decisión, bosques aleatorios, máquinas de soporte vectorial o redes neuronales, utilizan clases funcionales diferentes y pueden construir relaciones altamente no lineales sin que el investigador tenga que escribir de antemano una ecuación polinómica concreta.
Pero esto no significa que «no tengan estructura». La estructura se encuentra en la clase de hipótesis, la arquitectura del algoritmo, el criterio de optimización y la regularización.
8. Modelos lineales generalizados como aprendizaje supervisado
Los modelos lineales generalizados constituyen un ejemplo especialmente claro de la intersección entre estadística y aprendizaje automático.
Histórica y teóricamente son modelos estadísticos. Se especifica una distribución para la respuesta, un predictor lineal:
y una función enlace:
Sin embargo, cuando un MLG se ajusta sobre pares:
con el propósito de predecir \(Y\) para nuevos valores de \(X\), constituye también un procedimiento de aprendizaje supervisado.
No es el tratamiento bayesiano el que produce esta condición. Un GLM puede utilizarse para aprendizaje supervisado mediante estimación frecuentista, bayesiana o penalizada. Lo determinante es el problema de aprendizaje y la utilización del modelo.
8.1. La regresión logística sigue siendo regresión
La regresión logística ofrece un ejemplo especialmente ilustrativo. Para una respuesta binaria:
El objeto modelado es una probabilidad condicional. En este sentido, la regresión logística es inequívocamente un modelo de regresión.
Pero una probabilidad estimada puede convertirse legítimamente en una regla de clasificación:
donde \(c\) es un umbral de decisión elegido según el problema.
La regresión logística es un modelo de regresión probabilística y, al mismo tiempo, puede emplearse como clasificador supervisado. «Regresión» describe la estructura estadística del modelo; «clasificación» describe uno de los usos que pueden darse a sus probabilidades estimadas.
8.2. El criterio elemental de supervisión
En la clasificación más sencilla, un problema es supervisado cuando durante el entrenamiento disponemos de pares de entrada y respuesta:
La variable \(y_i\) proporciona la señal respecto de la cual puede evaluarse la predicción.
En un problema no supervisado disponemos, en cambio, de:
sin una variable objetivo asociada a cada observación. Esto no obliga a realizar agrupamiento: clustering es sólo una de las numerosas tareas no supervisadas posibles.
La teoría del aprendizaje estadístico se sitúa precisamente en este territorio común entre estadística, matemática y computación. Su interés no radica en sustituir una disciplina por otra, sino en estudiar de forma sistemática cómo se extrae información generalizable de los datos.
El problema fundamental puede condensarse en una secuencia:
↓
clase de hipótesis
↓
criterio de aprendizaje
↓
modelo estimado
↓
predicción, clasificación o inferencia
La calidad del aprendizaje no puede evaluarse únicamente preguntando qué tan bien el modelo reproduce los datos utilizados para construirlo. Lo decisivo es si la estructura aprendida representa una regularidad suficientemente estable como para conservar validez cuando se enfrenta a información nueva.
Referencias
Hastie, T., Tibshirani, R., & Friedman, J. (2009). The Elements of Statistical Learning: Data Mining, Inference, and Prediction (2nd ed.). New York: Springer.
James, G., Witten, D., Hastie, T., & Tibshirani, R. (2013). An Introduction to Statistical Learning with Applications in R. New York: Springer.
McCullagh, P., & Nelder, J. A. (1989). Generalized Linear Models (2nd ed.). London: Chapman & Hall.
Vapnik, V. N. (1998). Statistical Learning Theory. New York: Wiley.
Bishop, C. M. (2006). Pattern Recognition and Machine Learning. New York: Springer.


Leave a Comment/Deja un Comentario