0%
Tema 4.2

Conceptos clave del aprendizaje automático

¿Te está gustando el curso?

Regístrate gratis para guardar tu progreso y obtener tu certificado al finalizar

4.2 Conceptos clave del aprendizaje automático

Para trabajar eficazmente con sistemas de aprendizaje automático, es imprescindible dominar la terminología técnica específica que estructura este campo. Los conceptos que veremos en este apartado constituyen el lenguaje universal de los profesionales que trabajan con inteligencia artificial, y su comprensión es fundamental para interpretar correctamente cómo funcionan internamente los modelos con los que interactuamos mediante prompts.

Características (features) y objetivos (labels)

Una característica o feature es una variable de entrada que el sistema utiliza para aprender. En un modelo que predice el precio de una vivienda, las características podrían ser: la superficie en metros cuadrados, el número de habitaciones, la antigüedad del edificio, la zona geográfica, o la cercanía a transporte público. Cada característica aporta información que ayuda al modelo a establecer patrones.

El objetivo o label es aquello que queremos predecir o aprender. En el ejemplo anterior, el precio final de la vivienda es el label. Los sistemas de aprendizaje automático necesitan ver ejemplos donde conocemos tanto las características como el objetivo para aprender la relación entre ambos. Un conjunto de datos bien estructurado para aprendizaje automático contiene miles o millones de ejemplos con características y sus correspondientes objetivos.

Es crucial seleccionar características relevantes. Incluir características irrelevantes puede confundir al modelo, mientras que omitir características importantes limita su capacidad de aprendizaje. Este proceso, denominado ingeniería de características (feature engineering), es con frecuencia más importante que el algoritmo específico que se utilice.

Conjunto de entrenamiento, validación y prueba

El conjunto de datos disponible se divide generalmente en tres subconjuntos con propósitos distintos. El conjunto de entrenamiento, que típicamente constituye entre el 60 y el 80 por ciento del total, es aquello sobre lo que el algoritmo aprende. El algoritmo ajusta sus parámetros internos basándose en los errores que comete prediciendo los labels en este conjunto.

El conjunto de validación, generalmente un 10 a 20 por ciento de los datos, se utiliza durante el desarrollo del modelo para evaluarlo sin entrenar con esos datos. Permite ajustar hiperparámetros (configuraciones del algoritmo) comparando rendimiento en datos que el modelo no ha visto. El conjunto de prueba, los datos restantes, se reserva únicamente para evaluar el rendimiento final del modelo. Nunca debe utilizarse para entrenamiento o validación durante desarrollo, porque proporcionaría una evaluación sesgada.

Esta división es crítica porque los sistemas de aprendizaje automático pueden memorizarse los datos de entrenamiento sin aprender realmente patrones generalizables, fenómeno conocido como overfitting o sobreajuste.

Modelo y parámetros

Un modelo es la representación matemática de los patrones aprendidos. No es un programa en el sentido tradicional, sino una estructura matemática con parámetros internos que han sido ajustados durante el entrenamiento. Un modelo simple podría ser una ecuación lineal con coeficientes ajustados: precio = 500 × metros² + 3000 × habitaciones - 2000 × años. Un modelo complejo como una red neuronal profunda contiene millones de parámetros internos.

Los parámetros son los valores internos del modelo que se ajustan durante el entrenamiento. Inicialmente se asignan valores aleatorios, y conforme el algoritmo procesa ejemplos de entrenamiento, estos valores se modifican para minimizar el error. Este proceso se denomina optimización. Una vez completado el entrenamiento, los parámetros quedan fijos y el modelo puede hacer predicciones sobre datos nuevos.

Función de pérdida (loss function)

La función de pérdida es una fórmula matemática que cuantifica qué tan equivocado está el modelo. Para un problema de predicción de precios, podría ser simplemente el valor absoluto de la diferencia entre el precio predicho y el precio real. El objetivo del entrenamiento es minimizar esta función de pérdida. Si el modelo predice 250.000 euros para una casa que vale 300.000, la pérdida es 50.000.

La selección de la función de pérdida es una decisión crítica que afecta al comportamiento del modelo. Para problemas de clasificación (decidir si algo pertenece a una categoría u otra), se utilizan funciones de pérdida distintas que para problemas de regresión (predecir valores numéricos).

Precisión, recall y otras métricas de evaluación

Una vez entrenado el modelo, necesitamos evaluar qué tan bien funciona. Para problemas de clasificación, la precisión (qué porcentaje de predicciones positivas son correctas) y el recall (qué porcentaje de casos positivos reales detecta el modelo) son métricas fundamentales. Un sistema de diagnóstico médico necesita alto recall: es peor no detectar una enfermedad que hacer falsos alarmas.

Para problemas de regresión se utilizan métricas como el error cuadrático medio (MSE) o el coeficiente de determinación (R²). Estas métricas permiten comparar distintos modelos y seleccionar el que mejor se ajusta a nuestras necesidades específicas.

Algoritmos y tipos de aprendizaje

Existen cientos de algoritmos de aprendizaje automático distintos. Los más comunes incluyen regresión lineal para predicciones numéricas simples, máquinas de vectores de soporte (SVM) para clasificación, árboles de decisión que funcionan mediante preguntas sucesivas, y redes neuronales que imitan vagamente la estructura del cerebro. Cada algoritmo tiene fortalezas y debilidades según el problema específico.

El aprendizaje puede ser supervisado (donde tenemos ejemplos con labels), no supervisado (donde buscamos patrones sin objetivos predefinidos, como agrupar clientes similares), o semisupervisado (donde solo parte de los datos están etiquetados).

Hiperparámetros y ajuste de modelos

Los hiperparámetros son configuraciones del algoritmo que nosotros elegimos antes de entrenar, a diferencia de los parámetros que se ajustan automáticamente. En una red neuronal, el número de capas, el número de neuronas por capa, o la tasa de aprendizaje son hiperparámetros. Optimizar estos requiere experimentación sistemática, frecuentemente utilizando el conjunto de validación para evaluar distintas combinaciones.

Ideas clave

  • Las características (features) son variables de entrada, mientras que los objetivos (labels) son valores que queremos predecir; la ingeniería de características es crítica para el éxito del modelo.
  • Los datos se dividen en entrenamiento, validación y prueba para asegurar que el modelo generaliza a datos nuevos y no solo memoriza.
  • Un modelo es la representación matemática de patrones aprendidos; sus parámetros se ajustan durante el entrenamiento para minimizar la función de pérdida.
  • La función de pérdida cuantifica el error del modelo; seleccionar la función apropiada es fundamental para entrenar modelos efectivos.
  • Precisión, recall, MSE y otras métricas permiten evaluar rendimiento; la métrica correcta depende del problema específico y sus consecuencias de error.
  • Existen cientos de algoritmos distintos; la selección depende de la naturaleza del problema, la cantidad de datos disponibles y los requisitos de interpretabilidad.