Machine learning - qué es y cómo funciona
¿Te está gustando el curso?
Regístrate gratis para guardar tu progreso y obtener tu certificado al finalizar
4.5 Machine learning - qué es y cómo funciona
El término machine learning (aprendizaje automático en español) es frecuentemente utilizado de forma intercambiable con inteligencia artificial, pero es importante precisar la distinción. Mientras que la inteligencia artificial es un campo amplio que engloba cualquier técnica que permita máquinas realizar tareas que normalmente requieren inteligencia humana, el machine learning es un subconjunto específico de IA que se centra en permitir máquinas aprender de los datos en lugar de ser explícitamente programadas.
Machine learning dentro del ecosistema de inteligencia artificial
La inteligencia artificial como campo existe desde los años cincuenta y abarca múltiples enfoques. Los primeros sistemas de IA utilizaban reglas explícitas: si la temperatura supera 35 grados, encender aire acondicionado. Este enfoque basado en reglas (rule-based AI) es predecible y transparente, pero no escala bien cuando el problema es complejo. ¿Cuáles son exactamente las reglas para reconocer un rostro humano? Escribirlas manualmente sería prácticamente imposible.
El machine learning resuelve este problema mediante paradigma radicalmente distinto: en lugar de especificar reglas, proporcionamos ejemplos y dejamos que el sistema identifique las reglas automáticamente. Un sistema entrenado con miles de imágenes de rostros y no-rostros aprende automáticamente qué características definen un rostro, sin necesidad de escribir reglas.
Hoy, el machine learning y el deep learning (aprendizaje profundo, que cubriremos en el módulo siguiente) son los enfoques dominantes de IA porque funcionan mejora que sistemas basados en reglas en la mayoría de problemas del mundo real. Sin embargo, no son los únicos enfoques: la búsqueda heurística (como en ajedrez de computadora), sistemas expertos, algoritmos genéticos, y otros métodos siguen siendo relevantes en contextos específicos.
La ecuación fundamental del machine learning
El machine learning puede expresarse mediante una ecuación conceptual simple: Resultado = Datos + Algoritmo. Para obtener buenos resultados, necesitas tanto datos de alta calidad como un algoritmo apropiado. Ninguno de estos elementos por sí solo es suficiente. Excelentes datos con un algoritmo inadecuado producen resultados pobres. Un algoritmo sofisticado con datos insuficientes o irrelevantes tampoco funciona. La mayoría de fracasos en proyectos de machine learning resultan no de algoritmos deficientes, sino de datos insuficientes o de baja calidad.
Esta ecuación también explica por qué el aprendizaje automático ha proliferado después de 2010: la explosión de datos digitales proporcionó el componente "datos", mientras que la mejora en capacidad computacional (especialmente GPUs) permitió procesar esos datos con algoritmos cada vez más complejos. Históricamente, los algoritmos sofisticados de aprendizaje automático existían, pero carecían de datos y poder computacional para ser prácticos.
Ciclo de vida operacional de un sistema de machine learning
Un sistema de machine learning en producción es más que solo un modelo entrenado. Incluye toda una infraestructura de recolección de datos, limpieza, preprocesamiento, entrenamiento, evaluación, despliegue y monitoreo. El ciclo comienza con definición clara del problema: ¿qué queremos predecir? ¿Cuál es la métrica de éxito? Esto es crucial porque muchos proyectos fracasan por optimizar la métrica incorrecta.
Después sigue recolección y exploración de datos. Típicamente, 70 a 80 por ciento del tiempo en un proyecto se gasta en estas fases. Los datos deben ser limpios (sin errores, inconsistencias, o valores faltantes), relevantes (contener información que realmente predice el objetivo), y suficientes en cantidad. La exploración identifica patrones, distribuciones, y posibles problemas que pueden afectar el modelo.
El preprocesamiento transforma datos crudos en formato adecuado para el algoritmo. Puede incluir normalización (escalar variables para tener escala similar), codificación (convertir variables categóricas en numéricas), o ingeniería de características (crear nuevas variables que capturen información relevante). La selección de características elimina variables que no aportan información predictiva, simplificando el modelo y reduciendo ruido.
Entrenamiento, validación y despliegue
Una vez preparados los datos, se entrena el modelo. Esto implica seleccionar un algoritmo, definir hiperparámetros, ejecutar el entrenamiento, y validar rendimiento contra un conjunto de validación. Frecuentemente se prueban múltiples algoritmos o configuraciones, comparando desempeño. El modelo seleccionado se evalúa finalmente en datos completamente reservados, que no se han utilizado en ninguna fase anterior.
Si el desempeño es satisfactorio, el modelo se empaqueta y despliega a producción. Esto no es un simple copiar del modelo; requiere infraestructura para servir predicciones con latencia baja, manejar volumen alto de solicitudes, y proporcionar transparencia (explicar por qué se hizo una predicción específica).
Una vez en producción, comienza el monitoreo. Los datos en producción frecuentemente difieren de datos de entrenamiento de formas sutiles (fenómeno llamado data drift). Conforme tiempo pasa, el desempeño del modelo degrada gradualmente. Se requiere reentrenamiento periódico, generalmente con datos nuevos acumulados, para mantener precisión. Algunos sistemas reentrenan diariamente, otros semanalmente; la frecuencia depende de cuán rápidamente cambian patrones en datos.
Tipos de tareas en machine learning
Aunque todos los sistemas de machine learning siguen principios similares, pueden agruparse en categorías según el tipo de predicción requerida. En clasificación binaria, predecimos una de dos categorías: spam o no spam, cliente va a cancelar o retendrá, órgano canceroso o benigno. En clasificación multiclase, el número de categorías es mayor: clasificar un email en Promociones, Social, Tabloide o Primario. En regresión, predecimos valores numéricos: precio de vivienda, tasa de ocupación, demanda de producto.
Otras tareas incluyen clustering (agrupar observaciones similares sin labels predefinidos), detección de anomalías (identificar observaciones anormales), y ranking (ordenar elementos según relevancia). Sistemas de recomendación predicen qué producto, película o artículo interesa a cada usuario. Todos estos se implementan utilizando técnicas de machine learning adaptadas a la estructura específica del problema.
Machine learning en la era moderna
En 2024, el machine learning es absolutamente central para cualquier organización que utilice datos. Los motores de búsqueda ordenan resultados mediante ranking automatizado. Las redes sociales recomiendan contenido. Los bancos detectan fraude automáticamente. Los hospitales integran diagnóstico asistido por IA. Las empresas de energía predicen demanda para optimizar generación. Sin machine learning, ninguno de estos servicios sería viable en la escala actual.
Particularmente relevante para este curso, los modelos de lenguaje grande que permiten conversaciones naturales con inteligencia artificial (como ChatGPT, Claude, o Gemini) son principalmente sistemas de machine learning entrenados con aprendizaje profundo. Comprender cómo funcionan estos sistemas, cuáles son sus capacidades y limitaciones reales, requiere entender los principios fundamentales de machine learning que hemos cubierto en este módulo.
Ideas clave
- Machine learning es un subconjunto específico de inteligencia artificial que aprende patrones de datos en lugar de ejecutar reglas explícitas.
- La ecuación fundamental es Resultado = Datos + Algoritmo; data de baja calidad o insuficiente es la causa más común de fracaso en proyectos.
- El ciclo de vida incluye definición del problema, recolección y exploración de datos, preprocesamiento, entrenamiento, validación, despliegue y monitoreo continuo.
- Las tareas típicas de machine learning incluyen clasificación, regresión, clustering, detección de anomalías, y ranking.
- El monitoreo post-despliegue es crítico; el desempeño del modelo degrada conforme datos en producción divergen de datos de entrenamiento.
- Los modelos de lenguaje que habilitan inteligencia artificial conversacional moderna son sistemas avanzados de machine learning que aplican los principios fundamentales a escala masiva.