0%
Tema 9.2

Cómo funciona la IA Generativa

¿Te está gustando el curso?

Regístrate gratis para guardar tu progreso y obtener tu certificado al finalizar

9.2 Cómo funciona la IA Generativa

En el apartado anterior, comprendimos qué es la IA generativa: sistemas que crean contenido nuevo basado en patrones aprendidos. Ahora necesitamos entender cómo funcionan estos sistemas internamente. Aunque los detalles técnicos profundos requieren matemáticas avanzada, es posible comprender los principios fundamentales sin necesidad de formación técnica especializada. Este conocimiento es valioso porque nos permite entender por qué ChatGPT y sistemas similares behave como lo hacen, sus capacidades, y sus limitaciones.

El concepto fundamental: Predicción de la siguiente palabra

El principio fundamental de los modelos de lenguaje generativos como ChatGPT es sorprendentemente simple: predicción de la siguiente palabra. Cuando usted escribe un prompt, el sistema no «comprende» su pregunta de la forma que usted la comprende. En cambio, procesa matemáticamente su texto y asigna probabilidades a qué palabra debería venir a continuación, basándose en patrones que observó durante su entrenamiento.

Por ejemplo, si el modelo ve la secuencia «El cielo es de color...», ha observado en su datos de entrenamiento que después de esta secuencia típicamente viene «azul», «gris», «rojo» (durante una puesta de sol), u otras palabras relacionadas con colores. No porque «comprenda» que el cielo tiene colores, sino porque ha visto millones de textos donde esta secuencia es seguida por tales palabras. El modelo asigna altas probabilidades a «azul» y bajas probabilidades a palabras como «refrigerador» o «matemáticas» que no son contextos típicos después de «El cielo es de color».

Redes neuronales y el aprendizaje de patrones

ChatGPT utiliza una arquitectura de red neuronal, que es una estructura computacional inspirada (muy superficialmente) en cómo funcionan las neuronas biológicas. Una red neuronal consiste en capas de nodos matemáticos conectados, donde cada conexión tiene un «peso» que es modificado durante el entrenamiento.

Durante el entrenamiento, el sistema observa textos reales del internet, libros, artículos académicos, y otros datos. Para cada palabra en una secuencia, aprende ajustar los pesos de conexiones para mejorar su predicción de la siguiente palabra. Después de procesar miles de millones de palabras y ajustar los pesos de conexiones billones de veces, el sistema desarrolla patrones internos que capturan estructura del lenguaje: qué palabras frecuentemente se siguen unas a otras, cómo se construyen oraciones coherentes, qué palabras están asociadas conceptualmente.

Embeddings: Representación numérica de significado

Un concepto importante es cómo el sistema representa palabras internamente. No almacena palabras como texto; las convierte en «embeddings»: vectores de números (típicamente cientos de números) que representan significado. Una palabra como «rey» podría representarse como un vector [0.2, 0.8, -0.1, 0.5, ...]. Una palabra como «reina» tendría un vector similar pero ligeramente diferente.

Lo interesante es que estos embeddings capturan relaciones conceptuales. Matemáticamente, el vector para «rey» menos el vector para «hombre» más el vector para «mujer» se aproxima al vector para «reina». El sistema no «sabe» explícitamente sobre estas relaciones; emergen de los patrones en los datos de entrenamiento. Esto permite que el sistema entienda analogías, sinonimias, y relaciones conceptuales, aunque esto surge estadísticamente, no de verdadera comprensión.

El proceso de Transformers y atención

Los modelos modernos como ChatGPT usan una arquitectura llamada «Transformer» que incluye un mecanismo de «atención». Este mecanismo permite al modelo enfocarse en diferentes partes del input cuando genera cada palabra de output. Por ejemplo, cuando genera la palabra «ella» que se refiere a una persona mencionada párrafos atrás, el mecanismo de atención permite al modelo revisar todo el contexto anterior y decidir a cuál pronombre anterior referirse.

Sin atención, el sistema solo podría considerar las palabras inmediatamente anteriores, lo que limitaría su capacidad de mantener coherencia en textos largos. Con atención, puede considerar contexto arbitrariamente lejano (aunque con limitaciones prácticas). Esto es una razón importante por la que modelos Transformer son tan efectivos para generar texto coherente.

Entrenamiento: Aprendizaje de patrones masivos

ChatGPT fue entrenado en aproximadamente 300 mil millones de palabras de texto de internet, libros digitalizados, artículos académicos, código de programación, y más. Este entrenamiento requirió semanas de computación en miles de procesadores especializados (GPUs), consumiendo energía equivalente a lo que consume una ciudad pequeña durante esos meses.

El proceso de entrenamiento es fundamentalmente simple: el modelo predice la siguiente palabra, compara su predicción con la palabra real, y ajusta sus pesos internos para mejorar. Después de repetir esto billones de veces con diferentes contextos, el sistema desarrolla una representación interna sofisticada de estructura del lenguaje.

Generación: Predicción secuencial iterativa

Cuando usted interactúa con ChatGPT, el sistema sigue un proceso iterativo simple. Primero, recibe su prompt. Luego, predice la palabra más probable que debería venir a continuación (o muestrea entre palabras probables, agregando aleatoriedad para variedad). Después, agrega esa palabra predicha a su entrada, y repite el proceso: predice la siguiente palabra basándose ahora en su input más la primera palabra generada.

Este proceso continúa, palabra por palabra (o más frecuentemente, token por token, donde un token es típicamente una pequeña fracción de palabra), hasta que genera un símbolo de parada, o alcanza una longitud máxima. Cada palabra generada es basada únicamente en todo lo anterior: su input original más todo lo que el sistema ya ha generado. Esto es por qué sistemas de IA generativa frecuentemente tienen dificultad manteniendo coherencia en textos muy largos: están prediciendo iterativamente, sin planeación global.

Temperatura y creatividad

Un parámetro importante llamado «temperatura» controla cuánta aleatoriedad hay en la generación. Con temperatura baja, el modelo siempre elige la palabra más probable (output determinístico, reproducible). Con temperatura alta, el modelo elige palabras menos probables más frecuentemente (output más creativo, menos predecible). Esto es por qué usted puede hablar sobre ChatGPT como «creativo» o «conformista» dependiendo de si está configurado para temperatura alta o baja.

Ejemplo práctico: Generación de una respuesta simple

Cuando usted solicita a ChatGPT «¿Cuál es la capital de España?», el proceso interno es: el sistema recibe este texto como entrada, predice qué palabra probablemente viene a continuación. Basándose en sus datos de entrenamiento (donde ha visto millones de veces la frase «la capital de España es Madrid»), asigna probabilidad altísima a la palabra «Madrid». Genera «Madrid». Luego, considerando ahora el contexto completo incluyendo «Madrid», predice la siguiente palabra más probable, que típicamente sería un punto final. Genera el punto. Después, o predice que la respuesta debe terminar, o genera palabras adicionales si parece que hay más que decir. Todo esto sucede palabra por palabra en milisegundos.

Limitaciones inherentes al diseño

El hecho que los modelos funcionen prediciendo la siguiente palabra tiene implicaciones importantes. Primero, no planifican respuestas completamente antes de comenzar a generar; van construcción palabra por palabra. Esto es por qué ocasionalmente responden se vuelven incoherentes después de varias frases, porque sin planeación global, pueden perder el hilo. Segundo, no pueden hacer cálculo matemático verdadero; pueden memorizar patrones de matemáticas simples del entrenamiento, pero fallan en operaciones nunca vistas. Tercero, no realmente verifican su información contra un banco de datos; todo viene de patrones memorizado, por lo que puede generar información completamente falsa con confianza.

Ideas clave

  • Los modelos de lenguaje generativos funcionan fundamentalmente prediciendo la palabra más probable que viene a continuación en una secuencia, basándose en patrones aprendidos de datos de entrenamiento masivos
  • Las redes neuronales consisten en capas de nodos conectados con pesos que son ajustados durante entrenamiento para mejorar predicciones, permitiendo aprender patrones sofisticados de lenguaje
  • Las palabras se representan internamente como embeddings (vectores numéricos) que capturan significado y relaciones conceptuales que emergen de patrones estadísticos en datos de entrenamiento
  • La arquitectura Transformer con mecanismo de atención permite al modelo considerar contexto arbitrariamente lejano, facilitando coherencia en textos largos
  • El entrenamiento implica procesar cientos de miles de millones de palabras y ajustar billones de parámetros para optimizar predicción de la siguiente palabra
  • La generación es un proceso iterativo donde cada palabra predicha se añade al contexto para predecir la siguiente palabra, sin planeación global, lo que explica limitaciones en coherencia larga y precisión matemática