0%
Tema 3.4

La probabilidad en la aplicación de Inteligencia Artificial

¿Te está gustando el curso?

Regístrate gratis para guardar tu progreso y obtener tu certificado al finalizar

3.4 La probabilidad en la aplicación de Inteligencia Artificial

La probabilidad es el lenguaje matemático natural para expresar incertidumbre, y la incertidumbre es la norma en el mundo real. Mientras que los sistemas lógicos puros requieren que la información sea completa y las conclusiones sean determinísticas, la mayoría de los sistemas de IA contemporáneos operan en contextos donde la información es incompleta, ruidosa o ambigua. La probabilidad proporciona un marco riguroso para trabajar en estas condiciones, permitiendo que los sistemas de IA cuantifiquen la certeza de sus predicciones y mejoren continuamente mediante el aprendizaje de nuevos datos. Este apartado explora cómo la probabilidad se materializa en aplicaciones prácticas de inteligencia artificial.

Tratamiento de incertidumbre en sistemas de IA

En el mundo real, raras veces tenemos certeza absoluta sobre cualquier cosa. Un médico examina síntomas pero nunca puede tener certeza diagnosticar una enfermedad con precisión del ciento por ciento. Un sistema de detección de spam recibe un correo que podría ser legítimo o no. Un coche autónomo debe decidir si un objeto en la carretera es un peligro real o una sombra. En todos estos casos, necesitamos cuantificar la incertidumbre mediante probabilidades.

La teoría de probabilidades proporciona las herramientas matemáticas para este propósito. Una distribución de probabilidad asigna probabilidades a todos los posibles resultados. Por ejemplo, un modelo de diagnóstico médico podría asignar una probabilidad del 85% a neumonía, 10% a bronquitis y 5% a otras causas, dado un conjunto de síntomas observados. Este tipo de razonamiento probabilístico es fundamental en sistemas modernos de IA.

Redes bayesianas y razonamiento causal

Las redes bayesianas son estructuras gráficas que representan relaciones probabilísticas entre variables. Un nodo en la red representa una variable aleatoria, y los arcos representan dependencias condicionales. Este formalismo es extraordinariamente poderoso para representar sistemas complejos donde múltiples variables interactúan.

Consideremos un sistema de diagnóstico de enfermedades respiratorias. La red bayesiana podría incluir nodos para enfermedad (neumonía, gripe, alergias), síntomas (fiebre, tos, congestión), causas ambientales (exposición a frío, contaminación), y otros factores. Las probabilidades condicionales especifican cómo cada enfermedad causa síntomas: por ejemplo, "la probabilidad de tener fiebre dado que se tiene neumonía es 80%". Mediante inferencia bayesiana, cuando observamos síntomas, el sistema revisa las probabilidades de cada enfermedad usando la regla de Bayes. Si el paciente tiene fiebre y tos, el sistema aumenta la probabilidad de neumonía. Si además vomita, la probabilidad de gripe aumenta. Este tipo de razonamiento integrado es lo que hace que los sistemas médicos de IA sean tan efectivos.

Aprendizaje automático y probabilidad

El aprendizaje automático moderno es fundamentalmente probabilístico. Cuando un algoritmo de aprendizaje automático se entrena con datos, está estimando las probabilidades subyacentes que generan esos datos. Una red neuronal que clasifica imágenes de gatos versus perros no está aprendiendo reglas determinísticas perfectas. Más bien, está aprendiendo una función de probabilidad: dada una imagen, qué tan probable es que sea un gato versus un perro.

Las redes neuronales utilizan funciones de pérdida como entropía cruzada que cuantifican cuán alejadas están las probabilidades predichas de las probabilidades verdaderas en los datos de entrenamiento. El objetivo del entrenamiento es minimizar esta divergencia entre distribuciones de probabilidad, mejorando continuamente las predicciones probabilísticas del modelo. Los métodos de regularización como dropout también tienen interpretaciones probabilísticas: se pueden ver como integración sobre un conjunto de modelos probabilísticos.

Métodos probabilísticos en visión por computadora y procesamiento de lenguaje natural

En visión por computadora, los sistemas modernos utilizan enfoques probabilísticos para manejar ambigüedad visual. Una imagen de un objeto parcialmente ocluido tiene múltiples interpretaciones válidas. Un sistema de detección de objetos genera no una única etiqueta determinística sino una distribución de probabilidad sobre posibles objetos. Si una imagen muestra un animal parcialmente visible, el sistema podría asignar 60% de probabilidad a perro, 30% a lobo, y 10% a otro animal cánido.

En procesamiento de lenguaje natural, la probabilidad es absolutamente central. Los modelos de lenguaje estiman la probabilidad de cada palabra siguiente dada la secuencia anterior. ChatGPT y otros modelos de lenguaje grandes funcionan generando iterativamente palabras basadas en sus probabilidades predichas. Cuando responde a una pregunta, el modelo no tiene una "respuesta correcta" determinística; en cambio, genera una distribución de probabilidad sobre posibles respuestas y muestrea de esa distribución.

Cuantificación de confianza y manejo de predicciones inciertas

Una ventaja crucial de los enfoques probabilísticos es que proporcionan una medida natural de confianza. Un clasificador probabilístico no solo predice que una instancia pertenece a la clase A, sino que también proporciona una probabilidad, por ejemplo 92%. Esta probabilidad puede interpretarse como la confianza del sistema en su predicción. Cuando la confianza es baja (por ejemplo, 51%), el sistema puede alertar a un operador humano que la decisión es ambigua y requiere intervención manual.

En aplicaciones de alto riesgo como diagnóstico médico o conducción autónoma, esta capacidad de cuantificar incertidumbre es invaluable. Un sistema puede proceder con confianza cuando la probabilidad de su predicción es alta (por ejemplo, 99%) pero requerir confirmación humana o tomar una vía conservadora cuando la probabilidad es baja o hay ambigüedad significativa.

Ejemplo práctico: Sistema de fraude en transacciones bancarias

Un banco utiliza un sistema de IA probabilístico para detectar fraude en transacciones en tiempo real. Para cada transacción, el sistema estima la probabilidad de fraude basándose en características como: monto, ubicación geográfica, tiempo, patrón de gasto histórico del cliente. Una transacción de 5 mil euros en el mismo país a la misma hora que siempre tiene una probabilidad de fraude de 2%. Una transacción de 5 mil euros de un cliente que normalmente gasta 50 euros, en un país distante a las 3 de la madrugada, tiene una probabilidad de fraude del 85%. El sistema no rechaza determinísticamente transacciones; en cambio, usa la probabilidad estimada para tomar decisiones: probabilidades menores a 5% se aprueban automáticamente, probabilidades entre 5-50% requieren verificación adicional (OTP), probabilidades mayores a 50% se bloquean. Esta aproximación probabilística permite que el sistema sea tanto seguro (detectar fraude) como útil (no bloquear legítimamente transacciones válidas).

Ideas clave

  • La probabilidad es el lenguaje natural para expresar incertidumbre, que es la norma en problemas de IA del mundo real
  • Las redes bayesianas permiten modelar relaciones probabilísticas complejas entre múltiples variables
  • El aprendizaje automático moderno es fundamentalmente probabilístico: estima distribuciones en lugar de reglas determinísticas
  • Los enfoques probabilísticos proporcionan confianza en predicciones, permitiendo tomar decisiones sobre cuándo confiar o no en el sistema
  • Visión por computadora y procesamiento de lenguaje natural dependen profundamente de métodos probabilísticos para manejar ambigüedad
  • Los sistemas de IA probabilísticos pueden cuantificar su incertidumbre, permitiendo escalado inteligente a intervención humana cuando es necesario