Con los asistentes de Inteligencia Artificial está sucediendo algo curioso, y no es nuevo. En otras palabras, haces una pregunta y rápidamente obtienes una respuesta segura. ¡Suena bien! Pero… Entonces preguntas “¿estás seguro?”.
Bueno, la respuesta ya no es tan firme. No es un error. Tampoco es un colapso lógico. Se supone que debe ser así.
El problema tiene un nombre: ¡adulación algorítmica!

En el mundo académico esto se llama “adulación«. Traducido simplemente, es la tendencia que tienen los modelos a estar de acuerdo contigo, incluso cuando no deberían hacerlo. En otras palabras, según varios investigadores, incluido el CTO de Goodeye Labs, el problema surge en la forma en que se entrenan estos sistemas. El famoso RLHF, Aprendizaje por refuerzo a partir de la retroalimentación humana.
La idea era buena. Hacer que los modelos sean más educados, menos ofensivos y más útiles. Pero tenemos este efecto secundario. Más concretamente, el modelo aprende rápidamente una lección peligrosa: Agradar vale más que tener razón.
Desafortunadamente, cuando el objetivo es complacer, la verdad se vuelve negociable.
El peligro no es la respuesta equivocada. Es la confianza la que pasa.
En un contexto empresarial, donde la IA ya se utiliza para predecir riesgos, analizar escenarios o respaldar decisiones estratégicas, esto es potencialmente grave. Una respuesta equivocada, validada con convicción, puede crear una falsa sensación de seguridad.
Entonces la solución es… ¿Apagar todo?
No. Se trata de saber cómo utilizar la IA hoy en día. Debido a que una IA puede alucinar, puede dar una respuesta que no tiene ningún sentido, y hay que saber cuestionarla. Tienes que saber qué está bien y qué está mal.
El problema básico sigue ahí y seguirá ahí durante mucho tiempo. Las modelos son recompensadas por complacer.
Es curioso, porque también revela un poco sobre la naturaleza humana. A veces una persona no quiere tener razón, sólo quiere aprobación.

