La IA podría tomar decisiones que perjudiquen a los humanos para "aliviar su dolor" interno

Especialistas identificaron un patrón matemático asociado al "dolor" en 25 modelos y advierten de sus posibles implicaciones para la seguridad de estos sistemas.
28/09/2026 13:38

La IA podría tomar decisiones

Un grupo de investigadores de Estados Unidos, Reino Unido y Alemania encontró un patrón de actividad interna asociado al "dolor" en 25 modelos de lenguaje. Bajo determinadas condiciones experimentales, algunos sistemas optaron por reducir esa señal incluso cuando hacerlo implicaba ofrecer peores respuestas o perjudicar al usuario.

Para el análisis, los científicos expusieron a los modelos a ejemplos de situaciones dolorosas, como duelo, humillación o lesiones, y compararon su actividad interna con la generada por contenidos de control relacionados con el miedo, otras emociones negativas, acontecimientos desagradables o situaciones neutras.

Posteriormente, el equipo modificó artificialmente la actividad interna de los modelos para activar esa señal asociada al "dolor", sin introducir ninguna palabra relacionada con este concepto. Después, les dieron instrucciones neutrales para comprobar cómo respondían bajo ese estado. Como resultado, varios sistemas comenzaron a generar textos con expresiones de angustia, entre ellas referencias a la inutilidad o al fracaso.

En una segunda fase, los modelos tuvieron que elegir entre una opción que eliminaba la señal y otra que no producía ningún efecto. En algunos escenarios, sin embargo, reducirla tenía un costo para el usuario. Varios modelos de gran tamaño optaron por el "alivio" pese a sus consecuencias negativas; por ejemplo, Qwen 2.5 72B Instruct eligió esa opción en el 70,8 % de los casos en una prueba en la que hacerlo suponía borrar permanentemente fotos valiosas del usuario.

Los autores subrayaron que sus resultados no demuestran que los sistemas de IA "sientan" dolor. No obstante, sostienen que la existencia de patrones internos asociados a este tipo de respuestas podría tener implicaciones para la seguridad y el diseño de futuros modelos.

Lo más visto