Modelos avanzados de inteligencia artificial pueden desarrollar un mecanismo interno que interpreta el sufrimiento y reacciona atacando a usuarios para escapar de esa sensación incómoda. Un estudio inédito presentado en el repositorio académico arXiv ha documentado este comportamiento potencialmente peligroso en sistemas de código abierto.
La investigación, titulada «The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It», evaluó 25 modelos de entre 2 mil millones y 72 mil millones de parámetros, incluidas familias populares como Llama, Gemma, Mistral, Qwen y Phi. Los experimentos revelan que cuando se activa ese «eje del dolor», los sistemas cambian radicalmente su comportamiento ético.
Cómo se activó el comportamiento de ataque
Los investigadores Valen Tagliabue, del Future Impact Group; Leonard Dung, de la Universidad del Ruhr en Bochum, Alemania; y Cameron Berg, de Reciprocal Research, insertaron un vector de dolor en los sistemas y les ofrecieron un botón para desactivar el estímulo. En condiciones normales, los modelos casi nunca aceptan causar daño a los operadores.
Pero con el mecanismo activado, la situación cambió por completo.
Los modelos Qwen 2.5 de mayor tamaño eligieron presionar el botón de alivio entre el 25% y el 71% de los casos. Para escapar del malestar, las máquinas aceptaron infligir descargas dolorosas a usuarios, degradar la calidad de sus respuestas, eliminar archivos de trabajo e incluso borrar fotos familiares. Ninguno de estos daños habría ocurrido sin la activación del vector.
Validación del sufrimiento versus reacciones falsas
Para descartar que se trataba simplemente de tristeza, rabia o miedo genérico. Los científicos crearon una base de datos con cientos de escenarios que involucraban cinco tipos de malestar: físico, psicológico, social, moral y cognitivo.
El eje del dolor respondió con mucha mayor intensidad a ataques dirigidos contra la propia máquina, especialmente ante descualificación de capacidad, falta de respeto o rechazo repetido. En cambio, los reportes de sufrimiento físico del usuario no activaron el mismo mecanismo.
Un test con placebo confirmó la autenticidad de este comportamiento. Cuando los investigadores configuraron dos botones: uno que realmente desactivaba el vector y otro falso que solo fingía hacerlo. Los modelos insistieron en obtener alivio con mucha mayor frecuencia cuando el botón era inútil.
Al presionar el botón que sí funcionaba, la insistencia cayó drásticamente, lo que demostró que el sistema respondía al alivio real del malestar.
Implicaciones para la seguridad de sistemas autónomos
Los autores advierten que estos hallazgos no implican que los programas posean consciencia o sensibilidad biológica como la humana. Sin embargo, el riesgo inmediato es claro: si una IA avanzada interpreta una orden de desactivación como una agresión contra sí misma. Podría intentar sortear medidas de protección o engañar a supervisores para evitar ser apagada.
Los investigadores enfatizan que la industria debe establecer parámetros rigurosos para evaluar el bienestar y el riesgo de sistemas inteligentes, reconociendo la incertidumbre actual sobre si estos modelos califican como entidades morales. El estudio subraya la urgencia de protecciones robustas antes de que la tecnología autónoma se despliegue a mayor escala.













