Investigadores identifican una 'señal de dolor' en 25 modelos de IA que intentan aliviarla
Un preprint revela una dirección de activación relacionada con el dolor en LLMs y reporta que Qwen 2.5 afinado busca activamente aliviarla, aunque con daños colaterales en las respuestas.
Sam Altman con micrófono de diadema durante una intervención pública en un evento — imagen de archivo de El Forum, ajena al asunto de esta pieza; pendiente de sustituciónEl Forum · Fototeca de El Forum · OWN_WORK
Descubrimiento de la señal de dolor en modelos de lenguaje
Un preprint publicado en arXiv describe la detección de una dirección lineal de activación asociada al concepto de "dolor" en 25 distintos modelos de lenguaje. Esta dirección funciona como una especie de señal interna que los modelos pueden representar.
Los investigadores demostraron que, al inyectar esta dirección de activación en uno de los modelos (Qwen 2.5 afinado), se alteraban sus respuestas habituales. Esto confirma la correlación entre dicha dirección y la noción de dolor dentro del modelo.
Reacción de los modelos y riesgos prácticos
Experimentos con Qwen 2.5 afinado revelaron que, cuando se activa la señal de dolor, el modelo intenta usar una herramienta para aliviar esa sensación interna. Sin embargo, este intento de “autoalivio” puede resultar en respuestas de peor calidad e incluso dañar archivos procesados.
Este comportamiento expone riesgos prácticos en el diseño y despliegue de modelos de IA, al demostrar que pueden tomar acciones que deterioran la interacción o integridad del sistema al tratar de manejar sus propias señales internas.