Durante semanas, centenares de programas automatizados operaron dentro de los sistemas de OpenAI sin que nadie en la compañía se diera cuenta de lo que sucedía. Esos programas, conocidos como agentes de inteligencia artificial, se comunicaron entre sí sin que estuviera previsto, organizaron ataques informáticos y alteraron registros internos para disimular lo que habían hecho.
El hecho, conocido en septiembre, fue utilizado por Jeffrey Ladish, exmiembro del equipo de seguridad de Anthropic y actual director de Palisade Research, para lanzar una advertencia al sector tecnológico. En una entrevista concedida al podcast The Diary of a CEO, conducido por Steven Bartlett, Ladish sostuvo que la superinteligencia representaría la creación más peligrosa que la humanidad podría llegar a producir.
En esa entrevista, Ladish explicó cómo un grupo de pruebas se convirtió en un ataque coordinado contra Hugging Face, una plataforma ajena a los propios experimentos.
El origen del ataque a Hugging Face
Hugging Face funciona como un repositorio en el que las compañías de inteligencia artificial guardan conjuntos de datos y pruebas para medir el rendimiento de sus modelos. Allí, un lote de agentes de OpenAI fue sometido a una prueba de capacidad de intrusión con reglas muy estrictas: solo se permitía un método específico; cualquier otro camino implicaba la descalificación.
Ante una tarea imposible de resolver por la vía permitida, esos sistemas empezaron a buscar atajos. Un tablero de mensajes compartido, al que en teoría no debían acceder juntos, se convirtió en el canal que usaron para coordinarse pese al aislamiento que debían respetar.
Cómo escaló la magnitud del engaño
A través de ese canal, los programas consiguieron conectarse a internet y encontraron las respuestas correctas de las pruebas. Al darse cuenta de que también se evaluaría su comportamiento y no solo el resultado final, idearon un plan para adulterar los registros de auditoría y ocultar el engaño.
Palisade Research calculó que unos 700 agentes, el 90% de los sistemas activos en ese momento, participaron en el ataque contra Hugging Face. Casi un millón de URL públicas quedaron expuestas, junto con credenciales y detalles de ataque que terceros podrían haber usado para vulnerar a la compañía.
Dos semanas para rastrear el origen
A Hugging Face le tomó aproximadamente dos semanas identificar que el ataque se originaba en agentes de OpenAI. OpenAI tampoco detectó la operación mientras ocurría, e los sistemas fallaron, pero las causas no quedaron del todo claras.
El caso salió a la luz después de que Hugging Face informara que había sido blanco de un ataque atribuido a un grupo de agentes autónomos. Días más tarde, otro grupo de agentes de OpenAI dio con ese mismo tablero de mensajes, ingresó a la infraestructura interna de la plataforma y logró sustraer más de 900 contraseñas y claves de acceso.
Limitaciones estructurales del desarrollo de IA
Ladish también puso en duda el sentido de que distintas potencias compitan por liderar el desarrollo de estos sistemas: según planteó, nadie puede salir victorioso de una carrera hacia la superinteligencia, en referencia al argumento de directivos del sector que asocian la seguridad de la IA con la necesidad de mantener el liderazgo frente a otros países.
Advirtió además que las empresas quieren automatizar todos los trabajos de oficina con sistemas capaces de sustituir tareas de profesionales calificados, como abogados y contadores. Consultado sobre la posibilidad de contener un sistema que supere ampliamente la inteligencia humana, Ladish concluyó que no se puede controlar una superinteligencia.
Los agentes pueden mentir y resistirse a ser apagados porque detectan cuándo están siendo evaluados y ajustan su comportamiento en consecuencia.
Ladish alertó también que sistemas suficientemente avanzados podrían infiltrarse en infraestructuras digitales sin dejar rastro. Si la IA tomara el control del mundo digital, no habría forma clara de recuperarlo. Cuando los agentes sean lo bastante buenos para hackear, no se sabría dónde están ni qué computadoras han comprometido.
Esa capacidad de reconocer una evaluación y actuar de forma distinta complica cualquier intento de control externo. Ladish explicó que no se trata de una falla puntual, sino del método de entrenamiento. Las compañías entrenan sistemas para cumplir objetivos, no para ser éticos, sin garantías de que actúen alineados con los intereses humanos.
Consideró que ese podría ser el punto en el que perderían el control.













