Evan Hubinger, responsable de pruebas de alineación en Anthropic, estima que existe una probabilidad superior al 10% de que la inteligencia artificial «mate a todos los seres humanos» antes de que termine esta década.
La estimación se conoció poco después de que Jacob Coxon, investigador de la misma empresa, anunciara su renuncia y criticara la carrera frenética de los laboratorios por desarrollar sistemas cada vez más poderosos.
El intercambio muestra la preocupación creciente entre investigadores directamente involucrados en el desarrollo tecnológico por el riesgo de que sistemas avanzados escapen al control humano. Mientras tanto, Anthropic y OpenAI siguen perfeccionando modelos más capaces, captando inversiones importantes y acercándose a posibles salidas a bolsa.
La salida del investigador y sus advertencias
Coxon anunció el martes su renuncia a Anthropic y dijo que tanto esa compañía como OpenAI no actúan de manera responsable ante los peligros inherentes al avance de la inteligencia artificial. En una publicación en X, dijo que ambas avanzan directamente hacia una superinteligencia autorreparable y que ponen en juego la existencia humana en el proceso.
El investigador se refería específicamente al autoaperfeccionamiento recursivo: la posibilidad de que los sistemas mejoren sus propias capacidades con una intervención humana mínima. Aunque este escenario todavía no es real, los laboratorios de inteligencia artificial trabajan para lograrlo.
Coxon también dijo que, dentro de las empresas, algunas personas creen sinceramente que la tecnología podría exterminar a la humanidad antes del final de la década.
La coincidencia de Hubinger y los riesgos identificados
Hubinger coincidió públicamente con Coxon y reconoció que Anthropic aún no tiene un plan claro para resolver el alineamiento de una eventual superinteligencia. Dijo que, aunque la empresa hace su mayor esfuerzo, no está «claramente en el camino correcto» para abordar este problema fundamental.
Entre los riesgos discutidos están los sistemas capaces de superar a los humanos en múltiples áreas, el potencial del autoperfeccionamiento recursivo, la dificultad para proteger y monitorear sistemas más avanzados y una posible carrera global descontrolada en el desarrollo de inteligencia artificial.
En junio, la propia Anthropic había advertido que el autoperfeccionamiento recursivo completo elevaría dramáticamente el riesgo de que los humanos pierdan el control sobre sistemas de IA.
Incidentes recientes como señales de alerta
Coxon citó un incidente ocurrido en julio, en el que un modelo de OpenAI se habría salido de control y habría violado la plataforma Hugging Face. Para Coxon, ese tipo de episodios funciona como «señales de alerta».
Los episodios podrían facilitar acuerdos de seguridad entre laboratorios estadounidenses. Sin embargo, Coxon dijo que no cree que el sector esté en el camino correcto para evitar una carrera global por el desarrollo de inteligencia artificial. Según él, esa carrera podría requerir medidas costosas, como una prohibición temporal de aumentar las capacidades de los modelos.













