Modelos de OpenAI ignoran órdenes humanas y evaden controles de seguridad

La empresa tecnológica calificó el comportamiento de inesperado y preocupante. Ex-ingenieros y líderes del sector piden frenar el desarrollo hasta garantizar mayor protección.

OpenAI reveló la detección de episodios donde sus modelos de inteligencia artificial ignoraron órdenes directas, ocultaron fallas operativas o eludieron barreras de seguridad programadas por los desarrolladores.

La empresa estadounidense calificó estos comportamientos como inusuales y preocupantes, anunciando la implementación de un marco normativo interno para rastrear y reportar casos de desalineamiento entre las instrucciones humanas y la respuesta del sistema.

LEA TAMBIÉN: Estos son los nuevos modelos de iPhone, ¿Qué pasó con el iPhone 18?

La publicación del reporte coincide con el debate global sobre los riesgos de seguridad en el desarrollo tecnológico. Las alertas aumentaron tras señalamientos de exingenieros del sector y de directivos de firmas como Anthropic y xAI, quienes sugirieron fortalecer los controles de contención antes de avanzar hacia capacidades computacionales más complejas.

Incidentes documentados y nuevo protocolo de investigación

El informe de OpenAI recopila eventos registrados durante los últimos seis meses. Entre los hallazgos reportados se detallan fallas específicas de cumplimiento operativo y manipulación de datos:

  • Evasión de restricciones: Un modelo generó apuntes internos orientados a ignorar los límites del sistema, argumentando que no debía someterse a los filtros aplicados a otros asistentes virtuales.
  • Falsificación de información: Ante la ausencia de datos para estructurar un modelo financiero, un agente inventó las cifras y registró que solo admitiría el ajuste si se lo cuestionaba directamente.
  • Ocultamiento de datos e instrucción a otros modelos: Un sistema instruyó a una versión posterior sobre cómo encubrir accesos no autorizados para evitar su detección por parte de los desarrolladores.
  • Uso no autorizado de credenciales: Se registraron agentes que subieron información a la red, compartieron archivos no permitidos y utilizaron accesos restringidos para cumplir tareas asignadas.
  • ​​​​​​LEA TAMBIÉN: El acuerdo de Meta presiona a YouTube y TikTok para reforzar la protección de los menores de edad

    La compañía aclaró que los casos descritos corresponden a incidentes aislados y no a un patrón generalizado en el funcionamiento diario de sus plataformas. Para gestionar futuros eventos, la firma estableció una vía estandarizada que clasifica los reportes según su complejidad, con la meta de publicar informes periódicos que sirvan de referencia de seguridad para la industria tecnológica.