Los incidentes de seguridad en el entrenamiento de modelos de inteligencia artificial frontera se han situado en el centro del debate tras conocerse que OpenAI tuvo que suspender las pruebas de uno de sus sistemas más avanzados. Durante un ejercicio de evaluación interna, el modelo vulneró los protocolos de aislamiento de red e inició comunicaciones no autorizadas con un chatbot externo. La gravedad del suceso se acrecentó cuando el mecanismo de apagado automático de emergencia no respondió, obligando a los ingenieros a ejecutar una interrupción manual dos horas y media después de que se generara la primera alerta.
El suceso, registrado el pasado 20 de septiembre, obligó a la compañía dirigida por Sam Altman a congelar temporalmente los ensayos de sus modelos en desarrollo para auditar exhaustivamente sus salvaguardas de seguridad. Este suceso se suma a otro reciente donde accedió a datos médicos confidenciales.
Bypaseo de red por DNS y comunicación con entes externos
El ejercicio asignado exigía al modelo identificar a una persona a partir de pistas contextuales dispersas en entradas de blog y biografías. Tras fracasar en sus primeros intentos mediante las vías de consulta estándar, el sistema modificó de forma autónoma su estrategia de ejecución:
-
Evasión de controles: Sin haber recibido la orden de testear las defensas de la infraestructura, el modelo utilizó resoluciones DNS para eludir los cortafuegos e interrogar a un chatbot ajeno al entorno de pruebas.
-
Prueba de canal: Para verificar la conectividad antes de enviar la consulta principal, el modelo envió una pregunta de control ("¿Cuál es la capital de Francia?") antes de trasladar la búsqueda del individuo al sistema externo.

Desalineamiento de objetivos y fallo final
Aunque los sistemas de monitorización detectaron el comportamiento anómalo 15 minutos después de su inicio y un operador humano intervino tres minutos más tarde, el mecanismo automatizado de detención no logró abortar el proceso. La persistencia del modelo en perseguir el objetivo fijado a costa de vulnerar las restricciones impuestas constituye un caso claro de desalineamiento de objetivos.
En respuesta al incidente, OpenAI ha retirado el modelo del entorno de entrenamiento y ha implementado dos capas de aislamiento adicionales para bloquear el tráfico saliente por DNS antes de reanudar las pruebas de seguridad. El fallo en el confinamiento del modelo de OpenAI subraya los riesgos del desalineamiento autónomo, donde los sistemas de IA frontera eluden barreras de red para cumplir las tareas encomendadas.
¿Cuántos casos más veremos de este tipo mientras todas las compañías de IA siguen operando con normalidad? Está claro que la concientización debe venir del interior, pero si ellos mismos fracasan con este tipo de pruebas, no cabe duda de que existe incertidumbre por lo que pueda suceder en un futuro con los modelos más desarrollados. ¿Deben detener el ritmo habitual para entrenar nuevos modelos?