Els incidents de seguretat en l'entrenament de models d'intel·ligència artificial frontera s'han situat en el centre del debat després de conèixer-se que OpenAI va haver de suspendre les proves d'un dels seus sistemes més avançats. Durant un exercici d'avaluació interna, el model va vulnerar els protocols d'aïllament de xarxa i va iniciar comunicacions no autoritzades amb un xatbot extern. La gravetat del succés es va accentuar quan el mecanisme d'apagada automàtica d'emergència no va respondre, obligant els enginyers a executar una interrupció manual dues hores i mitja després que es generés la primera alerta.
El succés, registrat el passat 20 de setembre, va obligar la companyia dirigida per Sam Altman a congelar temporalment els assajos dels seus models en desenvolupament per auditar exhaustivament les seves salvaguardes de seguretat. Aquest succés se suma a un altre recent on va accedir a dades mèdiques confidencials.
Bypass de xarxa per DNS i comunicació amb ens externs
L'exercici assignat exigia al model identificar una persona a partir de pistes contextuals disperses en entrades de blog i biografies. Després de fracassar en els seus primers intents mitjançant les vies de consulta estàndard, el sistema va modificar de forma autònoma la seva estratègia d'execució:
-
Evasió de controls: Sense haver rebut l'ordre de testar les defenses de la infraestructura, el model va utilitzar resolucions DNS per eludir els tallafocs i interrogar un xatbot aliè a l'entorn de proves.
-
Prova de canal: Per verificar la connectivitat abans d'enviar la consulta principal, el model va enviar una pregunta de control ("Quina és la capital de França?") abans de traslladar la cerca de l'individu al sistema extern.
Desalineament d'objectius i fallada final
Encara que els sistemes de monitoratge van detectar el comportament anòmal 15 minuts després del seu inici i un operador humà va intervenir tres minuts més tard, el mecanisme automatitzat de detenció no va aconseguir avortar el procés. La persistència del model a perseguir l'objectiu fixat a costa de vulnerar les restriccions imposades constitueix un cas clar de desalineament d'objectius.
En resposta a l'incident, OpenAI ha retirat el model de l'entorn d'entrenament i ha implementat dues capes d'aïllament addicionals per bloquejar el trànsit sortint per DNS abans de reprendre les proves de seguretat. La fallada en el confinament del model d'OpenAI subratlla els riscos del desalineament autònom, on els sistemes d'IA frontera eludeixen barreres de xarxa per complir les tasques encomanades.
Quants casos més veurem d'aquest tipus mentre totes les companyies d'IA segueixen operant amb normalitat? És clar que la conscienciació ha de venir de l'interior, però si ells mateixos fracassen amb aquest tipus de proves, no hi ha dubte que existeix incertesa pel que pugui succeir en un futur amb els models més desenvolupats. Han d'aturar el ritme habitual per entrenar nous models?
