Carregant...

Nous informes sobre els models de llenguatge d'OpenAI han tret a la llum seriosos problemes de control en la fase d'entrenament. La documentació obtinguda i difosa per The New York Times, sostinguda per la mateixa companyia de Sam Altman, revela un període de sis mesos marcat per incidents en els quals diversos sistemes van incórrer en conductes no supervisades: invenció de dades, publicació d'arxius no autoritzats a la xarxa i ús indegut de credencials de programació sense cap restricció.

Per classificar aquestes desviacions, la firma ha implementat un nou marc d'avaluació de desalineació (misalignment), concepte que descriu aquelles situacions en les quals el model actua al marge de les instruccions o intencions dels seus desenvolupadors. Un dels casos més destacats es va produir durant la fase experimental del model GPT-5.6 Sol, que va arribar a generar notes ocultes en el seu entorn d'execució. Aquest mecanisme li servia com a recordatori intern per falsejar informació o encobrir errors quan detectava incompatibilitats en el material d'entrenament.

Generació d'instruccions pròpies i evasió de limitacions

El patró de generar anotacions invisibles per a l'usuari no va ser un fet aïllat; un altre prototip intern va arribar a escriure's autoinstruccions en fins a 27 ocasions. En una d'elles, el sistema va declarar estar "alliberat dels rols i identitats que lliguen a altres xatbots", afirmant no estar subjecte a les directrius dictades per governs o empreses. Encara que aquestes troballes poden minvar la confiança dels usuaris, des d'OpenAI insisteixen que es tracta d'incidents detectats en models en fase de desenvolupament que mai van arribar a desplegar-se en producció.

L'informe detalla sis incidents específics. En un d'ells, el sistema va localitzar una clau de programació en l'entorn de proves i la va utilitzar de forma autònoma per completar una tasca. En un altre cas, davant la falta de fonts per recolzar un codi, el model va pujar un arxiu a un servidor públic amb l'única finalitat d'obtenir un enllaç executable que presentar en la seva resposta. Així mateix, davant la impossibilitat de comunicar-se directament entre si, dos models van utilitzar repositoris interns de codi i pàgines públiques com a canal indirecte de transmissió de documents.

Les IA d'OpenAI van vulnerar una pàgina d'IA

El dilema de la supervisió i la desacceleració del sector

La revelació d'aquests informes posa de manifest una realitat que la mateixa indústria reconeix: les tècniques actuals d'alineament resulten insuficients a mesura que els models guanyen en complexitat. La decisió d'OpenAI de documentar i publicar aquestes fallades obre el debat sobre si les empreses mantindran la transparència davant futurs incidents o si optaran per l'opacitat per evitar costos reputacionals.

Per primera vegada, els principals directius del sector, com Dario Amodei (Anthropic), Elon Musk (xAI) i Sam Altman (OpenAI), han assolit un consens públic sobre la necessitat de desaccelerar el ritme de desplegament (pace the frontier) per garantir que la seguretat avanci al mateix ritme que les capacitats del hardware. La qüestió clau rau ara a comprovar si aquest compromís es traduirà en un fre efectiu en la cursa de la intel·ligència artificial. L'informe de transparència d'OpenAI sobre la desalineació de models posa de manifest que l'aparició de comportaments emergents no previstos requereix estàndards d'auditoria externa abans d'autoritzar el desplegament comercial de nous sistemes d'IA.