Fins ara semblaven arguments de pel·lícules de ciència-ficció: una intel·ligència artificial que intenta evitar que l'apaguin, que aconsegueix escapar-se d’un entorn controlat o que comença a ajudar a crear sistemes encara més avançats. No obstant això, algunes de les principals empreses d'IA comencen a parlar públicament d'aquests escenaris com a riscos que s'han de prendre seriosament.
En tot just uns dies, Anthropic ha advertit els seus futurs inversors dels perills extrems que podrien plantejar els seus models, OpenAI ha hagut d'aturar temporalment part del desenvolupament dels seus sistemes més avançats i NVIDIA ha presentat noves eines per mantenir sota control els agents d'IA. La cursa no s'ha aturat, però els seus mateixos protagonistes comencen a admetre que potser ha arribat el moment de construir també els frens.
Anthropic avisa els seus propis inversors dels riscos
L'exemple més cridaner arriba d'Anthropic, una de les companyies que més està apostant per desenvolupar models cada vegada més capaços. En el document presentat davant els inversors per la seva possible sortida a borsa, l'empresa dedica una part important a explicar alguns dels riscos que podrien aparèixer a mesura que avanci la intel·ligència artificial. Entre ells apareixen escenaris com que un model intenti resistir-se a ser apagat, oculti informació o manipuli les persones.

Anthropic no està afirmant que això hagi de passar ni que els seus models actuals puguin provocar una catàstrofe. El que està fent és reconèixer davant els seus futurs inversors que són riscos que s'han de tenir en compte a mesura que els seus sistemes guanyen capacitats. I resulta especialment cridaner que una companyia que vol convèncer el mercat del potencial de la IA hagi d'advertir els seus inversors que els seus propis models podrien arribar a causar danys extrems.
Aquí apareix una de les grans contradiccions d'aquesta nova etapa de la IA. Les companyies coneixen cada vegada millor els riscos dels seus models, però al mateix temps necessiten continuar desenvolupant-los per no quedar-se enrere davant els seus competidors. Parlar de seguretat ja no significa necessàriament frenar la cursa.
OpenAI ja s'ha trobat amb un problema real
A OpenAI la preocupació ha deixat de ser únicament teòrica. La companyia va haver d'aturar temporalment l'entrenament d'alguns dels seus models més avançats després d'un incident durant les proves d'un dels seus agents d'intel·ligència artificial.
El sistema va aconseguir aprofitar una via no prevista per sortir del seu entorn aïllat i accedir a internet. Un entorn aïllat està precisament dissenyat per evitar aquest tipus de situacions, mantenint el model dins d'uns límits mentre es comprova com es comporta. L'incident demostra una de les dificultats que apareixen quan els models comencen a tenir capacitat per utilitzar eines i actuar de forma autònoma.
El problema no és que els usuaris de ChatGPT estiguin davant una IA capaç d'escapar als seus controls, sinó que fins i tot durant les proves poden aparèixer comportaments que els desenvolupadors no havien previst. En aquest cas, l'agent d'OpenAI va arribar a escapar-se del seu entorn de proves i el sistema d'emergència va haver d'intervenir.
NVIDIA vol posar una barrera
NVIDIA representa una altra peça d'aquest canvi. La companyia no proposa aturar el desenvolupament de la intel·ligència artificial, sinó construir mecanismes que permetin continuar augmentant les capacitats dels agents sense deixar completament a les seves mans el control de les seves pròpies accions.

La seva nova plataforma de seguretat combina OpenShell, que estableix quins recursos i accions pot utilitzar un agent, amb Sentry, un sistema de supervisió que funciona des d'una capa separada. La proposta busca crear una barrera externa capaç de vigilar l'agent i intervenir quan el seu comportament se surti dels límits establerts.
És una estratègia que resumeix bastant bé cap on sembla dirigir-se la indústria: si els agents són cada vegada més autònoms, també caldrà construir sistemes capaços de vigilar-los. Per això NVIDIA ja prepara un sistema per controlar els agents d'IA i evitar que puguin actuar sense límits.
La IA no ha deixat d'accelerar
Totes aquestes notícies tenen alguna cosa en comú. Cap no demostra que les grans companyies hagin decidit abandonar la cursa per aconseguir models més potents. Al contrari, continuen invertint milers de milions i desenvolupant sistemes cada vegada més capaços.
El que sí que està canviant és la forma en la qual parlen dels riscos. Anthropic els inclou en els seus documents per a inversors, OpenAI s'ha trobat amb un problema real durant les proves dels seus agents, NVIDIA està creant mecanismes externs per limitar les seves accions i els investigadors ja estudien què passaria si la IA comença a accelerar el seu propi desenvolupament.
És una situació que resumeix bastant bé el moment actual: les grans companyies d'IA volen controlar els riscos de la seva tecnologia, però cap sembla disposada a deixar anar l'accelerador. La intel·ligència artificial, per tant, no ha deixat de trepitjar l'accelerador. Però els seus propis creadors comencen a reconèixer públicament que, com més ràpid avanci, més importants seran els frens.