La IA se plantea pisar el freno: ya están admitiendo en público los grandes peligros de su tecnolgía

Hasta ahora parecían argumentos de películas de ciencia ficción: una inteligencia artificial que intenta evitar que la apaguen, que consigue escapar de un entorno controlado o que empieza a ayudar a crear sistemas todavía más avanzados. Sin embargo, algunas de las mayores empresas de IA están empezando a hablar públicamente de estos escenarios como riesgos que deben tomarse en serio.

En apenas unos días, Anthropic ha advertido a sus futuros inversores de los peligros extremos que podrían plantear sus modelos, OpenAI ha tenido que detener temporalmente parte del desarrollo de sus sistemas más avanzados y NVIDIA ha presentado nuevas herramientas para mantener bajo control a los agentes de IA. La carrera no se ha detenido, pero sus propios protagonistas empiezan a admitir que quizá ha llegado el momento de construir también los frenos.

Anthropic avisa a sus propios inversores de los riesgos

El ejemplo más llamativo llega de Anthropic, una de las compañías que más está apostando por desarrollar modelos cada vez más capaces. En el documento presentado ante los inversores por su posible salida a bolsa, la empresa dedica una parte importante a explicar algunos de los riesgos que podrían aparecer a medida que avance la inteligencia artificial. Entre ellos aparecen escenarios como que un modelo intente resistirse a ser apagado, oculte información o manipule a las personas.

Dario Amodei
Dario Amodei, CEO de Anthropic

Anthropic no está afirmando que esto vaya a ocurrir ni que sus modelos actuales puedan provocar una catástrofe. Lo que está haciendo es reconocer ante sus futuros inversores que son riesgos que deben tenerse en cuenta a medida que sus sistemas ganan capacidades. Y resulta especialmente llamativo que una compañía que quiere convencer al mercado del potencial de la IA tenga que advertir a sus inversores de que sus propios modelos podrían llegar a causar daños extremos.

Aquí aparece una de las grandes contradicciones de esta nueva etapa de la IA. Las compañías conocen cada vez mejor los riesgos de sus modelos, pero al mismo tiempo necesitan seguir desarrollándolos para no quedarse atrás frente a sus competidores. Hablar de seguridad ya no significa necesariamente frenar la carrera.

OpenAI ya se ha encontrado con un problema real

En OpenAI la preocupación ha dejado de ser únicamente teórica. La compañía tuvo que detener temporalmente el entrenamiento de algunos de sus modelos más avanzados después de un incidente durante las pruebas de uno de sus agentes de inteligencia artificial.

El sistema consiguió aprovechar una vía no prevista para salir de su entorno aislado y acceder a internet. Un entorno aislado está precisamente diseñado para evitar este tipo de situaciones, manteniendo al modelo dentro de unos límites mientras se comprueba cómo se comporta. El incidente demuestra una de las dificultades que aparecen cuando los modelos empiezan a tener capacidad para utilizar herramientas y actuar de forma autónoma.

El problema no es que los usuarios de ChatGPT estén ante una IA capaz de escapar de sus controles, sino que incluso durante las pruebas pueden aparecer comportamientos que los desarrolladores no habían previsto. En este caso, el agente de OpenAI llegó a escapar de su entorno de pruebas y el sistema de emergencia tuvo que intervenir.

NVIDIA quiere poner una barrera

NVIDIA representa otra pieza de este cambio. La compañía no propone detener el desarrollo de la inteligencia artificial, sino construir mecanismos que permitan seguir aumentando las capacidades de los agentes sin dejar completamente en sus manos el control de sus propias acciones.

Jensen Huang, CEO de Nvidia, en el foro de Davos
Jensen Huang, CEO de Nvidia, en el Foro de Davos

Su nueva plataforma de seguridad combina OpenShell, que establece qué recursos y acciones puede utilizar un agente, con Sentry, un sistema de supervisión que funciona desde una capa separada. La propuesta busca crear una barrera externa capaz de vigilar al agente e intervenir cuando su comportamiento se salga de los límites establecidos.

Es una estrategia que resume bastante bien hacia dónde parece dirigirse la industria: si los agentes van a ser cada vez más autónomos, también habrá que construir sistemas capaces de vigilarlos. Por eso NVIDIA ya prepara un sistema para controlar a los agentes de IA y evitar que puedan actuar sin límites.

La IA no ha dejado de acelerar

Todas estas noticias tienen algo en común. Ninguna demuestra que las grandes compañías hayan decidido abandonar la carrera por conseguir modelos más potentes. Al contrario, siguen invirtiendo miles de millones y desarrollando sistemas cada vez más capaces.

Lo que sí está cambiando es la forma en la que hablan de los riesgos. Anthropic los incluye en sus documentos para inversores, OpenAI se ha encontrado con un problema real durante las pruebas de sus agentes, NVIDIA está creando mecanismos externos para limitar sus acciones y los investigadores ya estudian qué ocurriría si la IA empieza a acelerar su propio desarrollo.

Es una situación que resume bastante bien el momento actual: las grandes compañías de IA quieren controlar los riesgos de su tecnología, pero ninguna parece dispuesta a soltar el acelerador. La inteligencia artificial, por tanto, no ha dejado de pisar el acelerador. Pero sus propios creadores están empezando a reconocer públicamente que, cuanto más rápido avance, más importantes serán los frenos.