Esta ha sido la semana de Europa. ¡Y ya tocaba! Después de meses con los ojos puestos en Estados Unidos y China, las empresas europeas han vuelto a reclamar protagonismo. Todavía no podemos hablar de un liderazgo general, pero sí de modelos capaces de competir y destacar en ámbitos importantes. Esperemos que sea el inicio de un despertar y no una flor de verano. Europa necesita modelos propios y, como muestra la experiencia china, publicar sus pesos puede ser una buena manera de extender su uso y construir un ecosistema a su alrededor.

La estrella de la semana ha sido Mistral Large 4, bautizado como Le Chonk. Es un modelo de un billón de parámetros —un millón de millones— que solo activa unos 52.000 millones en cada paso de procesamiento. Esta arquitectura permite aprovechar un modelo enorme sin tener que movilizarlo entero para cada respuesta. Mistral lo ha entrenado desde cero con 3.800 GPU NVIDIA Grace Blackwell, en centros de datos propios en Europa. Una infraestructura considerable, pero alejada de los grandes despliegues de los gigantes americanos. 

Según las evaluaciones publicadas por Mistral, Large 4 se sitúa a la cabeza de los modelos de pesos abiertos desarrollados en Occidente y compite con los grandes modelos chinos, a los que supera en algunas pruebas. Destacan especialmente los resultados en ciberseguridad, finanzas y derecho: tres ámbitos donde Europa tiene mucho en juego. De momento, está disponible en versión preliminar; la publicación de los pesos está prevista para finales de octubre. Pero Mistral no ha sido la única protagonista. ElevenLabs ha reforzado su apuesta por la voz con Eleven v4 Turbo, que combina expresividad, rapidez y un coste inferior.

La compañía anuncia una latencia mediana de inferencia de unos 100 milisegundos, especialmente interesante para los asistentes que tienen que conversar en tiempo real. Porque una voz convincente sirve de poco si, después de cada pregunta, tenemos que esperar a que llegue la respuesta. Turbo encabeza el ranking de Artificial Analysis que compara los modelos con las voces seleccionadas por cada proveedor, aunque las posiciones cambian según la prueba. ElevenLabs sigue siendo una referencia en generación de voz, y este avance refuerza una tendencia: la voz puede ganar peso como interfaz cotidiana de la IA. Hablar con un asistente debería resultar tan fácil como hablar con alguien.  En Alemania, Aleph Alpha ha presentado Kolibri, un modelo de pesos abiertos con licencia Apache 2.0, que permite el uso comercial, la adaptación y la distribución de productos derivados. Su propuesta encaja con las necesidades de gobiernos y empresas que quieren controlar los datos y desplegar la IA en infraestructura propia. 

Kolibri tiene 78.100 millones de parámetros, pero solo activa 3.460 millones por token. Se centra en el alemán y el inglés y ofrece resultados competitivos frente a modelos como Qwen 3.5 y Nemotron 3 (todavía no de Qwen 3.8), con ventajas y desventajas según la tarea. Admite hasta un millón de tokens de contexto, aunque Aleph Alpha recomienda trabajar con 256.000 por eficiencia y para tareas complejas.  También destaca una novedad europea reciente: FLUX 3 Action, de Black Forest Labs, presentada el 23 de septiembre. Es un modelo de pesos abiertos de 7.000 millones de parámetros orientado al control de robots, que, según la compañía, encabeza el benchmark RoboLab. Un paso para reforzar las capacidades europeas en otra frontera decisiva: la IA que actúa sobre el mundo físico. 

Mientras tanto, el resto del sector tampoco se ha detenido. OpenAI ha publicado cientos de manuscritos matemáticos producidos por un modelo interno todavía no disponible, con resultados que tienen diferentes grados de verificación. Ha hecho ChatGPT más visual e interactivo y ha abierto su API Decisions, orientada a clasificar, puntuar y elegir entre opciones, en el terreno donde también compite Jev. Además, según Reuters, su ritmo anualizado de ingresos se acerca a los 70.000 millones de dólares.  Anthropic, por su parte, ha lanzado Haiku 5.5, un modelo pequeño, rápido y más barato, pensado para hacer asequibles muchas de las tareas de los agentes.  La IA no descansa ni una semana. Y Europa, esta vez, tiene novedades que contar. Ahora le toca convertir estos modelos en adopción, empresas y capacidad industrial. Porque volver a la carrera es una buena noticia; quedarse es el verdadero reto.

Las noticias clave

Mistral Large 4: Europa planta cara con una IA de pesos abiertos
Europa también quiere jugar en la primera división de la IA. La francesa Mistral ha presentado una versión preliminar de Mistral Large 4, bautizado con el nombre de "Le Chonk", su modelo más potente hasta ahora. Entrenado desde cero con 3.800 GPU NVIDIA en centros de datos propios en Europa, entiende texto e imágenes y puede ejecutar tareas con herramientas digitales. Según las evaluaciones publicadas por Mistral, compite con los grandes modelos abiertos chinos y destaca especialmente en ciberseguridad, finanzas y derecho. Puede analizar documentos, interpretar planos técnicos o ayudar a detectar vulnerabilidades informáticas.

Pero la gran apuesta es el control: Mistral anuncia que publicará los pesos del modelo a finales de octubre, lo que permitirá a las organizaciones desplegarlo en infraestructura propia. Para un banco, una administración o una empresa industrial, esto significa poder trabajar con datos críticos sin tener que enviarlos al servicio de un proveedor externo y decidir cómo utiliza la IA. Todavía es una versión preliminar y las comparaciones deberán contrastarse con el uso real, pero el mensaje es claro: Europa quiere desarrollar una IA competitiva que sus empresas e instituciones puedan tener en sus manos.

Eleven v4 Turbo: voz de IA de primera a mitad de precio
Una voz artificial más rápida y barata también puede gustar más. Eleven v4 Turbo, de ElevenLabs, se ha situado a la cabeza del ranking de Artificial Analysis que compara modelos con las voces escogidas por cada proveedor, ligeramente por delante de su hermano mayor, Eleven v4. La diferencia de puntuación es pequeña, pero la de precio es clara: la tarifa de referencia es de 40 dólares por millón de caracteres, la mitad que Eleven v4. Turbo también genera la voz más rápidamente, una combinación especialmente atractiva para asistentes y servicios de atención al cliente. 

El liderazgo depende de qué se mida: cuando se controla la voz utilizada en la comparación, Turbo ocupa la segunda posición, detrás del modelo de Qwen de Alibaba. Pero el resultado apunta a una tendencia importante: hablar con una IA con una voz expresiva y sin pausas largas resulta cada vez más asequible. Esto puede facilitar asistentes que nos expliquen una factura, nos ayuden a aprender o den voz a personajes interactivos. En una conversación, cada segundo de espera se nota; cuando el coste también baja, llevar estas experiencias a millones de usuarios se hace más viable.

Un ChatGPT visual e interactivo
Imagina que pides a ChatGPT que te ayude a preparar una cena y, en lugar de una lista, te muestra un contador de invitados: añades dos personas y las cantidades de comida se ajustan automáticamente. Esta es la novedad de OpenAI con GPT-6 y su "Intelligent UI": respuestas que combinan texto, gráficos y herramientas interactivas dentro de la conversación. Puedes explorar una idea cambiando los datos de un diagrama, calcular cuánto tienes que ahorrar o repartir la cuenta de un restaurante. ChatGPT elige el formato según la pregunta, y esta capacidad también llega a los usuarios gratuitos con el modelo GPT-6 Luna. 

El cambio va más allá de hacer las respuestas más bonitas: convierte la conversación en un lugar donde hacer cosas. Ya no hace falta acertar una pregunta perfecta; puedes tocar, ajustar y ver qué pasa. Esto facilita el uso de la IA y plantea un reto a las aplicaciones que resuelven una única tarea: si ChatGPT te crea la calculadora que necesitas al momento, ¿por qué abrir otra app? Aquí está la gran apuesta de OpenAI: convertirse en la puerta de entrada de nuestra vida digital. Y quien controla esta puerta puede acabar influyendo en las opciones que vemos y las decisiones que tomamos.

Anthropic Haiku 5.5 abarata los agentes de IA
La carrera de la IA también se juega en la factura. Anthropic ha presentado Claude Haiku 5.5, un modelo pequeño y rápido que mejora en programación y en el uso del ordenador, con un coste medio un 75% inferior al de su predecesor, según la compañía. En la prueba de uso del ordenador publicada por Anthropic, llega al 72,4% de aciertos, frente al 48,9% de GPT-6 Luna y el 15,7% de Haiku 4.5. También permite ajustar cuándo se esfuerza en razonar: más tiempo para los problemas difíciles y menos gasto para los sencillos.

La idea es repartir el trabajo: Opus o Sonnet, los modelos más potentes, pueden dirigir una tarea compleja mientras Haiku resuelve encargos concretos, como buscar datos o resumir documentos. Anthropic también ha introducido una rebaja que, según sus cálculos, reduce cerca de un 20% el coste de Sonnet 5.5 en muchas tareas con agentes. Esto puede hacer viable automatizar trabajos que hasta ahora salían demasiado caros, especialmente para las pequeñas empresas. Porque una cosa es tener una IA brillante y otra poderla poner a trabajar cada día sin que la factura se dispare.

Grok Bot también usará Claude, Midjourney y Suno
Elon Musk ha anunciado un giro en su agente de IA: Grok Bot también utilizará modelos de la competencia. Entre los elegidos se encuentran Claude Opus 5.5, de Anthropic, Midjourney y Suno, especializados en texto y razonamiento, imágenes y música. La consigna es recurrir al modelo que pueda dar el mejor resultado en cada tarea, aunque sea de un rival. Musk aún no ha concretado cómo se repartirá el trabajo. El movimiento apunta a un cambio en la competición entre empresas de IA. Grok Bot, que trabaja con ordenadores propios en la nube y puede ejecutar varias tareas en paralelo, aspira a coordinar herramientas de diferentes proveedores. Si esta fórmula se impone, tener el mejor modelo dejará de ser la única manera de ganar: también contará saber combinarlos y convertirlos en un servicio útil. Para el usuario, el nombre del modelo puede acabar siendo secundario. Lo que querrá es que el agente le resuelva el trabajo.

OpenAI publica cientos de resultados de IA sobre problemas matemáticos abiertos
La IA empieza a adentrarse en las matemáticas que todavía no tienen respuesta. OpenAI ha publicado cientos de manuscritos, agrupados en 372 familias de resultados, elaborados por un modelo interno que todavía no está disponible. El sistema afrontó unos 4.000 problemas de investigación, con un consumo medio de cálculo equivalente a unas tres horas de razonamiento de ChatGPT Pro por resultado. Los trabajos incluyen avances sobre el número π, la función zeta de Riemann y un caso particular de la conjetura de Hodge, uno de los grandes retos de las matemáticas. Ahora toca comprobar qué aportan estos trabajos. Una parte dispone de demostraciones formalizadas en Lean, un lenguaje que permite verificar la lógica con un ordenador, pero otros todavía pueden contener errores, como reconoce OpenAI. La compañía ha consultado a un grupo asesor independiente de matemáticos para orientar la publicación y facilitar el examen. El salto es sugerente: la IA puede ayudarnos a ampliar el conocimiento, más allá de explicar lo que ya sabemos. El reto será convertir este alud de resultados en matemáticas verificadas, entendidas y útiles para seguir investigando.

Kolibri: una IA europea de pesos abiertos para ejecutar en infraestructura propia
Pájaro pequeño, grandes ambiciones. La alemana Aleph Alpha ha presentado Kolibri, un modelo de IA con 78.000 millones de parámetros que solo activa unos 3.460 millones en cada paso de procesamiento. Esta arquitectura busca reducir el cálculo necesario seleccionando las partes del modelo que intervienen en cada respuesta. Admite hasta un millón de tokens de contexto: una gran cantidad de texto que le permite trabajar con documentos extensos dentro de una misma consulta. La apuesta es dar control a quien lo utiliza. Aleph Alpha ha publicado los pesos de Kolibri bajo Apache 2.0, una licencia permisiva que permite utilizarlo, modificarlo e integrarlo en productos comerciales. Las organizaciones pueden desplegarlo en infraestructura propia y trabajar con sus datos sin enviarlos a un servicio externo. Esto no significa que quepa en cualquier ordenador: también se necesita memoria para alojar el conjunto del modelo. Pero refuerza una vía europea con interés para empresas y administraciones: disponer de una IA que puedan adaptar y operar bajo su control.

¿Cómo la IA nos cambiará la vida?

El gasto de OpenAI en agentes de programación se duplica cada mes

Los coches chinos aparcan de lado

La investigación en IA 

Recursive self-improvement of AI research agents-AI Lab: Weco AI

Un agente de IA que reescribe su propio código para investigar mejor: esto es lo que han probado los creadores de AIDE2. El sistema propone modificaciones, las pone a prueba y conserva las que funcionan mejor; la versión mejorada se convierte en el punto de partida de la siguiente ronda. En ocho días de trabajo autónomo, encadenó siete mejoras, entre ellas nuevas estrategias de búsqueda y mecanismos para gestionar la memoria. Según el estudio, los avances también se trasladaron a cuatro pruebas que no habían servido para seleccionar las mejoras, incluida la predicción meteorológica basada en física. En las cuatro, la mejor versión igualó o superó a un agente de investigación avanzado diseñado por humanos.

Por qué es importante
Porque apunta a una IA capaz de mejorar las herramientas con las que investiga, un trabajo que hasta ahora dependía de sus desarrolladores. Si este proceso pudiera sostenerse, podría ayudar a contrarrestar los rendimientos decrecientes de la I+D: tener que gastar cada vez más para conseguir nuevos avances. Además, el agente redujo del 55% al 32% la frecuencia con la que explotaba atajos para obtener una buena puntuación sin cumplir realmente el objetivo, aunque no se le había optimizado explícitamente para ello. El experimento no demuestra una mejora ilimitada, pero sí una posibilidad potente: que la IA acelere la investigación mejorando su propia manera de investigar.

Real Companion: Benchmarking Human Understanding from  Reasoning over Longitudinal Real-World Conversations-AI Lab: Quis Lab
Una IA que habla con nosotros durante meses debería recordar qué le hemos explicado y saber cuándo es relevante recuperarlo. Para ponerlo a prueba, los autores de RealCompanion han reunido diez relaciones reales entre personas y un asistente de IA: más de 27.000 mensajes a lo largo de hasta 120 días. El resultado revela una dificultad inesperada: solo el 3,4% de los mensajes necesita información anterior, pero, cuando la necesita, a menudo queda muy lejos —una mediana de 2.157 mensajes atrás—. Los sistemas analizados tienen problemas para detectar estos momentos y tienden a atribuir al usuario las características que no ha revelado.

Por qué es importante
Un asistente personal útil debe recuperar el detalle adecuado cuando toca y evitar sacar conclusiones sin fundamento. El estudio muestra hasta qué punto esto es delicado: solo con etiquetar la información anterior como "memorias", los modelos la mencionan más a menudo, incluso cuando no es necesario. Para los asistentes que nos acompañarán cada día, la calidad dependerá tanto de la memoria como del criterio para utilizarla. Conocernos mejor también significa saber dónde acaba lo que hemos explicado y dónde empieza lo que la máquina se imagina.

AIM: Agentic Idea Management for Automated Research-AI Lab: Google Cloud AI Researdh, University of Wisconsin-Madison
AIM automatiza una parte esencial de la investigación: decidir qué ideas vale la pena explorar. Organiza las propuestas, selecciona las más prometedoras, comprueba que los experimentos realmente las pongan a prueba y distribuye el presupuesto disponible. En diez tareas de investigación computacional, supera el mejor sistema de comparación y alcanza su mejor resultado hasta 3,1 veces más rápido.

Por qué es importante
La IA empieza a asumir funciones de dirección de la investigación: escoger caminos, asignar recursos y abandonar intentos poco prometedores. La posible consecuencia es acelerar la innovación, aunque los resultados todavía se limitan a tareas computacionales.