Aquesta ha estat la setmana d’Europa. I ja tocava! Després de mesos amb els ulls posats als Estats Units i la Xina, les empreses europees han tornat a reclamar protagonisme. Encara no podem parlar d’un lideratge general, però sí de models capaços de competir i destacar en àmbits importants. Esperem que sigui l’inici d’un despertar-se i no una flor d’estiu. Europa necessita models propis i, com mostra l’experiència xinesa, publicar-ne els pesos pot ser una bona manera d’estendre’n l’ús i construir un ecosistema al seu voltant.
L’estrella de la setmana ha estat Mistral Large 4, batejat com a Le Chonk. És un model d’un bilió de paràmetres —un milió de milions— que només n’activa uns 52.000 milions en cada pas de processament. Aquesta arquitectura permet aprofitar un model enorme sense haver de mobilitzar-lo sencer per a cada resposta. Mistral l’ha entrenat des de zero amb 3.800 GPU NVIDIA Grace Blackwell, en centres de dades propis a Europa. Una infraestructura considerable, però allunyada dels grans desplegaments dels gegants americans.
Segons les avaluacions publicades per Mistral, Large 4 se situa al capdavant dels models de pesos oberts desenvolupats a Occident i competeix amb els grans models xinesos, als quals supera en algunes proves. Destaquen especialment els resultats en ciberseguretat, finances i dret: tres àmbits on Europa té molt en joc. De moment, està disponible en versió preliminar; la publicació dels pesos està prevista per a finals d’octubre. Però Mistral no ha estat l’única protagonista. ElevenLabs ha reforçat la seva aposta per la veu amb Eleven v4 Turbo, que combina expressivitat, rapidesa i un cost inferior.
La companyia anuncia una latència mediana d’inferència d’uns 100 mil·lisegons, especialment interessant per als assistents que han de conversar en temps real. Perquè una veu convincent serveix de poc si, després de cada pregunta, hem d’esperar que arribi la resposta. Turbo encapçala el rànquing d’Artificial Analysis que compara els models amb les veus seleccionades per cada proveïdor, tot i que les posicions canvien segons la prova. ElevenLabs continua sent una referència en generació de veu, i aquest avenç reforça una tendència: la veu pot guanyar pes com a interfície quotidiana de la IA. Parlar amb un assistent hauria de resultar tan fàcil com parlar amb algú. A Alemanya, Aleph Alpha ha presentat Kolibri, un model de pesos oberts amb llicència Apache 2.0, que permet l’ús comercial, l’adaptació i la distribució de productes derivats. La seva proposta encaixa amb les necessitats de governs i empreses que volen controlar les dades i desplegar la IA en infraestructura pròpia.
Kolibri té 78.100 milions de paràmetres, però només n’activa 3.460 milions per token. Se centra en l’alemany i l’anglès i ofereix resultats competitius davant de models com Qwen 3.5 i Nemotron 3 (encara no de Qwen 3.8), amb avantatges i desavantatges segons la tasca. Admet fins a un milió de tokens de context, tot i que Aleph Alpha recomana treballar amb 256.000 per eficiència i per a tasques complexes. També destaca una novetat europea recent: FLUX 3 Action, de Black Forest Labs, presentada el 23 de setembre. És un model de pesos oberts de 7.000 milions de paràmetres orientat al control de robots, que, segons la companyia, encapçala el benchmark RoboLab. Un pas per reforçar les capacitats europees en una altra frontera decisiva: la IA que actua sobre el món físic.
Mentrestant, la resta del sector tampoc s’ha aturat. OpenAI ha publicat centenars de manuscrits matemàtics produïts per un model intern encara no disponible, amb resultats que tenen diferents graus de verificació. Ha fet ChatGPT més visual i interactiu i ha obert la seva API Decisions, orientada a classificar, puntuar i escollir entre opcions, en el terreny on també competeix Jev. A més, segons Reuters, el seu ritme anualitzat d’ingressos s’acosta als 70.000 milions de dòlars. Anthropic, per la seva banda, ha llançat Haiku 5.5, un model petit, ràpid i més barat, pensat per fer assequibles moltes de les tasques dels agents. La IA no descansa ni una setmana. I Europa, aquesta vegada, té novetats per explicar. Ara li toca convertir aquests models en adopció, empreses i capacitat industrial. Perquè tornar a la cursa és una bona notícia; quedar-s’hi és el veritable repte.
Les notícies clau
Mistral Large 4: Europa planta cara amb una IA de pesos oberts
Europa també vol jugar a la primera divisió de la IA. La francesa Mistral ha presentat una versió preliminar de Mistral Large 4, batejat amb el nom de "Le Chonk", el seu model més potent fins ara. Entrenat des de zero amb 3.800 GPU NVIDIA en centres de dades propis a Europa, entén text i imatges i pot executar tasques amb eines digitals. Segons les avaluacions publicades per Mistral, competeix amb els grans models oberts xinesos i destaca especialment en ciberseguretat, finances i dret. Pot analitzar documents, interpretar plànols tècnics o ajudar a detectar vulnerabilitats informàtiques.
Però la gran aposta és el control: Mistral anuncia que publicarà els pesos del model a finals d’octubre, cosa que permetrà a les organitzacions desplegar-lo en infraestructura pròpia. Per a un banc, una administració o una empresa industrial, això significa poder treballar amb dades crítiques sense haver-les d’enviar al servei d’un proveïdor extern i decidir com utilitza la IA. Encara és una versió preliminar i les comparacions s’hauran de contrastar amb l’ús real, però el missatge és clar: Europa vol desenvolupar una IA competitiva que les seves empreses i institucions puguin tenir a les mans.
Meet Mistral Large 4, aka Le Chonk. • 1T parameters, natively multimodal. 49B active. It is the best open weights model from US or Europe on aggregated benchmarks. • State-of-the-art on critical workloads, including cyber defense, manufacturing and finance and it surpasses closed frontier models on visual grounding. • Forged in Europe end-to-end and is deployable from Europe via our own Mistral Cloud infrastructure. • Available to all via API today. Working with cybersecurity partners privately. Open weights release end of October.
— Mistral AI (@MistralAI) October 6, 2026
Eleven v4 Turbo: veu d’IA de primera a meitat de preu
Una veu artificial més ràpida i barata també pot agradar més. Eleven v4 Turbo, d’ElevenLabs, s’ha situat al capdavant del rànquing d’Artificial Analysis que compara models amb les veus escollides per cada proveïdor, lleugerament per davant del seu germà gran, Eleven v4. La diferència de puntuació és petita, però la de preu és clara: la tarifa de referència és de 40 dòlars per milió de caràcters, la meitat que Eleven v4. Turbo també genera la veu més ràpidament, una combinació especialment atractiva per a assistents i serveis d’atenció al client.
El lideratge depèn de què es mesuri: quan es controla la veu utilitzada en la comparació, Turbo ocupa la segona posició, darrere del model de Qwen d’Alibaba. Però el resultat apunta a una tendència important: parlar amb una IA amb una veu expressiva i sense pauses llargues resulta cada vegada més assequible. Això pot facilitar assistents que ens expliquin una factura, ens ajudin a aprendre o donin veu a personatges interactius. En una conversa, cada segon d’espera es nota; quan el cost també baixa, portar aquestes experiències a milions d’usuaris es fa més viable.
ElevenLabs' Eleven v4 Turbo takes the #1 spot on the Artificial Analysis Provider Voice TTS Arena Leaderboard, ahead of Eleven v4 while costing half the price Eleven v4 Turbo is the faster, lower-cost sibling of Eleven v4 from @ElevenLabs, designed to deliver comparable speech quality with lower latency and cost. Key takeaways: ➤ Provider Voice: Eleven v4 Turbo has an Elo of 1,334 (+19/-19) across 1,645 appearances, placing it ahead of Eleven v4 at 1,321, Alibaba's Qwen-Audio-3.1-TTS-Plus at 1,292 and Cartesia's Sonic 3.6 at 1,278. It ranks #1 in Customer Service and Entertainment and #2 in Assistants and Knowledge Sharing. ➤ Controlled Voice: Eleven v4 Turbo ranks #2 with an Elo of 1,173 (+15/-15) across 1,745 appearances, behind Qwen-Audio-3.1-TTS-Plus at 1,181 and ahead of Eleven v4 at 1,160. It ranks #1 in Arabic, German, Hindi and English (UK). ➤ Pronunciation Robustness: Eleven v4 Turbo scores 90.1%, ranking #2 behind Eleven v4 at 91.7% and ahead of Gemini 3.8 Flash TTS at 89.5%. ➤ Pricing: Eleven v4 Turbo is priced at $40/1M characters, half the price of Eleven v4 at $80/1M characters, compared to Sonic 3.6 at $49/1M characters and Gemini 3.8 Flash TTS at $16.49/1M characters. ➤ Speed: Eleven v4 Turbo processes 96 characters per second of generation time, compared to 84 characters per second for Eleven v4 and 59 for Eleven v3. See more details and listen to samples below 🧵
— Artificial Analysis (@ArtificialAnlys) October 6, 2026
Un ChatGPT visual i interactiu
Imagina que demanes a ChatGPT que t’ajudi a preparar un sopar i, en lloc d’una llista, et mostra un comptador de convidats: hi afegeixes dues persones i les quantitats de menjar s’ajusten automàticament. Aquesta és la novetat d’OpenAI amb GPT-6 i la seva "Intelligent UI": respostes que combinen text, gràfics i eines interactives dins de la conversa. Pots explorar una idea canviant les dades d’un diagrama, calcular quant has d’estalviar o repartir el compte d’un restaurant. ChatGPT tria el format segons la pregunta, i aquesta capacitat també arriba als usuaris gratuïts amb el model GPT-6 Luna.
El canvi va més enllà de fer les respostes més boniques: converteix la conversa en un lloc on fer coses. Ja no cal encertar una pregunta perfecta; pots tocar, ajustar i veure què passa. Això facilita l’ús de la IA i planteja un repte a les aplicacions que resolen una única tasca: si ChatGPT et crea la calculadora que necessites al moment, per què obrir una altra app? Aquí hi ha la gran aposta d’OpenAI: convertir-se en la porta d’entrada de la nostra vida digital. I qui controla aquesta porta pot acabar influint en les opcions que veiem i les decisions que prenem.
GPT-6 and Intelligent UI, now rolling out in ChatGPT for everyone. Intelligent UI in ChatGPT delivers fast, interactive answers that make everyday questions more visual, complex topics easier to grasp, and interactive tools for your task available on the spot. https://t.co/XL2gDCPBwG
— OpenAI (@OpenAI) October 7, 2026
Anthropic Haiku 5.5 abarateix els agents d’IA
La cursa de la IA també es juga en la factura. Anthropic ha presentat Claude Haiku 5.5, un model petit i ràpid que millora en programació i en l’ús de l’ordinador, amb un cost mitjà un 75% inferior al del seu predecessor, segons la companyia. En la prova d’ús de l’ordinador publicada per Anthropic, arriba al 72,4% d’encerts, davant del 48,9% de GPT-6 Luna i el 15,7% de Haiku 4.5. També permet ajustar quan s’esforça a raonar: més temps per als problemes difícils i menys despesa per als senzills.
La idea és repartir la feina: Opus o Sonnet, els models més potents, poden dirigir una tasca complexa mentre Haiku resol encàrrecs concrets, com buscar dades o resumir documents. Anthropic també ha introduït una rebaixa que, segons els seus càlculs, redueix prop d’un 20% el cost de Sonnet 5.5 en moltes tasques amb agents. Això pot fer viable automatitzar feines que fins ara sortien massa cares, especialment per a les petites empreses. Perquè una cosa és tenir una IA brillant i una altra poder-la posar a treballar cada dia sense que la factura es dispari.
Introducing Claude Haiku 5.5: the cheapest, fastest, and most capable small model we’ve ever released. On average, it costs around 75% less to run than Claude Haiku 4.5. https://t.co/jm06cZJfkV
— Claude (@claudeai) October 7, 2026
Grok Bot també farà servir Claude, Midjourney i Suno
Elon Musk ha anunciat un gir en el seu agent d’IA: Grok Bot també utilitzarà models de la competència. Entre els escollits hi ha Claude Opus 5.5, d’Anthropic, Midjourney i Suno, especialitzats en text i raonament, imatges i música. La consigna és recórrer al model que pugui donar el millor resultat en cada tasca, encara que sigui d’un rival. Musk encara no ha concretat com es repartirà la feina. El moviment apunta a un canvi en la competició entre empreses d’IA. Grok Bot, que treballa amb ordinadors propis al núvol i pot executar diverses tasques en paral·lel, aspira a coordinar eines de diferents proveïdors. Si aquesta fórmula s’imposa, tenir el millor model deixarà de ser l’única manera de guanyar: també comptarà saber combinar-los i convertir-los en un servei útil. Per a l’usuari, el nom del model pot acabar sent secundari. El que voldrà és que l’agent li resolgui la feina.
Important note regarding Grok @Bot: Going forward, @SpaceX will use the best back end model for any given task, including Claude Opus 5.5, MidJourney, Suno and other leading APIs. Whatever is most likely to give you the best outcome.
— Elon Musk (@elonmusk) October 7, 2026
OpenAI publica centenars de resultats d’IA sobre problemes matemàtics oberts
La IA comença a endinsar-se en les matemàtiques que encara no tenen resposta. OpenAI ha publicat centenars de manuscrits, agrupats en 372 famílies de resultats, elaborats per un model intern que encara no està disponible. El sistema va afrontar uns 4.000 problemes de recerca, amb un consum mitjà de càlcul equivalent a unes tres hores de raonament de ChatGPT Pro per resultat. Els treballs inclouen avenços sobre el nombre π, la funció zeta de Riemann i un cas particular de la conjectura de Hodge, un dels grans reptes de les matemàtiques. Ara toca comprovar què aporten aquests treballs. Una part disposa de demostracions formalitzades en Lean, un llenguatge que permet verificar-ne la lògica amb un ordinador, però d’altres encara poden contenir errors, com reconeix OpenAI. La companyia ha consultat un grup assessor independent de matemàtics per orientar la publicació i facilitar-ne l’examen. El salt és suggeridor: la IA pot ajudar-nos a ampliar el coneixement, més enllà d’explicar el que ja sabem. El repte serà convertir aquesta allau de resultats en matemàtiques verificades, enteses i útils per continuar investigant.
We’re releasing a broad range of new mathematical results produced by an internal frontier model. We’ve been consulting with the independent Advisory Group on Mathematics and Artificial Intelligence at the Institute for Advanced Study, and we have drawn on their advice and public recommendations to inform how we release these results. https://t.co/7N6TPlft1P
— OpenAI (@OpenAI) October 6, 2026
Kolibri: una IA europea de pesos oberts per executar en infraestructura pròpia
Petit ocell, grans ambicions. L’alemanya Aleph Alpha ha presentat Kolibri, un model d’IA amb 78.000 milions de paràmetres que només n’activa uns 3.460 milions en cada pas de processament. Aquesta arquitectura busca reduir el càlcul necessari seleccionant les parts del model que intervenen en cada resposta. Admet fins a un milió de tokens de context: una gran quantitat de text que li permet treballar amb documents extensos dins d’una mateixa consulta. L’aposta és donar control a qui l’utilitza. Aleph Alpha ha publicat els pesos de Kolibri sota Apache 2.0, una llicència permissiva que permet utilitzar-lo, modificar-lo i integrar-lo en productes comercials. Les organitzacions poden desplegar-lo en infraestructura pròpia i treballar amb les seves dades sense enviar-les a un servei extern. Això no significa que càpiga en qualsevol ordinador: també cal memòria per allotjar el conjunt del model. Però reforça una via europea amb interès per a empreses i administracions: disposar d’una IA que puguin adaptar i operar sota el seu control.
Small bird, fast wings, Kolibri is here. 78B parameters. 3.46B active. Up to 1M tokens of context. Built in Europe. Now the weights are yours. Run it on your own hardware, under Apache 2.0. https://t.co/5263xZ9xZN
— Aleph Alpha (@Aleph__Alpha) October 3, 2026
Com la IA ens canviarà la vida
La despesa d’OpenAI en agents de programació es duplica cada mes
OpenAI recently published data on its researchers’ coding-agent usage. We took their weekly figures from January to mid-August 2026 and fitted trends to summarize how quickly spending grew. We found that spending has been doubling about once a month. https://t.co/TpqyvhWqv9
— Epoch AI (@EpochAIResearch) October 5, 2026
Els cotxes xinesos aparquen de costat
La recerca en IA
Recursive self-improvement of AI research agents-AI Lab: Weco AI
Un agent d’IA que reescriu el seu propi codi per investigar millor: això és el que han provat els creadors d’AIDE2. El sistema proposa modificacions, les posa a prova i conserva les que funcionen millor; la versió millorada es converteix en el punt de partida de la ronda següent. En vuit dies de treball autònom, va encadenar set millores, entre les quals noves estratègies de cerca i mecanismes per gestionar la memòria. Segons l’estudi, els avenços també es van traslladar a quatre proves que no havien servit per seleccionar les millores, inclosa la predicció meteorològica basada en física. En totes quatre, la millor versió va igualar o superar un agent de recerca avançat dissenyat per humans.
Per què és important
Perquè apunta a una IA capaç de millorar les eines amb què fa recerca, una feina que fins ara depenia dels seus desenvolupadors. Si aquest procés es pogués sostenir, podria ajudar a contrarestar els rendiments decreixents de l'R+D: haver de gastar cada vegada més per aconseguir nous avenços. A més, l’agent va reduir del 55% al 32% la freqüència amb què explotava dreceres per obtenir una bona puntuació sense complir realment l’objectiu, tot i que no se l’havia optimitzat explícitament per això. L’experiment no demostra una millora il·limitada, però sí una possibilitat potent: que la IA acceleri la recerca millorant la seva pròpia manera d’investigar.
Real Companion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations-AI Lab: Quis Lab
Una IA que parla amb nosaltres durant mesos hauria de recordar què li hem explicat i saber quan és rellevant recuperar-ho. Per posar-ho a prova, els autors de RealCompanion han reunit deu relacions reals entre persones i un assistent d’IA: més de 27.000 missatges al llarg de fins a 120 dies. El resultat revela una dificultat inesperada: només el 3,4% dels missatges necessita informació anterior, però, quan la necessita, sovint queda molt lluny —una mediana de 2.157 missatges enrere—. Els sistemes analitzats tenen problemes per detectar aquests moments i tendeixen a atribuir a l’usuari les característiques que no ha revelat.
Per què és important
Un assistent personal útil ha de recuperar el detall adequat quan toca i evitar treure conclusions sense fonament. L’estudi mostra fins a quin punt això és delicat: només d’etiquetar la informació anterior com a "memòries", els models la mencionen més sovint, fins i tot quan no cal. Per als assistents que ens acompanyaran cada dia, la qualitat dependrà tant de la memòria com del criteri per utilitzar-la. Conèixer-nos millor també vol dir saber on acaba el que hem explicat i on comença el que la màquina s’imagina.
AIM: Agentic Idea Management for Automated Research-AI Lab: Google Cloud AI Researdh, University of Wisconsin-Madison
AIM automatitza una part essencial de la recerca: decidir quines idees val la pena explorar. Organitza les propostes, selecciona les més prometedores, comprova que els experiments realment les posin a prova i distribueix el pressupost disponible. En deu tasques de recerca computacional, supera el millor sistema de comparació i arriba al seu millor resultat fins a 3,1 vegades més ràpid.
Per què és important
La IA comença a assumir funcions de direcció de la recerca: escollir camins, assignar recursos i abandonar intents poc prometedors. La possible conseqüència és accelerar la innovació, tot i que els resultats encara es limiten a tasques computacionals.
