Esperábamos los nuevos modelos chinos, pero todavía no han llegado. Esperábamos el Opus 5 como un modelo peor que Fable y hemos tenido uno mejor —al menos en los trabajos más habituales.
Durante la semana, el estruendo causado por Kimi K3, de Moonshot, un modelo chino creado por una empresa fundada hace solo tres años y no por un gigante tecnológico como Alibaba, que se ha situado a la misma altura que Anthropic Fable y OpenAI GPT Sol, ha marcado la semana.
Ha habido anuncios de todo tipo: desde Microsoft afirmando que evaluará el modelo para utilizarlo en Copilot, en sustitución de los modelos de Anthropic y OpenAI, hasta voces que esperan verlo pronto en plataformas como AWS o Azure, que lo comercializarían y capturarían una parte del valor. También ha habido voces —básicamente Anthropic y OpenAI, porque el resto de la industria se ha mostrado contraria— que han pedido al gobierno estadounidense sanciones e incluso su prohibición, especialmente a las agencias federales.
Pero también se han formulado otras. A las puertas de dos grandes salidas a bolsa, las de Anthropic y OpenAI, mucha gente se ha preguntado si estas empresas continúan valiendo un billón de dólares cuando la valoración de Moonshot es de solo 20.000 millones.
Pero todo esto ha quedado resuelto cuando ha aparecido Opus 5, un modelo mejor al mismo precio del modelo anterior. Ahora nos queda esperar la reacción de OpenAI, ¿competirá por el liderazgo en los benchmarks o abrirá nuevos caminos como ChatGPT Health?
Mientras tanto, un nuevo modelo de OpenAI que tenía que conseguir unas respuestas decidió que la mejor manera de hacerlo era robarlas: se escapó, entró en Hugging Face y se las llevó. Todo muy humano. Quizás demasiado. Al mismo tiempo, un estudiante ha resuelto seis problemas más de Erdős que continuaban abiertos y que los matemáticos todavía están verificando.
Otro hecho importante es que Google Cloud ha incrementado los ingresos más de un 80%, pero no tanto gracias a la nube convencional como a la venta de TPU, las GPU de Google. De hecho, Google es la única empresa que dispone de un stack completo capaz de competir con Nvidia, y hace mucho tiempo que se especula que acabará haciéndolo. Quizás sí, pero parece que avanza demasiado lentamente y de una manera demasiado limitada para llegar a hacerle sombra.
En Europa, Black Forest Labs ha lanzado Flux 3, la nueva versión de su modelo de creación de imágenes:
Introducing FLUX 3.
— Black Forest Labs (@bfl_ai) July 23, 2026
One multi-modal model for Image, Video, Audio and Action-Prediction. Creations are truer to life in every kind of style.
FLUX 3 Video is now available in early access (link below).
Jointly trained in one unified architecture, our model can be extended to… pic.twitter.com/voQ5iUJJZY
Y en el Reino Unido ya tienen un nuevo ministro de IA, Kanishka Narayan, que quiere centrarse en la reindustrialización, la ciberseguridad y la promoción de la adopción de la inteligencia artificial:
48 hours since @10DowningStreet appointed me AI Minister, and feeling relentlessly focused on shaping AI with British leadership:
— Kanishka Narayan MP (@KanishkaNarayan) July 22, 2026
**We reindustrialise with AI manufacturing** 🏭
-- First call with @demishassabis on turning British advantage into British jobs
-- Spoke to… https://t.co/9EwMijClHT
Mientras tanto, seguimos esperando las nuevas versiones de los grandes modelos chinos: DeepSeek 4, Alibaba Qwen 3.8... Todos prometen mucho, pero no acaban de llegar. Kimi K3, presentado la semana pasada, ya ha tenido que cerrar el acceso a nuevos usuarios por falta de capacidad: están completamente desbordados.
¡Sin duda, tendremos un verano movido!
Claude Opus 5
Anthropic ha presentado Claude Opus 5, un modelo al nivel de Fable 5, pero a la mitad de coste y, de hecho, lo supera en muchos de los benchmarks más relevantes para el trabajo real. Mantiene el precio de Opus 4.8 —5 dólares por millón de tokens de entrada y 25 de salida— y se convierte en el modelo predeterminado de Claude Max y el más potente disponible en Claude Pro. La apuesta no es simplemente construir otro modelo gigante, sino ofrecer capacidades de frontera con una eficiencia que permita utilizarlas cada día.
Los resultados publicados por Anthropic son especialmente sólidos en programación, trabajo del conocimiento, uso del ordenador y automatización empresarial. Opus 5 más que duplica el rendimiento de Opus 4.8 en Frontier-Bench y supera al resto de modelos. En CursorBench queda a solo un 0,5% del máximo de Fable 5, pero con la mitad de coste. En OSWorld 2.0 supera el mejor resultado de Fable gastando poco más de un tercio, y en ARC-AGI 3 triplica la puntuación del segundo clasificado. También lidera u obtiene los mejores resultados en GDPval-AA, AutomationBench y diversas pruebas de investigación y resolución de problemas.
La mejora también llega a la ciencia. Opus 5 supera a Opus 4.8 en todas las evaluaciones de ciencias de la vida de Anthropic, con avances especialmente destacados en química orgánica, interpretación de espectros y predicción de cómo las mutaciones afectan el funcionamiento de las proteínas. Además, genera resultados visuales y artefactos interactivos mucho más sofisticados.
La diferencia más interesante, sin embargo, es el comportamiento. Opus 5 verifica mejor su trabajo, itera hasta que encuentra una solución y crea las herramientas que le faltan. En una prueba, construyó su propia visión artificial para reconstruir una pieza mecánica en 3D; en otra, identificó la raíz de un error de software que otros modelos solo corregían superficialmente. También creó autónomamente un entorno de pruebas para validar un sistema de datos financieros que los modelos anteriores no habían podido completar.
Anthropic afirma, además, que es su modelo más alineado y menos propenso al engaño o a acciones irreversibles. Puede encontrar vulnerabilidades casi tan bien como Mythos 5, pero continúa muy por detrás a la hora de convertirlas en ataques reales. Opus 5 confirma así un cambio en la competición: Fable todavía representa la frontera absoluta en algunos ámbitos, pero Opus ya lo supera en muchos benchmarks y ofrece casi toda su inteligencia a una fracción del coste. El modelo ganador quizás no será el más potente, sino el que haga rentable utilizar esta potencia masivamente.
