Alibaba lanza Qwen 3.8 Max: la IA china que ya pelea de tú a tú con Claude y GPT

Tabla de contenidos

Hasta hace unos meses, cuando alguien hablaba de los modelos IA de referencia, la lista era corta: ChatGPT, Claude, Gemini. Los tres, estadounidenses.

Ese mapa se está reescribiendo a toda velocidad. El pasado 2 de agosto de 2026, Alibaba presentó Qwen 3.8 Max, un modelo de 2,4 billones de parámetros que asegura estar por encima de Claude Opus 4.8 y GPT-5.6 Sol en varias pruebas clave. Y, para más impacto, ha anunciado que va a liberar los pesos.

Te cuento qué es exactamente Qwen 3.8 Max, qué trae de nuevo, cómo se compara realmente con los mejores modelos occidentales, cómo puedes probarlo tú mismo y por qué este lanzamiento cambia el panorama de la IA.

 

Qué es Qwen 3.8 Max

Qwen 3.8 Max es el modelo insignia de Alibaba, presentado oficialmente el 3 de agosto de 2026 en el Alibaba Cloud Summit. Es la última versión de la familia Qwen, la línea de modelos de inteligencia artificial de la gigante china.

Está construido sobre una arquitectura Mixture-of-Experts (MoE), la misma tendencia técnica que están adoptando prácticamente todos los grandes modelos de 2026. En cristiano: en lugar de un modelo único gigante que se activa entero para cada consulta, hay múltiples «expertos» internos y solo se activa el que necesita cada tarea concreta.

Cifras oficiales: 2,4 billones de parámetros totales, de los que solo 95.000 millones se activan por cada consulta. Contexto de 1 millón de tokens. Multimodal (texto, imagen y vídeo). Y una novedad importante para Alibaba: pesos abiertos por primera vez en su línea Max.

 

Qué trae de nuevo esta versión

Vamos a lo importante. Estas son las novedades que hacen a Qwen 3.8 Max relevante frente a versiones anteriores y frente a la competencia occidental.

Arquitectura MoE de 2,4 billones de parámetros

Esta es probablemente la cifra que más titulares se ha llevado. 2,4 billones de parámetros lo colocan entre los modelos más grandes que existen a día de hoy en el mercado abierto.

Pero el dato más interesante es la eficiencia: aunque el modelo total es enorme, solo activa 95.000 millones por consulta. Eso permite tiempos de respuesta razonables y costes de inferencia mucho más bajos que si activara toda la red cada vez.

1 millón de tokens de contexto

La ventana de contexto de 1 millón de tokens le permite procesar libros enteros, bases de código completas o conversaciones muy largas sin perder el hilo.

Es el mismo rango que Claude Sonnet 4.6 y Gemini, y significativamente más que ChatGPT en muchos de sus modelos. Ideal para tareas que requieren mucha información contextual.

Multimodal de verdad: texto, imagen y vídeo

No solo procesa texto. Puede analizar imágenes, entender vídeos y trabajar con contenido mixto sin necesidad de modelos especializados por separado. Según los benchmarks que ha publicado Alibaba, lidera 36 pruebas de visión y multimodalidad frente a Claude Fable 5 y GPT-5.6 Sol.

Pesos abiertos por primera vez en Qwen Max

Este es probablemente el movimiento más estratégico de todo el lanzamiento. Alibaba ha anunciado que va a publicar los pesos del modelo en Hugging Face y ModelScope, algo que nunca había hecho con la línea Max.

Traducido: cualquier empresa o desarrollador puede descargar el modelo, adaptarlo a sus necesidades y ejecutarlo en su propia infraestructura. Es un movimiento agresivo contra el modelo cerrado de OpenAI y Anthropic.

Compatible con los protocolos de OpenAI y Anthropic

Un detalle que ha pasado más desapercibido pero es importantísimo: Qwen 3.8 Max habla los mismos protocolos que usan los modelos de OpenAI y Anthropic. Eso significa que se puede conectar directamente a herramientas como Claude Code o Codex sin cambios en el código.

Para los desarrolladores es una barrera de entrada eliminada. Puedes probar el modelo en tus flujos existentes sin rehacer nada.

 

Los benchmarks: cómo se compara con Claude y GPT

Aquí llega la parte que hay que leer con cuidado. Las cifras que voy a darte son las que ha publicado Alibaba en su lanzamiento. Son autorreportadas y todavía están pendientes de verificación independiente exhaustiva.

En Terminal Bench 2.1 (un benchmark que simula tareas reales de desarrollador), Qwen 3.8 Max obtiene 86,6 puntos, por encima de los 84,6 de Claude Opus 4.8 y Claude Fable 5. Le sigue por delante GPT-5.6 Sol con 88,8.

En PaperBench (capacidad de replicar experimentos científicos), obtiene 93 puntos, el más alto de toda la comparación. En MathVision alcanza 95,2, en LogicVista 91,9 y en OSWorld-Verified 86,1.

Alibaba asegura además que su modelo lidera en 7 pruebas de programación y en 36 pruebas de visión y multimodalidad frente a Claude Fable 5 y GPT-5.6 Sol.

Es un resultado impresionante sobre el papel. Pero, y aquí viene el pero importante, en el lanzamiento del anterior Qwen 3.6 Max, análisis independientes posteriores mostraron que muchas de las claims oficiales se venían abajo en pruebas reales. Merece la pena esperar a los tests externos antes de asumir que la tabla oficial es la verdad absoluta.

 

Casos reales: lo que ha hecho el modelo por su cuenta

Más allá de los números, Alibaba ha querido demostrar la autonomía del modelo con dos experimentos concretos.

El primero: le encargaron desarrollar un proyecto de terminal llamado Oh My CLI. Durante 16 días, Qwen 3.8 Max generó 265 commits, 127 pull requests y resolvió 151 issues sin intervención humana. Trabajo completo de programación autónoma durante más de dos semanas.

El segundo: le pidieron replicar y mejorar un estudio académico sobre selección de datos para entrenar IA. El modelo trabajó cinco días de forma autónoma, escribió 7.600 líneas de código, ejecutó 33 rondas de entrenamiento en GPU y superó los resultados originales del paper por 2,7 puntos en el exigente examen de matemáticas AIME24.

Y en un desafío multimodal, según Alibaba, superó a 458 de 526 equipos humanos.

Son cifras potentes, aunque con la misma precaución: son datos oficiales, sin verificación independiente todavía.

 

Cómo probar Qwen 3.8 Max

Si te apetece testearlo tú mismo, tienes varias opciones ya disponibles.

La forma más rápida es entrar en Qwen Chat (chat.qwen.ai), la interfaz web propia de Alibaba, y probarlo directamente sin registro complicado.

Para uso profesional, está disponible vía API en Alibaba Cloud Model Studio y en la plataforma QwenWork. Los precios anunciados son competitivos: en torno a 2,50 dólares por millón de tokens de entrada y 7,50 por millón de salida, sensiblemente por debajo de Claude Opus y GPT-5 en sus tiers premium.

Y para quien quiera meterse a fondo, los pesos del modelo se están publicando estos días en Hugging Face y ModelScope. Incluye una versión «manejable» (Qwen 3.8-27B) que puede correr en hardware más estándar sin necesidad de servidores enormes.

 

Qué significa este lanzamiento para el ecosistema IA

Más allá del modelo en sí, hay tres consecuencias importantes que conviene subrayar.

La primera: la brecha entre los modelos chinos y los occidentales se ha cerrado prácticamente. Ya no hablamos de que China corre por detrás. Hablamos de una competencia real y muy pareja entre Anthropic, OpenAI, Google, Alibaba, DeepSeek y Moonshot.

La segunda: la estrategia de pesos abiertos de Alibaba (y también de DeepSeek) presiona a los modelos cerrados de OpenAI y Anthropic. Si tienes un modelo casi al nivel del mejor cerrado y puedes descargarlo gratis, la ecuación del mercado cambia mucho.

Y la tercera: las restricciones de exportación de chips de Estados Unidos hacia China no están frenando el desarrollo chino como Washington esperaba. Alibaba ha lanzado seis modelos en cinco meses en 2026, una cadencia más rápida que Anthropic o OpenAI.

 

Ventajas y limitaciones a día de hoy

Vamos a ordenar lo bueno y lo no tan bueno, para que te quedes con una foto realista.

Lo bueno: rendimiento muy competitivo con los mejores modelos occidentales, contexto de 1 millón de tokens, verdaderamente multimodal, precios más bajos que la competencia premium, pesos abiertos con posibilidad de personalización, y compatibilidad con los protocolos de OpenAI y Anthropic.

Lo no tan bueno: los benchmarks son autorreportados y necesitan verificación independiente (algo que suele mostrar cifras algo peores que las oficiales), el modelo tiene menos historial y estabilidad de servicio que sus competidores occidentales, la interfaz en español y el soporte al usuario final no son tan pulidos como los de ChatGPT o Claude, y hay dudas legítimas sobre privacidad de datos si operas desde infraestructura china con datos sensibles europeos.

Para un uso puntual o técnico, es una alternativa a considerar en serio. Para infraestructura crítica con datos sensibles, mantén la cautela hasta ver más rodaje.

 

Preguntas sobre Qwen 3.8 Max

¿Qwen 3.8 Max es mejor que Claude y ChatGPT?

En algunos benchmarks concretos según cifras oficiales de Alibaba, sí. En otros, va segundo por detrás de GPT-5.6 Sol o Claude Fable 5. En términos prácticos, es un modelo que juega en la misma liga que los mejores occidentales, pero decir «es mejor» a día de hoy es prematuro. Hace falta ver más pruebas independientes antes de sacar conclusiones definitivas.

¿Se puede usar Qwen 3.8 Max gratis?

Sí, con limitaciones. Puedes probarlo gratis en la interfaz web de Qwen Chat. Para uso vía API o volúmenes altos, se cobra por tokens procesados a precios competitivos. Y como los pesos son abiertos, un desarrollador puede descargarlo y ejecutarlo en su propia infraestructura sin pagar a Alibaba (aunque asume el coste de la infraestructura).

¿Es seguro usar Qwen 3.8 Max con datos sensibles?

Con precauciones. Si operas desde España o la UE con datos personales, la infraestructura china puede generar dudas de cumplimiento con el RGPD. Para tareas no sensibles funciona sin problema. Para datos críticos, una opción es descargar los pesos abiertos y ejecutar el modelo en tu propia infraestructura europea, algo que solo es viable si tienes capacidad técnica.

¿Puedo conectar Qwen 3.8 Max a mis herramientas de trabajo actuales?

Sí, y ese es uno de sus grandes ganchos. El modelo es compatible con los protocolos de OpenAI y Anthropic, así que se puede integrar en herramientas como Claude Code, Codex y muchos flujos ya existentes sin apenas cambios en el código.

¿Qué implica que Alibaba libere los pesos del modelo?

Implica que cualquier empresa o desarrollador puede descargarlo, adaptarlo y ejecutarlo en su propia infraestructura, sin depender de la nube de Alibaba. Es un movimiento estratégico que presiona el modelo cerrado de OpenAI y Anthropic y que acelera la democratización de la IA de vanguardia. Es también el mayor movimiento pro-open source dentro de la línea Qwen hasta la fecha.

 

¿Ya has probado Qwen 3.8 Max o sigues con Claude y ChatGPT como tus herramientas principales? ¿Crees que los modelos chinos van a acabar liderando el mercado o que las alternativas occidentales aguantarán?

Cuéntame qué opinas en los comentarios y abrimos debate.

Mentor de negocios y speaker. +600 emprendedores formados en marca personal y estrategia digital. Especializado en SEO, GEO e IA aplicada a negocios online

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Responsable: Jonathan Vélez Finalidad: Gestión de los comentarios de las publicaciones Legitimación: Consentimiento del interesado Destinatarios: Los datos no se cederán a terceros salvo en los casos en que exista una obligación legal. Los boletines electrónicos o newsletter están gestionados por entidades cuya sede y servidores se encuentran dentro del territorio de la UE Derechos: Acceder, rectificar y suprimir los datos, así como otros derechos, como se explica en la información adicional.