En pocas palabras: Qwen3.8 Max, el modelo propietario de Alibaba lanzado el 3 de agosto de 2026, alcanzó uno de los puntajes más altos del agentic index de Artificial Analysis, a la par de Anthropic y OpenAI. Con 2,4 billones de parámetros, es candidato a mejor modelo para agentes.
Qwen3.8 Max, el modelo insignia de Alibaba lanzado el 3 de agosto de 2026, se metió entre los mejores del agentic index de Artificial Analysis, con uno de los puntajes más altos del benchmark GDPval-AA, a la altura de lo mejor de Anthropic y OpenAI. Sobre el papel, es candidato a mejor modelo IA para agentes. Ahora, tiene una letra chica que conviene leer antes de migrar nada.
Qwen3.8 Max es el modelo de lenguaje propietario de Alibaba, un sistema de razonamiento con 2,4 billones de parámetros totales y 95 mil millones activos por paso, ventana de contexto de 1 millón de tokens y entrada de texto, imagen y video. Salió el 3 de agosto de 2026 y quien lo evalúa de forma independiente es Artificial Analysis, no la propia Alibaba (dato que importa cuando alguien grita “número uno”).
En 30 segundos
- Qué es: modelo propietario de Alibaba, 2,4 billones de parámetros (95 mil millones activos), contexto de 1M de tokens, lanzado el 3 de agosto de 2026.
- Por qué suena: uno de los puntajes más altos en GDPval-AA, el benchmark agentic de Artificial Analysis, codo a codo con lo mejor de Anthropic y OpenAI.
- En el índice general: figura entre los primeros puestos del Intelligence Index, según la ficha oficial de Artificial Analysis.
- Precio: USD 2 por millón de tokens de entrada y USD 6 de salida en la API de Alibaba Cloud.
- La trampa: resuelve las tareas agentic a fuerza bruta, con muchos más turnos y tokens que su antecesor, así que el costo por tarea completada sube fuerte.
¿Qué mide el agentic index y por qué Qwen3.8 Max quedó arriba?
El agentic index de Artificial Analysis mide qué tan bien un modelo completa tareas de varios pasos por su cuenta: usar herramientas, tomar decisiones, corregir el rumbo y llegar a un resultado sin que le lleves la mano. No es “responder una pregunta”, es “hacer un laburo entero”. El puntaje sale del benchmark GDPval-AA, expresado en Elo (como el ajedrez), donde más es mejor.
Ahí Qwen3.8 Max quedó en el pelotón de punta: codo a codo con lo mejor de Anthropic y OpenAI, y todavía por debajo del líder de la categoría, Claude Opus 5. O sea, está entre los mejores.
¿Es literalmente “el mejor overall”? Depende de qué corte del índice mires y de qué día. La ficha de Artificial Analysis lo ubica entre los primeros del Intelligence Index general, y en tareas agentic específicas es donde más brilla. El titular que circula por Hacker News agarra la lectura más favorable.
¿Por qué a Qwen3.8 Max lo llaman el mejor modelo IA para agentes?
Porque en los benchmarks de “computer use” y automatización desktop/mobile la rompe. Según los benchmarks disponibles, destaca en OSWorld-Verified, AndroidWorld y MobileWorld, además de en razonamiento y en seguir instrucciones. Para un agente que tiene que clickear, leer pantallas y encadenar acciones, eso es oro.
Eso sí: hay una asimetría rara. El mismo modelo que es tope de tabla en instruction following queda a media tabla en la categoría agentic y en coding. Traducido: sigue órdenes de manera impecable, razona bárbaro, pero cuando la tarea se estira a decenas de pasos, la eficiencia se le va al descenso.
Y acá viene lo bueno. VentureBeat tituló que Qwen3.8 Max “supera a GPT-5.6 Sol max y Fable 5 en uso agentic de computadora”, pero la forma en que lo logra es a fuerza bruta: hace más trabajo, gasta más tokens, tarda más turnos. Ganás la carrera, sí, pero con el tanque lleno hasta el tope. Más contexto en entornos corporativos securizados.
Características de Qwen3.8 Max: parámetros, velocidad, contexto y precio
Qwen3.8 Max es un modelo Mixture-of-Experts con 2,4 billones de parámetros totales y 95 mil millones activos por forward pass, unas seis veces más grande que Qwen3.5. Maneja 1 millón de tokens de contexto y acepta texto, imagen y video de entrada, con salida solo en texto.
- Velocidad de salida: por debajo de la mediana de su categoría según Artificial Analysis. No es de los rápidos.
- Latencia: relativamente alta hasta el primer token en la medición de Artificial Analysis.
- Contexto: 1 millón de tokens, suficiente para meter una base de código mediana entera.
- Modalidad: entiende imagen y video, no genera imágenes.
- Multiidioma: soporta español, aunque los benchmarks multilingües todavía no tienen medición pública completa.
Un detalle que se agradece: hay un precio reducido para el cache hit, así que si repetís prompts largos, el costo real puede achicarse bastante.
Qwen3.8 Max frente a Claude, GPT-5.6 y Kimi K3
En el benchmark agentic GDPval-AA, estos son los modelos que al 6 de agosto de 2026 pelean en el pelotón de punta. Ojo que el Elo mide desempeño, no eficiencia ni costo (dos cosas donde Qwen3.8 Max no gana).
| Modelo | Lab |
|---|---|
| Claude Opus 5 max | Anthropic |
| Claude Fable 5 | Anthropic |
| Qwen3.8 Max | Alibaba |
| GPT-5.6 Sol max | OpenAI |
| Kimi K3 | Moonshot AI |

La lectura honesta: Qwen3.8 Max entra en el top del ranking agentic, pero no es el rey solitario. Está pegado a Fable 5 y todavía por debajo de Opus 5 max. En el Intelligence Index general de Artificial Analysis quedó segundo entre los labs chinos, detrás de Kimi K3, y por encima de todo lo de Google, Meta y xAI. Nada mal para un modelo con menos de una semana de vida.
¿Cuánto cuesta usar Qwen3.8 Max?
La API de Alibaba Cloud cobra USD 2 por millón de tokens de entrada y USD 6 por millón de salida. En papel es competitivo. El problema no está en la tarifa, está en cuántos tokens quema el modelo para terminar una tarea. Cubrimos ese tema en detalle en al igual que ChatGPT.
Los números de la comparativa son elocuentes: una tarea agentic promedio le cuesta bastante más que a Qwen3.7 Max, prácticamente el doble. ¿La razón? Necesita muchos más turnos y tokens por tarea que su antecesor.
Ponele que corrés 10.000 tareas agentic al mes: la cuenta con 3.8 Max se acerca al doble que con 3.7 Max. La “mejora” de ranking te sale bastante más plata. Habría que ver si el salto de calidad lo justifica para tu caso, porque no siempre lo hace.
¿Para qué conviene usar Qwen3.8 Max?
Conviene para tareas donde la calidad del resultado pesa más que el costo o la latencia. Rinde bien en benchmarks de código como Terminal-Bench y SWE-bench, así que anda para pair programming y resolución de issues reales de código. Y por su desempeño en OSWorld y AndroidWorld, es de lo mejor que hay hoy para automatizar interfaces gráficas.
- Automatización de escritorio y mobile: agentes que operan apps por vos, donde su fuerte de “computer use” rinde.
- Análisis multimodal: revisar documentos con imágenes o video aprovechando la ventana de 1M de tokens.
- Código complejo: tareas largas de refactor o debugging donde preferís que insista hasta resolver, aunque gaste tokens.
Para soporte al cliente de alto volumen, en cambio, lo pensaría dos veces. La combinación de una velocidad por debajo de la mediana y muchos turnos por tarea juega en contra cuando necesitás respuestas rápidas y baratas a escala.
¿Cómo acceder a Qwen3.8 Max desde América Latina?
La vía directa es la API de Alibaba Cloud (Model Studio), con pago por uso a USD 2 / USD 6 por millón de tokens. Alibaba anunció además que liberaría los pesos del modelo la semana siguiente al lanzamiento, así que también vas a poder correrlo vía proveedores tipo OpenRouter o Hugging Face Inference, o self-hosted si tenés el fierro para semejante MoE.
Si vas a poner un agente de estos a laburar en serio, no alcanza con la API: necesitás infraestructura donde corra el orquestador, la cola de tareas y el logging. Para servidores y hosting en Argentina, donweb.com te resuelve esa capa sin pelearte con la latencia de un datacenter del otro lado del mundo. No hay restricción regional conocida para consumir la API desde LatAm, más allá de pagar en dólares.
Qué está confirmado y qué todavía no
- Confirmado: Qwen3.8 Max salió el 3 de agosto de 2026, lo evaluó Artificial Analysis (no la propia Alibaba) y quedó entre los mejores del agentic index con un puntaje alto en GDPval-AA.
- Confirmado: precio USD 2 / USD 6 por millón de tokens, contexto de 1M, arquitectura de 2,4 billones de parámetros con 95 mil millones activos.
- Pendiente: la apertura efectiva de los pesos y su disponibilidad estable en proveedores externos.
- Pendiente: mediciones completas en benchmarks de matemática y multilingüe, que todavía no tienen datos públicos completos.
- A tomar con pinzas: el rótulo de “mejor modelo overall”, que aplica a cierta lectura del agentic index y no al Intelligence Index general.
Errores comunes al evaluar Qwen3.8 Max
Confundir “líder en agentic” con “el mejor para todo”. No es lo mismo. En razonamiento e instruction following es tope de tabla, pero en eficiencia agentic y coding queda a media tabla. Elegilo por la tarea, no por el titular. Te puede servir nuestra cobertura de entre los modelos de razonamiento.
Mirar solo el precio por token. El USD 6 de salida parece barato hasta que ves que una tarea agentic cuesta el doble que en la versión anterior por la cantidad de turnos. La métrica que importa es el costo por tarea completada, no la tarifa por millón.
Asumir velocidad alta por ser un modelo nuevo. Está por debajo de la mediana de su categoría en velocidad. Si tu producto vive de respuestas instantáneas, medí la latencia real antes de comprometerte.
Tomar el benchmark del fabricante como palabra santa. Acá la ventaja es que el número viene de Artificial Analysis, un tercero. Igual, cruzá siempre con tu propia evaluación sobre tus casos de uso reales.
Preguntas Frecuentes
¿Qué es Qwen3.8 Max?
Es el modelo de lenguaje propietario más grande de Alibaba, lanzado el 3 de agosto de 2026, con 2,4 billones de parámetros totales (95 mil millones activos), ventana de contexto de 1 millón de tokens y capacidad multimodal de entrada (texto, imagen y video). Es un modelo de razonamiento orientado a tareas agentic.
¿Por qué Qwen3.8 Max quedó arriba en el agentic index?
Porque logró uno de los puntajes más altos en el benchmark GDPval-AA de Artificial Analysis, a la altura de lo mejor de Anthropic y OpenAI. Su fuerte está en tareas de uso de computadora, como OSWorld-Verified. La contra es que lo logra usando muchos más turnos y tokens por tarea. Esto se conecta con lo que analizamos en frente a las soluciones de Google.
¿Cuánto cuesta Qwen3.8 Max?
La API de Alibaba Cloud cobra USD 2 por millón de tokens de entrada y USD 6 por millón de salida. En la práctica, una tarea agentic promedio cuesta cerca del doble que en Qwen3.7 Max, por la cantidad de turnos que necesita.
¿Cómo se compara Qwen3.8 Max con Claude y GPT-5.6?
En el agentic index quedó codo a codo con Claude Fable 5 y apenas por encima de GPT-5.6 Sol max, pero por debajo de Claude Opus 5 max, el líder de la categoría. En el Intelligence Index general figura entre los primeros puestos, por encima de todo Google, Meta y xAI, y segundo entre los labs chinos detrás de Kimi K3.
¿Dónde acceder a Qwen3.8 Max desde América Latina?
Vía la API de Alibaba Cloud (Model Studio) con pago por uso, sin restricción regional conocida más allá de facturar en dólares. Alibaba anunció la apertura de los pesos, así que también estará disponible en proveedores como OpenRouter o Hugging Face Inference y para self-hosting.
Conclusión
Qwen3.8 Max confirma que Alibaba juega en la primera división de los modelos agentic: un puntaje alto en el agentic index lo pone codo a codo con lo mejor de Anthropic y OpenAI, y por delante de todo Occidente salvo esos dos labs. Para automatización de interfaces y tareas de código largas, es de lo más capaz que podés usar hoy.
Pero cuidado con el titular fácil. La corona de “mejor modelo overall” aplica a una lectura puntual del agentic index, no al ranking general, donde no encabeza. Y esa capacidad se paga: cerca del doble de costo por tarea que la versión anterior, muchos más turnos por tarea y una velocidad por debajo de la mediana. Si tu caso premia calidad sobre presupuesto, probalo ya. Si vivís de respuestas rápidas y baratas a escala, medí tu costo por tarea real antes de mover un solo agente a producción.
Fuentes
- Artificial Analysis – Ficha oficial de Qwen3.8 Max: Intelligence Index, precio, velocidad y contexto
- Artificial Analysis – Agentic Index e Intelligence Index v4.1.1
- BenchLM – Benchmarks y velocidad de Qwen3.8 Max (agosto 2026)
- OfficeChai – Qwen3.8 Max y su posición frente a labs de EE.UU.
- Hacker News – Discusión sobre Qwen3.8 Max al tope del agentic index




