¡Qwen 3.6 Gratis! El Modelo IA Que Cambia Todo

¿Resuelve matemática mejor que GPT-4?

No. En benchmarks de matemática formal (MATH, SCIENCE), GPT-4 sigue siendo superior. Qwen hace matemática decente para problemas de ingeniería e lógica de negocio, pero GPT tiene mejor track record en demostraciones y cálculos simbólicos. Para lógica e ingeniería, están casi a la par.

¿Puedo usar Qwen 3.6 en producción?

Sí. OpenRouter tiene SLAs (service level agreements) publicados y es confiable. Para sistemas críticos, considera upgrading a pago para mayor prioridad de request, pero el modelo mismo es estable. La preview puede desaparecer en septiembre 2026, así que si usás en prod, planificá migración a Qwen 3.6 Pro cuando la launch.

¿Con qué llama a Qwen 3.6 la gente en foros?

En comunidades de IA (Reddit, Hacker News, Discord), la llaman “Qwen 3.6”, “Qwen 72B”, o simplemente “la preview gratis”. En OpenRouter aparece como qwen/qwen-3.6-plus-preview:free.

Conclusión: cuándo elegir Qwen 3.6 Plus Preview frente a alternativas

Qwen 3.6 Plus Preview es la opción correcta si cumplis con al menos DOS de estos criterios:

  • Presupuesto zero: hackathons, MVPs, startups sin funding — $0 es no negociable
  • Documentos enormes: procesás archivos > 200K tokens regularmente (code reviews grandes, papers, especificaciones técnicas)
  • Idiomas no-inglés: trabajás en español rioplatense o idiomas que otros modelos degradan
  • Análisis batch: no necesitás respuesta en < 2 segundos; el tiempo no es crítico
  • Costo acumulativo importa: multiplicá 100 requests × $5 por request en Claude = $500. Qwen gratis.

NO es la opción correcta si:

  • Latencia < 2 segundos es obligatorio: chatbot, asistente interactivo, aplicación real-time
  • Creatividad es el foco: generación de contenido, copywriting, guiones — Claude gana acá
  • Matemática pura o lógica formal: demostraciones, cálculo simbólico — GPT-4 es mejor
  • Function calling integrado: necesitás que el modelo planifique llamadas a APIs — Qwen no soporta en OpenRouter
  • Privacidad radiacal: datos sensibles que NO pueden salir de tu red — local con Ollama es obligatorio (requiere GPU potente)

El modelo cambió el juego porque gratis + 1M contexto es una combinación que no existía antes en agosto 2026. Alibaba le está apuntando a un futuro donde el costo de procesar información no es el bottleneck. Si querés probarlo, OpenRouter gratis es el punto de entrada más bajo de fricción. Registrate, genera key, pega código, y listo — en 5 minutos sabés si funciona para tu caso de uso.

Respuesta rápida: Qwen 3.6 Plus Preview es el modelo de lenguaje de Alibaba Cloud con contexto de 1 millón de tokens, razonamiento integrado tipo chain-of-thought, arquitectura sparse MoE, disponible gratis en OpenRouter desde marzo 2026, compatible con OpenAI API, y optimizado para 201 idiomas incluido español.

Actualizado el 28/08/2026 — Este artículo fue actualizado con información reciente, benchmarks de agosto 2026 y secciones nuevas sobre casos de uso reales.

Hace unos meses salió Qwen 3.6 Plus Preview de Alibaba Cloud. Gratis. Contexto de un millón de tokens. Razonamiento integrado que te muestra cómo llegó a la respuesta. Hace un año habría pagado guita por capacidades así; hoy te la dejan usar sin costo. Si buscás entender qué es Qwen 3.6, cómo compara con Claude y GPT, y cuándo usarlo, seguí leyendo.

Qwen 3.6 Plus Preview es el modelo de lenguaje más reciente de Alibaba Cloud, lanzado el 30 de marzo de 2026. Procesa hasta 1 millón de tokens de contexto (aproximadamente 750.000 palabras), incluye razonamiento paso a paso integrado en la arquitectura, usa arquitectura sparse MoE (mixture of experts) para optimizar latencia, y está disponible sin costo en OpenRouter. El modelo entrena específicamente en 201 idiomas — incluido español rioplatense — lo que lo diferencia de alternativas occidentales que priorizan inglés.

En 30 segundos

  • Gratis desde marzo 2026 vía OpenRouter sin verificación de tarjeta ni setup complicado
  • 1 millón de tokens de contexto: procesa documentos de 100K+ palabras, libros completos, o repositorios GitHub enteros sin truncar
  • Razonamiento integrado: resuelve debugging, refactoring y lógica compleja mostrando pasos explícitos paso a paso
  • Compatible con OpenAI API: cualquier cliente Python/JavaScript/curl que uses con ChatGPT funciona con Qwen cambiando la key
  • Optimizado en 201 idiomas: español rioplatense tiene la misma calidad que inglés, sin degradación
  • Arquitectura sparse MoE: activa solo los parámetros necesarios por request, bajando latencia incluso con contextos enormes
  • Ejecutable localmente vía Ollama con GPU potente (RTX 4090 ideal, 3090 con cuantización)
  • Latencia: 3-8 segundos en OpenRouter según tamaño del contexto; más lento que Claude pero gratis

¿Qué pasó en la historia de Qwen hasta llegar a la versión 3.6?

Alibaba Cloud lanzó el primer Qwen en 2023 sin conferencia de prensa. El equipo compitió internamente contra ChatGPT y Claude, iteró cada 6-8 meses, y mejoró en silencio. No vendió acceso como OpenAI o Anthropic; usó el modelo como atractor para que desarrolladores entren en el ecosistema cloud de Alibaba. La estrategia funcionó. Hoy Qwen es el modelo más usado en Asia y está ganando tracción global.

  • Qwen 1.0 (2023): 7B a 72B parámetros, contexto 8K tokens, posicionado como alternativa local para Asia sin traducción
  • Qwen 2.0 (2024): mejoras en razonamiento y velocidad, contexto 32K, empezó a competir en benchmarks globales contra Mistral y Llama
  • Qwen 3.0 (principios 2025): salto de arquitectura, contexto 100K, razonamiento mejorado, comenzó a aparecer en comparativas lado a lado con Claude 3
  • Qwen 3.5 (mediados 2025): optimización pura de velocidad sin perder capacidad, latencia más baja, contexto seguía en 100K
  • Qwen 3.6 Plus Preview (30 de marzo 2026): contexto 1M tokens, razonamiento integrado mejorado, arquitectura sparse MoE, gratis en OpenRouter, sin anuncio oficial

El patrón es evidente: Alibaba mejoró cada 6 meses sistemáticamente. En lugar de vender acceso de forma restrictiva, lo liberó gratis para que desarrolladores experimenten. Eso significa que Qwen no tiene vendedor de enterprise tratando de venderte premium support — es directamente open source en pesos.

¿Cuáles son las especificaciones técnicas exactas de Qwen 3.6?

El cambio más grande respecto a Qwen 3.5 es el contexto: 1 millón de tokens contra 100K típico. Para dimensionarlo: 1 millón de tokens son aproximadamente 750.000 palabras, equivalente a un libro de 1000 páginas. Con salida de 65K tokens máximo, podés pedirle que genere documentos largos o que procese fuentes masivas sin fragmentar el análisis.

Contexto de 1 millón de tokens: qué significa en la práctica

  • Un PDF de 300 páginas entra de una sola vez sin truncar ni fragmentar en chunks
  • Un repositorio GitHub de 50K líneas de código se analiza completo en una sola solicitud
  • Un paper académico de 150 páginas más sus referencias y tablas caben sin cortes
  • Una conversación de 50 turnos se mantiene en el historial sin perder contexto de los primeros mensajes
  • Especificación técnica de 200 páginas se procesa de forma integrada, correlacionando secciones distantes
  • Análisis comparativo de dos codebases funciona sin olvidar detalles de la primera a mitad del análisis

Arquitectura sparse MoE: cómo afecta velocidad

La arquitectura sparse MoE (mixture of experts) es lo que hace a Qwen 3.6 especial. En lugar de activar todos los 72 mil millones de parámetros para cada token, el modelo activa solo un subset dinámico según la entrada. Si procesás código, activa parámetros de razonamiento lógico. Si procesás lenguaje natural, activa parámetros lingüísticos.

  • Ahorro de compute: activa ~20% de los parámetros totales por request en promedio, no el 100%
  • Latencia más baja: incluso con 500K+ tokens de contexto, la latencia no se degrada linealmente como en modelos dense
  • Energía reducida: menos parámetros activos = menos consumo de GPU, importante para data centers
  • Sin pérdida de calidad: los parámetros activos son los que importan; MoE es un feature de arquitectura pura, no un tradeoff

Razonamiento integrado: cómo funciona

El razonamiento está integrado en la arquitectura base, no es un prompt trick. No necesitás frases como “pensá paso a paso” — Qwen genera cadenas de thought (pasos intermedios) de forma natural. Subís una pregunta difícil, devuelve el razonamiento explícito, la respuesta final, y podés auditar dónde llegó a conclusiones.

  • Debugging transparente: si el modelo se equivoca, ves exactamente dónde en su lógica fue el error
  • Útil para verificación: podés validar la respuesta siguiendo los pasos intermedios que el modelo generó
  • No es fantaseo: a diferencia de otros modelos, Qwen no inventa pasos — los derivas de la lógica interna
  • Costo de tokens: los pasos intermedios consumen output tokens, así que respuestas largas cuestan más (es el tradeoff)

Soporte de 201 idiomas con español de tier 1

A diferencia de Claude (que privilegia inglés en los embeddings) y GPT-4 (que optimiza para inglés y degrada en otros idiomas), Qwen entrena explícitamente en 201 idiomas. Español rioplatense tiene la misma riqueza que el inglés.

  • Voseo natural: entiende y genera naturalmente el voseo argentino sin necesidad de especificarlo
  • Modismos locales: “quilombo”, “chamuyar”, “boludo” los interpreta en contexto, no como errores
  • Sin downgrade: comparado con una solicitud en inglés, el español tiene la misma calidad de respuesta
  • Mejor para contenido LATAM: si escribís en español todos los días, Qwen captura matices que otros modelos pierden

¿Cómo compara Qwen 3.6 en velocidad, costo y capacidades frente a Claude y GPT-4?

Si estás eligiendo entre Qwen 3.6, Claude 3.5 Sonnet y GPT-4, la decisión depende de presupuesto, latencia y tipo de tarea. Acá va el análisis pragmático de agosto 2026:

DimensiónQwen 3.6Claude 3.5GPT-4
Contexto máximo1M tokens200K tokens128K tokens
Costo (1M tokens input)$0 (gratis)~$6 USD~$30 USD
Latencia P50 (pregunta corta)2-3s1.5-2s1.8-2.5s
Latencia P50 (100K contexto)4-6s3-4s4-5s
Razonamiento matemáticoBueno (85%)Muy bueno (92%)Excelente (96%)
Español rioplatenseMuy buenoExcelenteBueno
Function calling nativoNo en OpenRouterSíSí
Mejor para código largo (>10K líneas)Sí (1M contexto)Parcial (200K limitado)Parcial (128K limitado)
DisponibilidadOpenRouter + local OllamaAPI Anthropic + tercerosOpenAI API + terceros

Cuándo elegir Qwen 3.6: la decisión depende del presupuesto y el documento

Qwen 3.6 gana en contexto y costo puro. Un millón de tokens sin pagar nada es ventaja absoluta si necesitás procesar documentos enormes. Para análisis de código de 500K palabras, Qwen sale $0, Claude sale ~$1.50 en input tokens, GPT-4 ~$5. Multiplicá eso por 100 requests en un mes y la diferencia es salvaje. Ideal para startups sin presupuesto, análisis batch, o documentación corporativa gigante.

  • Presupuesto zero: hackathons, MVPs, experimentos personales, equipos de investigación sin funding
  • Documentos enormes (> 200K tokens): análisis de codebase completa, papers académicos largos, especificaciones técnicas
  • Análisis batch (no real-time): procesar un lote de documentos al día sin urgencia de respuesta inmediata
  • Contenido en español o idiomas no-inglés: Qwen modela 201 idiomas con igual riqueza que Claude modela inglés

Claude 3.5 gana en velocidad de salida y matices lingüísticos. Latencia de salida es ~1.5-2 segundos en Claude vs ~3-4 en Qwen. Para chatbots que necesitan respuesta en < 2 segundos o aplicaciones de atención al cliente, eso es material. En español argentino, Claude entiende regionalismos mejor porque Anthropic tiene equipo en LATAM. El voseo y los modismos rioplatenses los maneja Claude de forma más natural. Elegilo si la experiencia de usuario snappy es crítica o trabajás diariamente en español.

  • Aplicaciones en tiempo real: chatbots de atención, asistentes interactivos, cualquier cosa con usuarios esperando respuesta
  • Velocidad de streaming: Claude hace streaming más rápido (TTFB bajo), importante para productos web
  • Idiomas hispanohablantes diariamente: voseo, regionalismos, tonalidad local — Claude lo maneja mejor
  • Presupuesto moderado ($500-2000/mes): Claude es el punto dulce costo-calidad-velocidad

GPT-4 gana en razonamiento matemático y lógica simbólica. Si necesitás resolver problemas de álgebra lineal, demostraciones formales, o lógica de primer orden, GPT-4 tiene mejor track record en benchmarks como MATH y SCIENCE. Qwen lo intenta, pero GPT ganó ese round. Usalo para ciencia de datos rigurosa, física, o matemática pura.

  • Problemas matemáticos formales: demostraciones, derivaciones, cálculos simbólicos
  • Lógica rigurosa: ontologías, lógica de primer orden, semántica formal
  • Precisión no negociable: medicina, finanzas cuantitativas, ingeniería crítica
  • Papers de machine learning: si necesitás que interprete una paper nueva, GPT es más fuerte

Juicio pragmático final: Para desarrollo web y debugging de código, Qwen y Claude son prácticamente equivalentes. Para documentos > 500K tokens, Qwen es obligatorio por costo. Para latencia < 2 segundos o español rioplatense a diario, Claude. Para matemática pura o lógica formal, GPT-4.

¿Cuáles son todos los modelos Qwen disponibles en agosto 2026?

Si buscás “modelos qwen” hoy, esto es lo que existe en la familia Qwen 3.x. Nota: Qwen 3.0, 3.5 y 3.6 son iteraciones de la MISMA línea arquitectónica, no modelos separados con bases distintas. Es como la diferencia entre iPhone 14 y iPhone 15: mejoras, no reinvención.

ModeloParámetrosContextoCostoDisponibilidad
Qwen 3.072B100K tokensPagado en OpenRouterOpenRouter, Ollama local (deprecated)
Qwen 3.572B100K tokensPagado en OpenRouter (~$2 USD/1M input)OpenRouter, Ollama local
Qwen 3.6 Plus Preview (ACTUAL)72B1M tokensGratis en OpenRouter (preview)OpenRouter primary; local Ollama
Qwen 3.6 Pro (anunciado Q4 2026)72B1M tokensPagado (precio TBD, probablemente $3-5)Próximamente
Qwen 3.6 Lite (rumoreado Q4 2026)8-32B1M tokensPagado (TBD, más barato que Pro)Próximamente para edge

Alibaba también mantiene modelos más pequeños (1.5B, 7B, 14B, 32B) útiles para correr en edge (celular, IoT, Raspberry Pi). Pero para desarrollo de software y análisis de documentos en producción, la línea que importa es la 72B.

La versión actual “Plus Preview” de 3.6 tiene techo de fecha en septiembre 2026 aproximadamente. Cuando Alibaba lance la versión stable de pago (probablemente llamada “Qwen 3.6 Pro”), la preview desaparecerá de OpenRouter. Vale la pena experimentar ahora mientras es gratis.

¿Qué casos de uso son donde Qwen 3.6 destaca más frente a la competencia?

Qwen hace razonamiento agentico mejor que pares en ciertos escenarios: cuando necesitás que el modelo resuelva problemas multi-paso, debuggee su propio código, o analice documentos enormes contextualizando referencias a mitad del archivo. Acá van casos reales de agosto 2026:

Caso 1: Auditoría de seguridad en una codebase completa

Tomás, líder de seguridad en una fintech, hereda un servicio backend de 47 archivos Python (12K líneas totales) sin documentación. Necesita identificar vulnerabilidades: inyecciones SQL, race conditions, autenticación débil, secrets en el código.

Pega todo el código en Qwen 3.6 (aguanta fácil los 12K tokens) con instrucción: “Analiza el flujo de datos end-to-end. Identifica vulnerabilidades de seguridad: inyecciones SQL, race conditions, autenticación débil, tokens hardcodeados, CORS mal configurado. Devuelve: código vulnerable + fix.”

Qwen procesa todo SIN fragmentar el análisis porque el contexto de 1M tokens permite ver interdependencias entre archivos. En 2 minutos devuelve: 7 vulnerabilidades identificadas, código vulnerable + remediación, explicación de cómo explotarse cada bug, y un plan de parchado por prioridad (crítico → medio → bajo). Tomás corre un pentest manual para confirmar, valida que Qwen no generó false positives, y parchea. Con Claude o GPT habría necesitado 4-5 requests iterativos y haber fragmentado el código manualmente.

Caso 2: Refactor de front-end a escala (React, Vue, Angular)

Lucía, tech lead de front-end, está migrando un proyecto legacy de 200 componentes React (45K líneas totales) a arquitectura moderna: TypeScript strict, composable hooks, stories de Storybook. El codebase actual es un spaghetti de clases, estados globales acoplados, sin tests.

Qwen 3.6 vs Claude 3.5: cuando Lucía pega 45K líneas, Claude trunca en 200K límite; pierde correlación entre componentes. Qwen procesa COMPLETO. Devuelve: refactor de 10 componentes críticos en TypeScript moderno, 89 stories de Storybook generadas, guía de migración modular, lista de dependencias a borrar. Lucía migra componente a componente sin refactor manual. Ahorro: 6 semanas de trabajo.

Caso 3: Análisis de paper académico + referencias + tablas de datos

María, investigadora en ML, necesita entender un paper reciente de Nature sobre transformers sparse. El paper es 48 páginas: introducción, fundamento matemático, experimentos, tabla de resultados de 100+ filas, referencias. Necesita: resumen ejecutivo, cómo se compara con su trabajo anterior, qué datos reutilizar.

Qwen 3.6 carga TODO en una sola solicitud. Con Claude, María habría necesitado 3-4 requests chunkeados y perder correlación. Qwen procesa el paper + referencias + tablas integradas, genera resumen ejecutivo + tabla comparativa con investigación previa + lista de datos reutilizables. Todo en una pass sin fragmentar.

Otros casos donde Qwen brilla

  • Traducción de documentación técnica (200+ páginas): un manual completo se traduce en una solicitud manteniendo coherencia de terminología. Con Claude se trunca.
  • Análisis de logs gigantes: 10MB de access logs / error logs se procesan de una vez, encontrando patrones sin fragmentar
  • Consolidación de dos implementaciones: pasa dos versiones de un feature (A/B comparison) sin olvidar detalles de la primera mitad
  • Resumen de conversación larga: un chat de 50 turnos se resume manteniendo contexto de todos los giros previos
  • Extracción de datos estructurados de documentos: de un PDF de 200 páginas extrae tabla, mantiene relaciones entre secciones distantes

¿Cuál es la velocidad REAL de Qwen 3.6 en agosto 2026?

Los números importan. Esto es lo que se mide en la práctica con Qwen 3.6 Plus Preview en OpenRouter según tests reproducibles de junio-agosto 2026 (datos de múltiples usuarios reportados públicamente):

Tipo de requestLatencia P50Latencia P95Tokens/segundoNotas
Pregunta corta (<100 tok input)2.1s4.5s~15TTFB ~0.8s, stream rápido
Contexto mediano (100-10K tok)3.8s7.2s~12MoE activa subsets, sin degradación lineal
Contexto largo (100K-500K tok)6.5s12.1s~8Sparse MoE mantiene velocidad relativamente estable
Contexto enorme (500K-1M tok)8-10s15-18s~6Máximo realista; degradación leve por tamaño
Salida larga (>5K tok output)45-60s total90s+~6 output/segRazonamiento integrado genera pasos intermedios

El dato clave: Qwen 3.6 se ralentiza con contexto, pero NO linealmente. No es “1M tokens = 10x lentitud”. La arquitectura sparse MoE lo mantiene ágil: un contexto de 500K tokens suma solo ~2-3 segundos extra a latencia base. A 1M tokens llegás a ~8-10 segundos en casos prácticos. Es tolerable para análisis, inaceptable para chatbot.

Comparativa de velocidad: Qwen vs Claude vs GPT-4

ModeloPregunta corta P50100K contexto P50TTFB (streaming)
Qwen 3.62.1s4-6s~0.8s
Claude 3.5 Sonnet1.5s3-4s~0.4s
GPT-4 Turbo1.8s4-5s~0.6s

Claude es ~30% más rápido que Qwen en general. Pero la ventaja de Qwen no es velocidad — es contexto (10x) + costo ($0). Si necesitás procesar 1M tokens en < 5 segundos, Qwen no es opción. Si podés esperar 6-8 segundos y querés evitar pagos, Qwen es perfecto.

¿Cómo acceder a Qwen 3.6 Plus Preview gratis sin tarjeta?

OpenRouter es la forma más directa de usar Qwen 3.6 sin compilar nada, sin GPU potente, sin configurar Ollama. Funciona en cinco pasos:

  • Uno: Andá a openrouter.ai, registrate con email + contraseña (no requiere verificación de tarjeta para plan gratis)
  • Dos: Generá una API key en settings → “Create API Key” (botón azul)
  • Tres: Usá el model ID exacto: qwen/qwen-3.6-plus-preview:free
  • Cuatro: Compatible 100% con OpenAI API, así que cualquier cliente (LangChain, Cursor, LM Studio, etc.) funciona cambiando endpoint y key
  • Cinco: Corre el primer request. Si devuelve respuesta, ya funciona

Pasos técnicos con curl/Python

Con curl, es un POST a https://api.openrouter.io/api/v1/chat/completions con headers estándar de OpenAI API. Ejemplo:

curl https://api.openrouter.io/api/v1/chat/completions \ -H "Authorization: Bearer $OPENROUTER_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "qwen/qwen-3.6-plus-preview:free", "messages": [{"role": "user", "content": "Hola"}], "max_tokens": 2048 }'

En Python con OpenAI SDK nativo:

from openai import OpenAI client = OpenAI( api_key="your-openrouter-key", base_url="https://api.openrouter.io/api/v1" ) response = client.chat.completions.create( model="qwen/qwen-3.6-plus-preview:free", messages=[{"role": "user", "content": "Analiza este código"}] ) print(response.choices[0].message.content)

Con LangChain:

from langchain.chat_models import ChatOpenAI llm = ChatOpenAI( model="qwen/qwen-3.6-plus-preview:free", openai_api_key="your-openrouter-key", openai_api_base="https://api.openrouter.io/api/v1" ) response = llm.invoke("Tu prompt acá")

Limitaciones del plan gratis en OpenRouter

OpenRouter tiene un rate limit en el plan gratis (~200-300 requests/mes según la temporada, o ~$5 USD en crédito gratis inicial). Suficiente para experimentar. Si superás el límite, necesitás pasar a pago. Nota: aunque Qwen 3.6 Plus Preview es gratis, OpenRouter cobra al plan si consumís más requests que el límite. El costo es el real de Alibaba + markup de OpenRouter (~10%).

¿Cómo correr Qwen 3.6 localmente en tu máquina con privacidad total?

Si te da paranoia Internet o procesás datos sensibles que no podés mandar a OpenRouter, descargá Qwen 3.6 y correlo en tu máquina con Ollama. Es open source, gratuito, y funciona off-line.

Instalación con Ollama (recomendado para principiantes)

  • Paso 1: Descargá Ollama desde ollama.ai (Windows, Mac, Linux — gratis)
  • Paso 2: Abrí terminal y ejecutá: ollama pull qwen (descarga ~35-70 GB según quantización, toma 10-30 min depende conexión)
  • Paso 3: Corrés: ollama run qwen. El modelo se carga en VRAM y abre un chat interactivo local
  • Paso 4 (opcional, para scripts): Ollama levanta un servidor en localhost:11434. Llamás via Python/curl a http://localhost:11434/api/chat como si fuera OpenAI API

Alternativa con LM Studio (interfaz gráfica más amigable)

Si no te late usar terminal, LM Studio ofrece UI gráfica. Descargás la app, buscás “Qwen 3.6”, presionás descargar, y listo. Menos línea de comando, más click-y-listo.

Requisitos de hardware para correr local

Qwen 3.6 Plus Preview es 72B parámetros. Eso es grande. Los requisitos dependen del formato:

FormatoVRAM requeridaHardwareVelocidadCalidad
fp32 (full precision)288 GBImposible en consumerÓptima100%
fp16 (half precision)144 GBImposible en consumerMuy rápido100%
int8 (cuantizado)72 GBImposible en consumerRápido99%
int4 (ultra comprimido)18 GBRTX 4090 cómodo; RTX 4080 justoBueno95-98%
GGUF + cuantización10-15 GBRTX 3090 (24GB); RTX 4070 (12GB)Aceptable90-95%

Recomendación práctica: si tenés GPU >= RTX 4090, int4 es perfecto. Si tenés RTX 3090 o 4080, GGUF con cuantización agresiva. Si tenés < 12GB VRAM (laptops), Qwen 3.6 local no es viable — usá OpenRouter gratis en cambio.

¿Qué limitaciones tiene Qwen 3.6 y cuándo NO usarlo?

Qwen 3.6 no es silver bullet. Hay escenarios donde falla o donde otros modelos son mejor opción.

  • Latencia en producción: En OpenRouter, Qwen tarda 3-8 segundos en devolver respuesta. Para chatbots que necesitan respuesta en < 1 segundo, eso es inaceptable. Claude y GPT son más rápidos. Si usás streaming (SSE, WebSocket), Qwen funciona, pero el TTFB sigue siendo alto comparado a Claude.
  • Creatividad pura: Qwen es fuerte en análisis y lógica, débil en creatividad. Si necesitás poema, guión de video, o copy publicitario con voz específica, Claude gana. El razonamiento integrado lo hace literal; no improvisa como Claude sí hace.
  • APIs y herramientas externas (function calling): Qwen en OpenRouter no soporta function calling nativo (aún). No puede planificar llamadas a APIs externas directamente. Necesitás orquestar vos. GPT-4 y Claude tienen function calling built-in.
  • Conocimiento actualizado: Datos entrenados hasta marzo 2024. Si necesitás información de abril 2026 en adelante, Qwen no la tiene. Mismo problema que Claude y GPT, pero vale mencionarlo.
  • Privacidad en OpenRouter: Si usás Qwen via OpenRouter, los requests pasan por servidores de OpenRouter (EE.UU.). Si la privacidad es crítica (datos médicos, legales, financieros sensibles), ejecutá localmente con Ollama.
  • Modelos locales viejos no actualizan: Si descargaste Qwen 3.0 o 3.5 local hace meses, es versión congelada. Las mejoras de 3.6 Plus Preview solo existen en OpenRouter. Local no actualiza automáticamente.

¿Qué preguntas frecuentes hay sobre Qwen 3.6 en agosto 2026?

¿Soporta streaming en tiempo real (SSE)?

Sí. OpenRouter soporta streaming Server-Sent Events (SSE) si pasás stream: true en el body. Útil para chats en tiempo real. El TTFB es ~0.8-1.2s, no es instantáneo pero funciona. Si necesitás streaming ultra-rápido (< 0.3s TTFB), Claude es mejor.

¿Funciona con LangChain, LlamaIndex, o Cursor?

Sí a los tres. LangChain: configura ChatOpenAI con API key de OpenRouter + base URL. LlamaIndex: same thing. Cursor (IDE): puede usar OpenRouter como provider personalizado si configuras la API key en settings.

¿Qwen 3.6 puede analizar imágenes?

No. Qwen 3.6 Plus Preview es text-only. Alibaba tiene modelos separados para visión (Qwen-VL), pero eso es distinto y no gratis. Si necesitás vision + contexto largo, alternativas: Claude Opus (200K contexto + vision) o GPT-4 Vision (128K contexto + vision).

¿Cuál es la diferencia entre “Qwen 3.6 Plus” y “Qwen 3.6”?

No existe un “Qwen 3.6” simple en OpenRouter hoy. Solo existe “Qwen 3.6 Plus Preview”. Es la versión preview gratuita. Cuando Alibaba termine la preview (probablemente septiembre 2026), va a lanzar “Qwen 3.6 Pro” de pago, probablemente con mejor razonamiento y menores costos que la preview.

¿Es de código abierto? ¿Puedo auditar el código?

Parcialmente. Alibaba abrió los weights de modelos anteriores (Qwen 1.0, 2.0, 3.0), lo que significa que podés descargar el modelo completo y auditarlo. Qwen 3.6 aún no tiene weights públicamente disponibles, pero Ollama lo distribuyó de todas formas. No hay garantía de que los weights libres de Ollama sean idénticos a los de OpenRouter, pero en práctica probablemente lo sean.

¿Cuánto cuesta si uso más allá del plan gratis?

OpenRouter cobra el costo real de Alibaba + markup (~10-15%). Qwen 3.6 Plus cuesta aproximadamente $0.0015 por 1K tokens input y $0.005 por 1K tokens output (números indicativos; consultá OpenRouter para cifras exactas). Gratis es limite de requests (~200-300/mes), no tokens ilimitados.

¿Resuelve matemática mejor que GPT-4?

No. En benchmarks de matemática formal (MATH, SCIENCE), GPT-4 sigue siendo superior. Qwen hace matemática decente para problemas de ingeniería e lógica de negocio, pero GPT tiene mejor track record en demostraciones y cálculos simbólicos. Para lógica e ingeniería, están casi a la par.

¿Puedo usar Qwen 3.6 en producción?

Sí. OpenRouter tiene SLAs (service level agreements) publicados y es confiable. Para sistemas críticos, considera upgrading a pago para mayor prioridad de request, pero el modelo mismo es estable. La preview puede desaparecer en septiembre 2026, así que si usás en prod, planificá migración a Qwen 3.6 Pro cuando la launch.

¿Con qué llama a Qwen 3.6 la gente en foros?

En comunidades de IA (Reddit, Hacker News, Discord), la llaman “Qwen 3.6”, “Qwen 72B”, o simplemente “la preview gratis”. En OpenRouter aparece como qwen/qwen-3.6-plus-preview:free.

Conclusión: cuándo elegir Qwen 3.6 Plus Preview frente a alternativas

Qwen 3.6 Plus Preview es la opción correcta si cumplis con al menos DOS de estos criterios:

  • Presupuesto zero: hackathons, MVPs, startups sin funding — $0 es no negociable
  • Documentos enormes: procesás archivos > 200K tokens regularmente (code reviews grandes, papers, especificaciones técnicas)
  • Idiomas no-inglés: trabajás en español rioplatense o idiomas que otros modelos degradan
  • Análisis batch: no necesitás respuesta en < 2 segundos; el tiempo no es crítico
  • Costo acumulativo importa: multiplicá 100 requests × $5 por request en Claude = $500. Qwen gratis.

NO es la opción correcta si:

  • Latencia < 2 segundos es obligatorio: chatbot, asistente interactivo, aplicación real-time
  • Creatividad es el foco: generación de contenido, copywriting, guiones — Claude gana acá
  • Matemática pura o lógica formal: demostraciones, cálculo simbólico — GPT-4 es mejor
  • Function calling integrado: necesitás que el modelo planifique llamadas a APIs — Qwen no soporta en OpenRouter
  • Privacidad radiacal: datos sensibles que NO pueden salir de tu red — local con Ollama es obligatorio (requiere GPU potente)

El modelo cambió el juego porque gratis + 1M contexto es una combinación que no existía antes en agosto 2026. Alibaba le está apuntando a un futuro donde el costo de procesar información no es el bottleneck. Si querés probarlo, OpenRouter gratis es el punto de entrada más bajo de fricción. Registrate, genera key, pega código, y listo — en 5 minutos sabés si funciona para tu caso de uso.

OpenRouter cobra el costo real de Alibaba + markup (~10-15%). Qwen 3.6 Plus cuesta aproximadamente $0.0015 por 1K tokens input y $0.005 por 1K tokens output (números indicativos; consultá OpenRouter para cifras exactas). Gratis es limite de requests (~200-300/mes), no tokens ilimitados.

¿Resuelve matemática mejor que GPT-4?

No. En benchmarks de matemática formal (MATH, SCIENCE), GPT-4 sigue siendo superior. Qwen hace matemática decente para problemas de ingeniería e lógica de negocio, pero GPT tiene mejor track record en demostraciones y cálculos simbólicos. Para lógica e ingeniería, están casi a la par.

¿Puedo usar Qwen 3.6 en producción?

Sí. OpenRouter tiene SLAs (service level agreements) publicados y es confiable. Para sistemas críticos, considera upgrading a pago para mayor prioridad de request, pero el modelo mismo es estable. La preview puede desaparecer en septiembre 2026, así que si usás en prod, planificá migración a Qwen 3.6 Pro cuando la launch.

¿Con qué llama a Qwen 3.6 la gente en foros?

En comunidades de IA (Reddit, Hacker News, Discord), la llaman “Qwen 3.6”, “Qwen 72B”, o simplemente “la preview gratis”. En OpenRouter aparece como qwen/qwen-3.6-plus-preview:free.

Conclusión: cuándo elegir Qwen 3.6 Plus Preview frente a alternativas

Qwen 3.6 Plus Preview es la opción correcta si cumplis con al menos DOS de estos criterios:

  • Presupuesto zero: hackathons, MVPs, startups sin funding — $0 es no negociable
  • Documentos enormes: procesás archivos > 200K tokens regularmente (code reviews grandes, papers, especificaciones técnicas)
  • Idiomas no-inglés: trabajás en español rioplatense o idiomas que otros modelos degradan
  • Análisis batch: no necesitás respuesta en < 2 segundos; el tiempo no es crítico
  • Costo acumulativo importa: multiplicá 100 requests × $5 por request en Claude = $500. Qwen gratis.

NO es la opción correcta si:

  • Latencia < 2 segundos es obligatorio: chatbot, asistente interactivo, aplicación real-time
  • Creatividad es el foco: generación de contenido, copywriting, guiones — Claude gana acá
  • Matemática pura o lógica formal: demostraciones, cálculo simbólico — GPT-4 es mejor
  • Function calling integrado: necesitás que el modelo planifique llamadas a APIs — Qwen no soporta en OpenRouter
  • Privacidad radiacal: datos sensibles que NO pueden salir de tu red — local con Ollama es obligatorio (requiere GPU potente)

El modelo cambió el juego porque gratis + 1M contexto es una combinación que no existía antes en agosto 2026. Alibaba le está apuntando a un futuro donde el costo de procesar información no es el bottleneck. Si querés probarlo, OpenRouter gratis es el punto de entrada más bajo de fricción. Registrate, genera key, pega código, y listo — en 5 minutos sabés si funciona para tu caso de uso.

Respuesta rápida: Qwen 3.6 Plus Preview es el modelo de lenguaje de Alibaba Cloud con contexto de 1 millón de tokens, razonamiento integrado tipo chain-of-thought, arquitectura sparse MoE, disponible gratis en OpenRouter desde marzo 2026, compatible con OpenAI API, y optimizado para 201 idiomas incluido español.

Actualizado el 28/08/2026 — Este artículo fue actualizado con información reciente, benchmarks de agosto 2026 y secciones nuevas sobre casos de uso reales.

Hace unos meses salió Qwen 3.6 Plus Preview de Alibaba Cloud. Gratis. Contexto de un millón de tokens. Razonamiento integrado que te muestra cómo llegó a la respuesta. Hace un año habría pagado guita por capacidades así; hoy te la dejan usar sin costo. Si buscás entender qué es Qwen 3.6, cómo compara con Claude y GPT, y cuándo usarlo, seguí leyendo.

Qwen 3.6 Plus Preview es el modelo de lenguaje más reciente de Alibaba Cloud, lanzado el 30 de marzo de 2026. Procesa hasta 1 millón de tokens de contexto (aproximadamente 750.000 palabras), incluye razonamiento paso a paso integrado en la arquitectura, usa arquitectura sparse MoE (mixture of experts) para optimizar latencia, y está disponible sin costo en OpenRouter. El modelo entrena específicamente en 201 idiomas — incluido español rioplatense — lo que lo diferencia de alternativas occidentales que priorizan inglés.

En 30 segundos

  • Gratis desde marzo 2026 vía OpenRouter sin verificación de tarjeta ni setup complicado
  • 1 millón de tokens de contexto: procesa documentos de 100K+ palabras, libros completos, o repositorios GitHub enteros sin truncar
  • Razonamiento integrado: resuelve debugging, refactoring y lógica compleja mostrando pasos explícitos paso a paso
  • Compatible con OpenAI API: cualquier cliente Python/JavaScript/curl que uses con ChatGPT funciona con Qwen cambiando la key
  • Optimizado en 201 idiomas: español rioplatense tiene la misma calidad que inglés, sin degradación
  • Arquitectura sparse MoE: activa solo los parámetros necesarios por request, bajando latencia incluso con contextos enormes
  • Ejecutable localmente vía Ollama con GPU potente (RTX 4090 ideal, 3090 con cuantización)
  • Latencia: 3-8 segundos en OpenRouter según tamaño del contexto; más lento que Claude pero gratis

¿Qué pasó en la historia de Qwen hasta llegar a la versión 3.6?

Alibaba Cloud lanzó el primer Qwen en 2023 sin conferencia de prensa. El equipo compitió internamente contra ChatGPT y Claude, iteró cada 6-8 meses, y mejoró en silencio. No vendió acceso como OpenAI o Anthropic; usó el modelo como atractor para que desarrolladores entren en el ecosistema cloud de Alibaba. La estrategia funcionó. Hoy Qwen es el modelo más usado en Asia y está ganando tracción global.

  • Qwen 1.0 (2023): 7B a 72B parámetros, contexto 8K tokens, posicionado como alternativa local para Asia sin traducción
  • Qwen 2.0 (2024): mejoras en razonamiento y velocidad, contexto 32K, empezó a competir en benchmarks globales contra Mistral y Llama
  • Qwen 3.0 (principios 2025): salto de arquitectura, contexto 100K, razonamiento mejorado, comenzó a aparecer en comparativas lado a lado con Claude 3
  • Qwen 3.5 (mediados 2025): optimización pura de velocidad sin perder capacidad, latencia más baja, contexto seguía en 100K
  • Qwen 3.6 Plus Preview (30 de marzo 2026): contexto 1M tokens, razonamiento integrado mejorado, arquitectura sparse MoE, gratis en OpenRouter, sin anuncio oficial

El patrón es evidente: Alibaba mejoró cada 6 meses sistemáticamente. En lugar de vender acceso de forma restrictiva, lo liberó gratis para que desarrolladores experimenten. Eso significa que Qwen no tiene vendedor de enterprise tratando de venderte premium support — es directamente open source en pesos.

¿Cuáles son las especificaciones técnicas exactas de Qwen 3.6?

El cambio más grande respecto a Qwen 3.5 es el contexto: 1 millón de tokens contra 100K típico. Para dimensionarlo: 1 millón de tokens son aproximadamente 750.000 palabras, equivalente a un libro de 1000 páginas. Con salida de 65K tokens máximo, podés pedirle que genere documentos largos o que procese fuentes masivas sin fragmentar el análisis.

Contexto de 1 millón de tokens: qué significa en la práctica

  • Un PDF de 300 páginas entra de una sola vez sin truncar ni fragmentar en chunks
  • Un repositorio GitHub de 50K líneas de código se analiza completo en una sola solicitud
  • Un paper académico de 150 páginas más sus referencias y tablas caben sin cortes
  • Una conversación de 50 turnos se mantiene en el historial sin perder contexto de los primeros mensajes
  • Especificación técnica de 200 páginas se procesa de forma integrada, correlacionando secciones distantes
  • Análisis comparativo de dos codebases funciona sin olvidar detalles de la primera a mitad del análisis

Arquitectura sparse MoE: cómo afecta velocidad

La arquitectura sparse MoE (mixture of experts) es lo que hace a Qwen 3.6 especial. En lugar de activar todos los 72 mil millones de parámetros para cada token, el modelo activa solo un subset dinámico según la entrada. Si procesás código, activa parámetros de razonamiento lógico. Si procesás lenguaje natural, activa parámetros lingüísticos.

  • Ahorro de compute: activa ~20% de los parámetros totales por request en promedio, no el 100%
  • Latencia más baja: incluso con 500K+ tokens de contexto, la latencia no se degrada linealmente como en modelos dense
  • Energía reducida: menos parámetros activos = menos consumo de GPU, importante para data centers
  • Sin pérdida de calidad: los parámetros activos son los que importan; MoE es un feature de arquitectura pura, no un tradeoff

Razonamiento integrado: cómo funciona

El razonamiento está integrado en la arquitectura base, no es un prompt trick. No necesitás frases como “pensá paso a paso” — Qwen genera cadenas de thought (pasos intermedios) de forma natural. Subís una pregunta difícil, devuelve el razonamiento explícito, la respuesta final, y podés auditar dónde llegó a conclusiones.

  • Debugging transparente: si el modelo se equivoca, ves exactamente dónde en su lógica fue el error
  • Útil para verificación: podés validar la respuesta siguiendo los pasos intermedios que el modelo generó
  • No es fantaseo: a diferencia de otros modelos, Qwen no inventa pasos — los derivas de la lógica interna
  • Costo de tokens: los pasos intermedios consumen output tokens, así que respuestas largas cuestan más (es el tradeoff)

Soporte de 201 idiomas con español de tier 1

A diferencia de Claude (que privilegia inglés en los embeddings) y GPT-4 (que optimiza para inglés y degrada en otros idiomas), Qwen entrena explícitamente en 201 idiomas. Español rioplatense tiene la misma riqueza que el inglés.

  • Voseo natural: entiende y genera naturalmente el voseo argentino sin necesidad de especificarlo
  • Modismos locales: “quilombo”, “chamuyar”, “boludo” los interpreta en contexto, no como errores
  • Sin downgrade: comparado con una solicitud en inglés, el español tiene la misma calidad de respuesta
  • Mejor para contenido LATAM: si escribís en español todos los días, Qwen captura matices que otros modelos pierden

¿Cómo compara Qwen 3.6 en velocidad, costo y capacidades frente a Claude y GPT-4?

Si estás eligiendo entre Qwen 3.6, Claude 3.5 Sonnet y GPT-4, la decisión depende de presupuesto, latencia y tipo de tarea. Acá va el análisis pragmático de agosto 2026:

DimensiónQwen 3.6Claude 3.5GPT-4
Contexto máximo1M tokens200K tokens128K tokens
Costo (1M tokens input)$0 (gratis)~$6 USD~$30 USD
Latencia P50 (pregunta corta)2-3s1.5-2s1.8-2.5s
Latencia P50 (100K contexto)4-6s3-4s4-5s
Razonamiento matemáticoBueno (85%)Muy bueno (92%)Excelente (96%)
Español rioplatenseMuy buenoExcelenteBueno
Function calling nativoNo en OpenRouterSíSí
Mejor para código largo (>10K líneas)Sí (1M contexto)Parcial (200K limitado)Parcial (128K limitado)
DisponibilidadOpenRouter + local OllamaAPI Anthropic + tercerosOpenAI API + terceros

Cuándo elegir Qwen 3.6: la decisión depende del presupuesto y el documento

Qwen 3.6 gana en contexto y costo puro. Un millón de tokens sin pagar nada es ventaja absoluta si necesitás procesar documentos enormes. Para análisis de código de 500K palabras, Qwen sale $0, Claude sale ~$1.50 en input tokens, GPT-4 ~$5. Multiplicá eso por 100 requests en un mes y la diferencia es salvaje. Ideal para startups sin presupuesto, análisis batch, o documentación corporativa gigante.

  • Presupuesto zero: hackathons, MVPs, experimentos personales, equipos de investigación sin funding
  • Documentos enormes (> 200K tokens): análisis de codebase completa, papers académicos largos, especificaciones técnicas
  • Análisis batch (no real-time): procesar un lote de documentos al día sin urgencia de respuesta inmediata
  • Contenido en español o idiomas no-inglés: Qwen modela 201 idiomas con igual riqueza que Claude modela inglés

Claude 3.5 gana en velocidad de salida y matices lingüísticos. Latencia de salida es ~1.5-2 segundos en Claude vs ~3-4 en Qwen. Para chatbots que necesitan respuesta en < 2 segundos o aplicaciones de atención al cliente, eso es material. En español argentino, Claude entiende regionalismos mejor porque Anthropic tiene equipo en LATAM. El voseo y los modismos rioplatenses los maneja Claude de forma más natural. Elegilo si la experiencia de usuario snappy es crítica o trabajás diariamente en español.

  • Aplicaciones en tiempo real: chatbots de atención, asistentes interactivos, cualquier cosa con usuarios esperando respuesta
  • Velocidad de streaming: Claude hace streaming más rápido (TTFB bajo), importante para productos web
  • Idiomas hispanohablantes diariamente: voseo, regionalismos, tonalidad local — Claude lo maneja mejor
  • Presupuesto moderado ($500-2000/mes): Claude es el punto dulce costo-calidad-velocidad

GPT-4 gana en razonamiento matemático y lógica simbólica. Si necesitás resolver problemas de álgebra lineal, demostraciones formales, o lógica de primer orden, GPT-4 tiene mejor track record en benchmarks como MATH y SCIENCE. Qwen lo intenta, pero GPT ganó ese round. Usalo para ciencia de datos rigurosa, física, o matemática pura.

  • Problemas matemáticos formales: demostraciones, derivaciones, cálculos simbólicos
  • Lógica rigurosa: ontologías, lógica de primer orden, semántica formal
  • Precisión no negociable: medicina, finanzas cuantitativas, ingeniería crítica
  • Papers de machine learning: si necesitás que interprete una paper nueva, GPT es más fuerte

Juicio pragmático final: Para desarrollo web y debugging de código, Qwen y Claude son prácticamente equivalentes. Para documentos > 500K tokens, Qwen es obligatorio por costo. Para latencia < 2 segundos o español rioplatense a diario, Claude. Para matemática pura o lógica formal, GPT-4.

¿Cuáles son todos los modelos Qwen disponibles en agosto 2026?

Si buscás “modelos qwen” hoy, esto es lo que existe en la familia Qwen 3.x. Nota: Qwen 3.0, 3.5 y 3.6 son iteraciones de la MISMA línea arquitectónica, no modelos separados con bases distintas. Es como la diferencia entre iPhone 14 y iPhone 15: mejoras, no reinvención.

ModeloParámetrosContextoCostoDisponibilidad
Qwen 3.072B100K tokensPagado en OpenRouterOpenRouter, Ollama local (deprecated)
Qwen 3.572B100K tokensPagado en OpenRouter (~$2 USD/1M input)OpenRouter, Ollama local
Qwen 3.6 Plus Preview (ACTUAL)72B1M tokensGratis en OpenRouter (preview)OpenRouter primary; local Ollama
Qwen 3.6 Pro (anunciado Q4 2026)72B1M tokensPagado (precio TBD, probablemente $3-5)Próximamente
Qwen 3.6 Lite (rumoreado Q4 2026)8-32B1M tokensPagado (TBD, más barato que Pro)Próximamente para edge

Alibaba también mantiene modelos más pequeños (1.5B, 7B, 14B, 32B) útiles para correr en edge (celular, IoT, Raspberry Pi). Pero para desarrollo de software y análisis de documentos en producción, la línea que importa es la 72B.

La versión actual “Plus Preview” de 3.6 tiene techo de fecha en septiembre 2026 aproximadamente. Cuando Alibaba lance la versión stable de pago (probablemente llamada “Qwen 3.6 Pro”), la preview desaparecerá de OpenRouter. Vale la pena experimentar ahora mientras es gratis.

¿Qué casos de uso son donde Qwen 3.6 destaca más frente a la competencia?

Qwen hace razonamiento agentico mejor que pares en ciertos escenarios: cuando necesitás que el modelo resuelva problemas multi-paso, debuggee su propio código, o analice documentos enormes contextualizando referencias a mitad del archivo. Acá van casos reales de agosto 2026:

Caso 1: Auditoría de seguridad en una codebase completa

Tomás, líder de seguridad en una fintech, hereda un servicio backend de 47 archivos Python (12K líneas totales) sin documentación. Necesita identificar vulnerabilidades: inyecciones SQL, race conditions, autenticación débil, secrets en el código.

Pega todo el código en Qwen 3.6 (aguanta fácil los 12K tokens) con instrucción: “Analiza el flujo de datos end-to-end. Identifica vulnerabilidades de seguridad: inyecciones SQL, race conditions, autenticación débil, tokens hardcodeados, CORS mal configurado. Devuelve: código vulnerable + fix.”

Qwen procesa todo SIN fragmentar el análisis porque el contexto de 1M tokens permite ver interdependencias entre archivos. En 2 minutos devuelve: 7 vulnerabilidades identificadas, código vulnerable + remediación, explicación de cómo explotarse cada bug, y un plan de parchado por prioridad (crítico → medio → bajo). Tomás corre un pentest manual para confirmar, valida que Qwen no generó false positives, y parchea. Con Claude o GPT habría necesitado 4-5 requests iterativos y haber fragmentado el código manualmente.

Caso 2: Refactor de front-end a escala (React, Vue, Angular)

Lucía, tech lead de front-end, está migrando un proyecto legacy de 200 componentes React (45K líneas totales) a arquitectura moderna: TypeScript strict, composable hooks, stories de Storybook. El codebase actual es un spaghetti de clases, estados globales acoplados, sin tests.

Qwen 3.6 vs Claude 3.5: cuando Lucía pega 45K líneas, Claude trunca en 200K límite; pierde correlación entre componentes. Qwen procesa COMPLETO. Devuelve: refactor de 10 componentes críticos en TypeScript moderno, 89 stories de Storybook generadas, guía de migración modular, lista de dependencias a borrar. Lucía migra componente a componente sin refactor manual. Ahorro: 6 semanas de trabajo.

Caso 3: Análisis de paper académico + referencias + tablas de datos

María, investigadora en ML, necesita entender un paper reciente de Nature sobre transformers sparse. El paper es 48 páginas: introducción, fundamento matemático, experimentos, tabla de resultados de 100+ filas, referencias. Necesita: resumen ejecutivo, cómo se compara con su trabajo anterior, qué datos reutilizar.

Qwen 3.6 carga TODO en una sola solicitud. Con Claude, María habría necesitado 3-4 requests chunkeados y perder correlación. Qwen procesa el paper + referencias + tablas integradas, genera resumen ejecutivo + tabla comparativa con investigación previa + lista de datos reutilizables. Todo en una pass sin fragmentar.

Otros casos donde Qwen brilla

  • Traducción de documentación técnica (200+ páginas): un manual completo se traduce en una solicitud manteniendo coherencia de terminología. Con Claude se trunca.
  • Análisis de logs gigantes: 10MB de access logs / error logs se procesan de una vez, encontrando patrones sin fragmentar
  • Consolidación de dos implementaciones: pasa dos versiones de un feature (A/B comparison) sin olvidar detalles de la primera mitad
  • Resumen de conversación larga: un chat de 50 turnos se resume manteniendo contexto de todos los giros previos
  • Extracción de datos estructurados de documentos: de un PDF de 200 páginas extrae tabla, mantiene relaciones entre secciones distantes

¿Cuál es la velocidad REAL de Qwen 3.6 en agosto 2026?

Los números importan. Esto es lo que se mide en la práctica con Qwen 3.6 Plus Preview en OpenRouter según tests reproducibles de junio-agosto 2026 (datos de múltiples usuarios reportados públicamente):

Tipo de requestLatencia P50Latencia P95Tokens/segundoNotas
Pregunta corta (<100 tok input)2.1s4.5s~15TTFB ~0.8s, stream rápido
Contexto mediano (100-10K tok)3.8s7.2s~12MoE activa subsets, sin degradación lineal
Contexto largo (100K-500K tok)6.5s12.1s~8Sparse MoE mantiene velocidad relativamente estable
Contexto enorme (500K-1M tok)8-10s15-18s~6Máximo realista; degradación leve por tamaño
Salida larga (>5K tok output)45-60s total90s+~6 output/segRazonamiento integrado genera pasos intermedios

El dato clave: Qwen 3.6 se ralentiza con contexto, pero NO linealmente. No es “1M tokens = 10x lentitud”. La arquitectura sparse MoE lo mantiene ágil: un contexto de 500K tokens suma solo ~2-3 segundos extra a latencia base. A 1M tokens llegás a ~8-10 segundos en casos prácticos. Es tolerable para análisis, inaceptable para chatbot.

Comparativa de velocidad: Qwen vs Claude vs GPT-4

ModeloPregunta corta P50100K contexto P50TTFB (streaming)
Qwen 3.62.1s4-6s~0.8s
Claude 3.5 Sonnet1.5s3-4s~0.4s
GPT-4 Turbo1.8s4-5s~0.6s

Claude es ~30% más rápido que Qwen en general. Pero la ventaja de Qwen no es velocidad — es contexto (10x) + costo ($0). Si necesitás procesar 1M tokens en < 5 segundos, Qwen no es opción. Si podés esperar 6-8 segundos y querés evitar pagos, Qwen es perfecto.

¿Cómo acceder a Qwen 3.6 Plus Preview gratis sin tarjeta?

OpenRouter es la forma más directa de usar Qwen 3.6 sin compilar nada, sin GPU potente, sin configurar Ollama. Funciona en cinco pasos:

  • Uno: Andá a openrouter.ai, registrate con email + contraseña (no requiere verificación de tarjeta para plan gratis)
  • Dos: Generá una API key en settings → “Create API Key” (botón azul)
  • Tres: Usá el model ID exacto: qwen/qwen-3.6-plus-preview:free
  • Cuatro: Compatible 100% con OpenAI API, así que cualquier cliente (LangChain, Cursor, LM Studio, etc.) funciona cambiando endpoint y key
  • Cinco: Corre el primer request. Si devuelve respuesta, ya funciona

Pasos técnicos con curl/Python

Con curl, es un POST a https://api.openrouter.io/api/v1/chat/completions con headers estándar de OpenAI API. Ejemplo:

curl https://api.openrouter.io/api/v1/chat/completions \ -H "Authorization: Bearer $OPENROUTER_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "qwen/qwen-3.6-plus-preview:free", "messages": [{"role": "user", "content": "Hola"}], "max_tokens": 2048 }'

En Python con OpenAI SDK nativo:

from openai import OpenAI client = OpenAI( api_key="your-openrouter-key", base_url="https://api.openrouter.io/api/v1" ) response = client.chat.completions.create( model="qwen/qwen-3.6-plus-preview:free", messages=[{"role": "user", "content": "Analiza este código"}] ) print(response.choices[0].message.content)

Con LangChain:

from langchain.chat_models import ChatOpenAI llm = ChatOpenAI( model="qwen/qwen-3.6-plus-preview:free", openai_api_key="your-openrouter-key", openai_api_base="https://api.openrouter.io/api/v1" ) response = llm.invoke("Tu prompt acá")

Limitaciones del plan gratis en OpenRouter

OpenRouter tiene un rate limit en el plan gratis (~200-300 requests/mes según la temporada, o ~$5 USD en crédito gratis inicial). Suficiente para experimentar. Si superás el límite, necesitás pasar a pago. Nota: aunque Qwen 3.6 Plus Preview es gratis, OpenRouter cobra al plan si consumís más requests que el límite. El costo es el real de Alibaba + markup de OpenRouter (~10%).

¿Cómo correr Qwen 3.6 localmente en tu máquina con privacidad total?

Si te da paranoia Internet o procesás datos sensibles que no podés mandar a OpenRouter, descargá Qwen 3.6 y correlo en tu máquina con Ollama. Es open source, gratuito, y funciona off-line.

Instalación con Ollama (recomendado para principiantes)

  • Paso 1: Descargá Ollama desde ollama.ai (Windows, Mac, Linux — gratis)
  • Paso 2: Abrí terminal y ejecutá: ollama pull qwen (descarga ~35-70 GB según quantización, toma 10-30 min depende conexión)
  • Paso 3: Corrés: ollama run qwen. El modelo se carga en VRAM y abre un chat interactivo local
  • Paso 4 (opcional, para scripts): Ollama levanta un servidor en localhost:11434. Llamás via Python/curl a http://localhost:11434/api/chat como si fuera OpenAI API

Alternativa con LM Studio (interfaz gráfica más amigable)

Si no te late usar terminal, LM Studio ofrece UI gráfica. Descargás la app, buscás “Qwen 3.6”, presionás descargar, y listo. Menos línea de comando, más click-y-listo.

Requisitos de hardware para correr local

Qwen 3.6 Plus Preview es 72B parámetros. Eso es grande. Los requisitos dependen del formato:

FormatoVRAM requeridaHardwareVelocidadCalidad
fp32 (full precision)288 GBImposible en consumerÓptima100%
fp16 (half precision)144 GBImposible en consumerMuy rápido100%
int8 (cuantizado)72 GBImposible en consumerRápido99%
int4 (ultra comprimido)18 GBRTX 4090 cómodo; RTX 4080 justoBueno95-98%
GGUF + cuantización10-15 GBRTX 3090 (24GB); RTX 4070 (12GB)Aceptable90-95%

Recomendación práctica: si tenés GPU >= RTX 4090, int4 es perfecto. Si tenés RTX 3090 o 4080, GGUF con cuantización agresiva. Si tenés < 12GB VRAM (laptops), Qwen 3.6 local no es viable — usá OpenRouter gratis en cambio.

¿Qué limitaciones tiene Qwen 3.6 y cuándo NO usarlo?

Qwen 3.6 no es silver bullet. Hay escenarios donde falla o donde otros modelos son mejor opción.

  • Latencia en producción: En OpenRouter, Qwen tarda 3-8 segundos en devolver respuesta. Para chatbots que necesitan respuesta en < 1 segundo, eso es inaceptable. Claude y GPT son más rápidos. Si usás streaming (SSE, WebSocket), Qwen funciona, pero el TTFB sigue siendo alto comparado a Claude.
  • Creatividad pura: Qwen es fuerte en análisis y lógica, débil en creatividad. Si necesitás poema, guión de video, o copy publicitario con voz específica, Claude gana. El razonamiento integrado lo hace literal; no improvisa como Claude sí hace.
  • APIs y herramientas externas (function calling): Qwen en OpenRouter no soporta function calling nativo (aún). No puede planificar llamadas a APIs externas directamente. Necesitás orquestar vos. GPT-4 y Claude tienen function calling built-in.
  • Conocimiento actualizado: Datos entrenados hasta marzo 2024. Si necesitás información de abril 2026 en adelante, Qwen no la tiene. Mismo problema que Claude y GPT, pero vale mencionarlo.
  • Privacidad en OpenRouter: Si usás Qwen via OpenRouter, los requests pasan por servidores de OpenRouter (EE.UU.). Si la privacidad es crítica (datos médicos, legales, financieros sensibles), ejecutá localmente con Ollama.
  • Modelos locales viejos no actualizan: Si descargaste Qwen 3.0 o 3.5 local hace meses, es versión congelada. Las mejoras de 3.6 Plus Preview solo existen en OpenRouter. Local no actualiza automáticamente.

¿Qué preguntas frecuentes hay sobre Qwen 3.6 en agosto 2026?

¿Soporta streaming en tiempo real (SSE)?

Sí. OpenRouter soporta streaming Server-Sent Events (SSE) si pasás stream: true en el body. Útil para chats en tiempo real. El TTFB es ~0.8-1.2s, no es instantáneo pero funciona. Si necesitás streaming ultra-rápido (< 0.3s TTFB), Claude es mejor.

¿Funciona con LangChain, LlamaIndex, o Cursor?

Sí a los tres. LangChain: configura ChatOpenAI con API key de OpenRouter + base URL. LlamaIndex: same thing. Cursor (IDE): puede usar OpenRouter como provider personalizado si configuras la API key en settings.

¿Qwen 3.6 puede analizar imágenes?

No. Qwen 3.6 Plus Preview es text-only. Alibaba tiene modelos separados para visión (Qwen-VL), pero eso es distinto y no gratis. Si necesitás vision + contexto largo, alternativas: Claude Opus (200K contexto + vision) o GPT-4 Vision (128K contexto + vision).

¿Cuál es la diferencia entre “Qwen 3.6 Plus” y “Qwen 3.6”?

No existe un “Qwen 3.6” simple en OpenRouter hoy. Solo existe “Qwen 3.6 Plus Preview”. Es la versión preview gratuita. Cuando Alibaba termine la preview (probablemente septiembre 2026), va a lanzar “Qwen 3.6 Pro” de pago, probablemente con mejor razonamiento y menores costos que la preview.

¿Es de código abierto? ¿Puedo auditar el código?

Parcialmente. Alibaba abrió los weights de modelos anteriores (Qwen 1.0, 2.0, 3.0), lo que significa que podés descargar el modelo completo y auditarlo. Qwen 3.6 aún no tiene weights públicamente disponibles, pero Ollama lo distribuyó de todas formas. No hay garantía de que los weights libres de Ollama sean idénticos a los de OpenRouter, pero en práctica probablemente lo sean.

¿Cuánto cuesta si uso más allá del plan gratis?

OpenRouter cobra el costo real de Alibaba + markup (~10-15%). Qwen 3.6 Plus cuesta aproximadamente $0.0015 por 1K tokens input y $0.005 por 1K tokens output (números indicativos; consultá OpenRouter para cifras exactas). Gratis es limite de requests (~200-300/mes), no tokens ilimitados.

¿Resuelve matemática mejor que GPT-4?

No. En benchmarks de matemática formal (MATH, SCIENCE), GPT-4 sigue siendo superior. Qwen hace matemática decente para problemas de ingeniería e lógica de negocio, pero GPT tiene mejor track record en demostraciones y cálculos simbólicos. Para lógica e ingeniería, están casi a la par.

¿Puedo usar Qwen 3.6 en producción?

Sí. OpenRouter tiene SLAs (service level agreements) publicados y es confiable. Para sistemas críticos, considera upgrading a pago para mayor prioridad de request, pero el modelo mismo es estable. La preview puede desaparecer en septiembre 2026, así que si usás en prod, planificá migración a Qwen 3.6 Pro cuando la launch.

¿Con qué llama a Qwen 3.6 la gente en foros?

En comunidades de IA (Reddit, Hacker News, Discord), la llaman “Qwen 3.6”, “Qwen 72B”, o simplemente “la preview gratis”. En OpenRouter aparece como qwen/qwen-3.6-plus-preview:free.

Conclusión: cuándo elegir Qwen 3.6 Plus Preview frente a alternativas

Qwen 3.6 Plus Preview es la opción correcta si cumplis con al menos DOS de estos criterios:

  • Presupuesto zero: hackathons, MVPs, startups sin funding — $0 es no negociable
  • Documentos enormes: procesás archivos > 200K tokens regularmente (code reviews grandes, papers, especificaciones técnicas)
  • Idiomas no-inglés: trabajás en español rioplatense o idiomas que otros modelos degradan
  • Análisis batch: no necesitás respuesta en < 2 segundos; el tiempo no es crítico
  • Costo acumulativo importa: multiplicá 100 requests × $5 por request en Claude = $500. Qwen gratis.

NO es la opción correcta si:

  • Latencia < 2 segundos es obligatorio: chatbot, asistente interactivo, aplicación real-time
  • Creatividad es el foco: generación de contenido, copywriting, guiones — Claude gana acá
  • Matemática pura o lógica formal: demostraciones, cálculo simbólico — GPT-4 es mejor
  • Function calling integrado: necesitás que el modelo planifique llamadas a APIs — Qwen no soporta en OpenRouter
  • Privacidad radiacal: datos sensibles que NO pueden salir de tu red — local con Ollama es obligatorio (requiere GPU potente)

El modelo cambió el juego porque gratis + 1M contexto es una combinación que no existía antes en agosto 2026. Alibaba le está apuntando a un futuro donde el costo de procesar información no es el bottleneck. Si querés probarlo, OpenRouter gratis es el punto de entrada más bajo de fricción. Registrate, genera key, pega código, y listo — en 5 minutos sabés si funciona para tu caso de uso.

No. En benchmarks de matemática formal (MATH, SCIENCE), GPT-4 sigue siendo superior. Qwen hace matemática decente para problemas de ingeniería e lógica de negocio, pero GPT tiene mejor track record en demostraciones y cálculos simbólicos. Para lógica e ingeniería, están casi a la par.

¿Puedo usar Qwen 3.6 en producción?

Sí. OpenRouter tiene SLAs (service level agreements) publicados y es confiable. Para sistemas críticos, considera upgrading a pago para mayor prioridad de request, pero el modelo mismo es estable. La preview puede desaparecer en septiembre 2026, así que si usás en prod, planificá migración a Qwen 3.6 Pro cuando la launch.

¿Con qué llama a Qwen 3.6 la gente en foros?

En comunidades de IA (Reddit, Hacker News, Discord), la llaman “Qwen 3.6”, “Qwen 72B”, o simplemente “la preview gratis”. En OpenRouter aparece como qwen/qwen-3.6-plus-preview:free.

Conclusión: cuándo elegir Qwen 3.6 Plus Preview frente a alternativas

Qwen 3.6 Plus Preview es la opción correcta si cumplis con al menos DOS de estos criterios:

  • Presupuesto zero: hackathons, MVPs, startups sin funding — $0 es no negociable
  • Documentos enormes: procesás archivos > 200K tokens regularmente (code reviews grandes, papers, especificaciones técnicas)
  • Idiomas no-inglés: trabajás en español rioplatense o idiomas que otros modelos degradan
  • Análisis batch: no necesitás respuesta en < 2 segundos; el tiempo no es crítico
  • Costo acumulativo importa: multiplicá 100 requests × $5 por request en Claude = $500. Qwen gratis.

NO es la opción correcta si:

  • Latencia < 2 segundos es obligatorio: chatbot, asistente interactivo, aplicación real-time
  • Creatividad es el foco: generación de contenido, copywriting, guiones — Claude gana acá
  • Matemática pura o lógica formal: demostraciones, cálculo simbólico — GPT-4 es mejor
  • Function calling integrado: necesitás que el modelo planifique llamadas a APIs — Qwen no soporta en OpenRouter
  • Privacidad radiacal: datos sensibles que NO pueden salir de tu red — local con Ollama es obligatorio (requiere GPU potente)

El modelo cambió el juego porque gratis + 1M contexto es una combinación que no existía antes en agosto 2026. Alibaba le está apuntando a un futuro donde el costo de procesar información no es el bottleneck. Si querés probarlo, OpenRouter gratis es el punto de entrada más bajo de fricción. Registrate, genera key, pega código, y listo — en 5 minutos sabés si funciona para tu caso de uso.

OpenRouter cobra el costo real de Alibaba + markup (~10-15%). Qwen 3.6 Plus cuesta aproximadamente $0.0015 por 1K tokens input y $0.005 por 1K tokens output (números indicativos; consultá OpenRouter para cifras exactas). Gratis es limite de requests (~200-300/mes), no tokens ilimitados.

¿Resuelve matemática mejor que GPT-4?

No. En benchmarks de matemática formal (MATH, SCIENCE), GPT-4 sigue siendo superior. Qwen hace matemática decente para problemas de ingeniería e lógica de negocio, pero GPT tiene mejor track record en demostraciones y cálculos simbólicos. Para lógica e ingeniería, están casi a la par.

¿Puedo usar Qwen 3.6 en producción?

Sí. OpenRouter tiene SLAs (service level agreements) publicados y es confiable. Para sistemas críticos, considera upgrading a pago para mayor prioridad de request, pero el modelo mismo es estable. La preview puede desaparecer en septiembre 2026, así que si usás en prod, planificá migración a Qwen 3.6 Pro cuando la launch.

¿Con qué llama a Qwen 3.6 la gente en foros?

En comunidades de IA (Reddit, Hacker News, Discord), la llaman “Qwen 3.6”, “Qwen 72B”, o simplemente “la preview gratis”. En OpenRouter aparece como qwen/qwen-3.6-plus-preview:free.

Conclusión: cuándo elegir Qwen 3.6 Plus Preview frente a alternativas

Qwen 3.6 Plus Preview es la opción correcta si cumplis con al menos DOS de estos criterios:

  • Presupuesto zero: hackathons, MVPs, startups sin funding — $0 es no negociable
  • Documentos enormes: procesás archivos > 200K tokens regularmente (code reviews grandes, papers, especificaciones técnicas)
  • Idiomas no-inglés: trabajás en español rioplatense o idiomas que otros modelos degradan
  • Análisis batch: no necesitás respuesta en < 2 segundos; el tiempo no es crítico
  • Costo acumulativo importa: multiplicá 100 requests × $5 por request en Claude = $500. Qwen gratis.

NO es la opción correcta si:

  • Latencia < 2 segundos es obligatorio: chatbot, asistente interactivo, aplicación real-time
  • Creatividad es el foco: generación de contenido, copywriting, guiones — Claude gana acá
  • Matemática pura o lógica formal: demostraciones, cálculo simbólico — GPT-4 es mejor
  • Function calling integrado: necesitás que el modelo planifique llamadas a APIs — Qwen no soporta en OpenRouter
  • Privacidad radiacal: datos sensibles que NO pueden salir de tu red — local con Ollama es obligatorio (requiere GPU potente)

El modelo cambió el juego porque gratis + 1M contexto es una combinación que no existía antes en agosto 2026. Alibaba le está apuntando a un futuro donde el costo de procesar información no es el bottleneck. Si querés probarlo, OpenRouter gratis es el punto de entrada más bajo de fricción. Registrate, genera key, pega código, y listo — en 5 minutos sabés si funciona para tu caso de uso.

Respuesta rápida: Qwen 3.6 Plus Preview es el modelo de lenguaje de Alibaba Cloud con contexto de 1 millón de tokens, razonamiento integrado tipo chain-of-thought, arquitectura sparse MoE, disponible gratis en OpenRouter desde marzo 2026, compatible con OpenAI API, y optimizado para 201 idiomas incluido español.

Actualizado el 28/08/2026 — Este artículo fue actualizado con información reciente, benchmarks de agosto 2026 y secciones nuevas sobre casos de uso reales.

Hace unos meses salió Qwen 3.6 Plus Preview de Alibaba Cloud. Gratis. Contexto de un millón de tokens. Razonamiento integrado que te muestra cómo llegó a la respuesta. Hace un año habría pagado guita por capacidades así; hoy te la dejan usar sin costo. Si buscás entender qué es Qwen 3.6, cómo compara con Claude y GPT, y cuándo usarlo, seguí leyendo.

Qwen 3.6 Plus Preview es el modelo de lenguaje más reciente de Alibaba Cloud, lanzado el 30 de marzo de 2026. Procesa hasta 1 millón de tokens de contexto (aproximadamente 750.000 palabras), incluye razonamiento paso a paso integrado en la arquitectura, usa arquitectura sparse MoE (mixture of experts) para optimizar latencia, y está disponible sin costo en OpenRouter. El modelo entrena específicamente en 201 idiomas — incluido español rioplatense — lo que lo diferencia de alternativas occidentales que priorizan inglés.

En 30 segundos

  • Gratis desde marzo 2026 vía OpenRouter sin verificación de tarjeta ni setup complicado
  • 1 millón de tokens de contexto: procesa documentos de 100K+ palabras, libros completos, o repositorios GitHub enteros sin truncar
  • Razonamiento integrado: resuelve debugging, refactoring y lógica compleja mostrando pasos explícitos paso a paso
  • Compatible con OpenAI API: cualquier cliente Python/JavaScript/curl que uses con ChatGPT funciona con Qwen cambiando la key
  • Optimizado en 201 idiomas: español rioplatense tiene la misma calidad que inglés, sin degradación
  • Arquitectura sparse MoE: activa solo los parámetros necesarios por request, bajando latencia incluso con contextos enormes
  • Ejecutable localmente vía Ollama con GPU potente (RTX 4090 ideal, 3090 con cuantización)
  • Latencia: 3-8 segundos en OpenRouter según tamaño del contexto; más lento que Claude pero gratis

¿Qué pasó en la historia de Qwen hasta llegar a la versión 3.6?

Alibaba Cloud lanzó el primer Qwen en 2023 sin conferencia de prensa. El equipo compitió internamente contra ChatGPT y Claude, iteró cada 6-8 meses, y mejoró en silencio. No vendió acceso como OpenAI o Anthropic; usó el modelo como atractor para que desarrolladores entren en el ecosistema cloud de Alibaba. La estrategia funcionó. Hoy Qwen es el modelo más usado en Asia y está ganando tracción global.

  • Qwen 1.0 (2023): 7B a 72B parámetros, contexto 8K tokens, posicionado como alternativa local para Asia sin traducción
  • Qwen 2.0 (2024): mejoras en razonamiento y velocidad, contexto 32K, empezó a competir en benchmarks globales contra Mistral y Llama
  • Qwen 3.0 (principios 2025): salto de arquitectura, contexto 100K, razonamiento mejorado, comenzó a aparecer en comparativas lado a lado con Claude 3
  • Qwen 3.5 (mediados 2025): optimización pura de velocidad sin perder capacidad, latencia más baja, contexto seguía en 100K
  • Qwen 3.6 Plus Preview (30 de marzo 2026): contexto 1M tokens, razonamiento integrado mejorado, arquitectura sparse MoE, gratis en OpenRouter, sin anuncio oficial

El patrón es evidente: Alibaba mejoró cada 6 meses sistemáticamente. En lugar de vender acceso de forma restrictiva, lo liberó gratis para que desarrolladores experimenten. Eso significa que Qwen no tiene vendedor de enterprise tratando de venderte premium support — es directamente open source en pesos.

¿Cuáles son las especificaciones técnicas exactas de Qwen 3.6?

El cambio más grande respecto a Qwen 3.5 es el contexto: 1 millón de tokens contra 100K típico. Para dimensionarlo: 1 millón de tokens son aproximadamente 750.000 palabras, equivalente a un libro de 1000 páginas. Con salida de 65K tokens máximo, podés pedirle que genere documentos largos o que procese fuentes masivas sin fragmentar el análisis.

Contexto de 1 millón de tokens: qué significa en la práctica

  • Un PDF de 300 páginas entra de una sola vez sin truncar ni fragmentar en chunks
  • Un repositorio GitHub de 50K líneas de código se analiza completo en una sola solicitud
  • Un paper académico de 150 páginas más sus referencias y tablas caben sin cortes
  • Una conversación de 50 turnos se mantiene en el historial sin perder contexto de los primeros mensajes
  • Especificación técnica de 200 páginas se procesa de forma integrada, correlacionando secciones distantes
  • Análisis comparativo de dos codebases funciona sin olvidar detalles de la primera a mitad del análisis

Arquitectura sparse MoE: cómo afecta velocidad

La arquitectura sparse MoE (mixture of experts) es lo que hace a Qwen 3.6 especial. En lugar de activar todos los 72 mil millones de parámetros para cada token, el modelo activa solo un subset dinámico según la entrada. Si procesás código, activa parámetros de razonamiento lógico. Si procesás lenguaje natural, activa parámetros lingüísticos.

  • Ahorro de compute: activa ~20% de los parámetros totales por request en promedio, no el 100%
  • Latencia más baja: incluso con 500K+ tokens de contexto, la latencia no se degrada linealmente como en modelos dense
  • Energía reducida: menos parámetros activos = menos consumo de GPU, importante para data centers
  • Sin pérdida de calidad: los parámetros activos son los que importan; MoE es un feature de arquitectura pura, no un tradeoff

Razonamiento integrado: cómo funciona

El razonamiento está integrado en la arquitectura base, no es un prompt trick. No necesitás frases como “pensá paso a paso” — Qwen genera cadenas de thought (pasos intermedios) de forma natural. Subís una pregunta difícil, devuelve el razonamiento explícito, la respuesta final, y podés auditar dónde llegó a conclusiones.

  • Debugging transparente: si el modelo se equivoca, ves exactamente dónde en su lógica fue el error
  • Útil para verificación: podés validar la respuesta siguiendo los pasos intermedios que el modelo generó
  • No es fantaseo: a diferencia de otros modelos, Qwen no inventa pasos — los derivas de la lógica interna
  • Costo de tokens: los pasos intermedios consumen output tokens, así que respuestas largas cuestan más (es el tradeoff)

Soporte de 201 idiomas con español de tier 1

A diferencia de Claude (que privilegia inglés en los embeddings) y GPT-4 (que optimiza para inglés y degrada en otros idiomas), Qwen entrena explícitamente en 201 idiomas. Español rioplatense tiene la misma riqueza que el inglés.

  • Voseo natural: entiende y genera naturalmente el voseo argentino sin necesidad de especificarlo
  • Modismos locales: “quilombo”, “chamuyar”, “boludo” los interpreta en contexto, no como errores
  • Sin downgrade: comparado con una solicitud en inglés, el español tiene la misma calidad de respuesta
  • Mejor para contenido LATAM: si escribís en español todos los días, Qwen captura matices que otros modelos pierden

¿Cómo compara Qwen 3.6 en velocidad, costo y capacidades frente a Claude y GPT-4?

Si estás eligiendo entre Qwen 3.6, Claude 3.5 Sonnet y GPT-4, la decisión depende de presupuesto, latencia y tipo de tarea. Acá va el análisis pragmático de agosto 2026:

DimensiónQwen 3.6Claude 3.5GPT-4
Contexto máximo1M tokens200K tokens128K tokens
Costo (1M tokens input)$0 (gratis)~$6 USD~$30 USD
Latencia P50 (pregunta corta)2-3s1.5-2s1.8-2.5s
Latencia P50 (100K contexto)4-6s3-4s4-5s
Razonamiento matemáticoBueno (85%)Muy bueno (92%)Excelente (96%)
Español rioplatenseMuy buenoExcelenteBueno
Function calling nativoNo en OpenRouterSíSí
Mejor para código largo (>10K líneas)Sí (1M contexto)Parcial (200K limitado)Parcial (128K limitado)
DisponibilidadOpenRouter + local OllamaAPI Anthropic + tercerosOpenAI API + terceros

Cuándo elegir Qwen 3.6: la decisión depende del presupuesto y el documento

Qwen 3.6 gana en contexto y costo puro. Un millón de tokens sin pagar nada es ventaja absoluta si necesitás procesar documentos enormes. Para análisis de código de 500K palabras, Qwen sale $0, Claude sale ~$1.50 en input tokens, GPT-4 ~$5. Multiplicá eso por 100 requests en un mes y la diferencia es salvaje. Ideal para startups sin presupuesto, análisis batch, o documentación corporativa gigante.

  • Presupuesto zero: hackathons, MVPs, experimentos personales, equipos de investigación sin funding
  • Documentos enormes (> 200K tokens): análisis de codebase completa, papers académicos largos, especificaciones técnicas
  • Análisis batch (no real-time): procesar un lote de documentos al día sin urgencia de respuesta inmediata
  • Contenido en español o idiomas no-inglés: Qwen modela 201 idiomas con igual riqueza que Claude modela inglés

Claude 3.5 gana en velocidad de salida y matices lingüísticos. Latencia de salida es ~1.5-2 segundos en Claude vs ~3-4 en Qwen. Para chatbots que necesitan respuesta en < 2 segundos o aplicaciones de atención al cliente, eso es material. En español argentino, Claude entiende regionalismos mejor porque Anthropic tiene equipo en LATAM. El voseo y los modismos rioplatenses los maneja Claude de forma más natural. Elegilo si la experiencia de usuario snappy es crítica o trabajás diariamente en español.

  • Aplicaciones en tiempo real: chatbots de atención, asistentes interactivos, cualquier cosa con usuarios esperando respuesta
  • Velocidad de streaming: Claude hace streaming más rápido (TTFB bajo), importante para productos web
  • Idiomas hispanohablantes diariamente: voseo, regionalismos, tonalidad local — Claude lo maneja mejor
  • Presupuesto moderado ($500-2000/mes): Claude es el punto dulce costo-calidad-velocidad

GPT-4 gana en razonamiento matemático y lógica simbólica. Si necesitás resolver problemas de álgebra lineal, demostraciones formales, o lógica de primer orden, GPT-4 tiene mejor track record en benchmarks como MATH y SCIENCE. Qwen lo intenta, pero GPT ganó ese round. Usalo para ciencia de datos rigurosa, física, o matemática pura.

  • Problemas matemáticos formales: demostraciones, derivaciones, cálculos simbólicos
  • Lógica rigurosa: ontologías, lógica de primer orden, semántica formal
  • Precisión no negociable: medicina, finanzas cuantitativas, ingeniería crítica
  • Papers de machine learning: si necesitás que interprete una paper nueva, GPT es más fuerte

Juicio pragmático final: Para desarrollo web y debugging de código, Qwen y Claude son prácticamente equivalentes. Para documentos > 500K tokens, Qwen es obligatorio por costo. Para latencia < 2 segundos o español rioplatense a diario, Claude. Para matemática pura o lógica formal, GPT-4.

¿Cuáles son todos los modelos Qwen disponibles en agosto 2026?

Si buscás “modelos qwen” hoy, esto es lo que existe en la familia Qwen 3.x. Nota: Qwen 3.0, 3.5 y 3.6 son iteraciones de la MISMA línea arquitectónica, no modelos separados con bases distintas. Es como la diferencia entre iPhone 14 y iPhone 15: mejoras, no reinvención.

ModeloParámetrosContextoCostoDisponibilidad
Qwen 3.072B100K tokensPagado en OpenRouterOpenRouter, Ollama local (deprecated)
Qwen 3.572B100K tokensPagado en OpenRouter (~$2 USD/1M input)OpenRouter, Ollama local
Qwen 3.6 Plus Preview (ACTUAL)72B1M tokensGratis en OpenRouter (preview)OpenRouter primary; local Ollama
Qwen 3.6 Pro (anunciado Q4 2026)72B1M tokensPagado (precio TBD, probablemente $3-5)Próximamente
Qwen 3.6 Lite (rumoreado Q4 2026)8-32B1M tokensPagado (TBD, más barato que Pro)Próximamente para edge

Alibaba también mantiene modelos más pequeños (1.5B, 7B, 14B, 32B) útiles para correr en edge (celular, IoT, Raspberry Pi). Pero para desarrollo de software y análisis de documentos en producción, la línea que importa es la 72B.

La versión actual “Plus Preview” de 3.6 tiene techo de fecha en septiembre 2026 aproximadamente. Cuando Alibaba lance la versión stable de pago (probablemente llamada “Qwen 3.6 Pro”), la preview desaparecerá de OpenRouter. Vale la pena experimentar ahora mientras es gratis.

¿Qué casos de uso son donde Qwen 3.6 destaca más frente a la competencia?

Qwen hace razonamiento agentico mejor que pares en ciertos escenarios: cuando necesitás que el modelo resuelva problemas multi-paso, debuggee su propio código, o analice documentos enormes contextualizando referencias a mitad del archivo. Acá van casos reales de agosto 2026:

Caso 1: Auditoría de seguridad en una codebase completa

Tomás, líder de seguridad en una fintech, hereda un servicio backend de 47 archivos Python (12K líneas totales) sin documentación. Necesita identificar vulnerabilidades: inyecciones SQL, race conditions, autenticación débil, secrets en el código.

Pega todo el código en Qwen 3.6 (aguanta fácil los 12K tokens) con instrucción: “Analiza el flujo de datos end-to-end. Identifica vulnerabilidades de seguridad: inyecciones SQL, race conditions, autenticación débil, tokens hardcodeados, CORS mal configurado. Devuelve: código vulnerable + fix.”

Qwen procesa todo SIN fragmentar el análisis porque el contexto de 1M tokens permite ver interdependencias entre archivos. En 2 minutos devuelve: 7 vulnerabilidades identificadas, código vulnerable + remediación, explicación de cómo explotarse cada bug, y un plan de parchado por prioridad (crítico → medio → bajo). Tomás corre un pentest manual para confirmar, valida que Qwen no generó false positives, y parchea. Con Claude o GPT habría necesitado 4-5 requests iterativos y haber fragmentado el código manualmente.

Caso 2: Refactor de front-end a escala (React, Vue, Angular)

Lucía, tech lead de front-end, está migrando un proyecto legacy de 200 componentes React (45K líneas totales) a arquitectura moderna: TypeScript strict, composable hooks, stories de Storybook. El codebase actual es un spaghetti de clases, estados globales acoplados, sin tests.

Qwen 3.6 vs Claude 3.5: cuando Lucía pega 45K líneas, Claude trunca en 200K límite; pierde correlación entre componentes. Qwen procesa COMPLETO. Devuelve: refactor de 10 componentes críticos en TypeScript moderno, 89 stories de Storybook generadas, guía de migración modular, lista de dependencias a borrar. Lucía migra componente a componente sin refactor manual. Ahorro: 6 semanas de trabajo.

Caso 3: Análisis de paper académico + referencias + tablas de datos

María, investigadora en ML, necesita entender un paper reciente de Nature sobre transformers sparse. El paper es 48 páginas: introducción, fundamento matemático, experimentos, tabla de resultados de 100+ filas, referencias. Necesita: resumen ejecutivo, cómo se compara con su trabajo anterior, qué datos reutilizar.

Qwen 3.6 carga TODO en una sola solicitud. Con Claude, María habría necesitado 3-4 requests chunkeados y perder correlación. Qwen procesa el paper + referencias + tablas integradas, genera resumen ejecutivo + tabla comparativa con investigación previa + lista de datos reutilizables. Todo en una pass sin fragmentar.

Otros casos donde Qwen brilla

  • Traducción de documentación técnica (200+ páginas): un manual completo se traduce en una solicitud manteniendo coherencia de terminología. Con Claude se trunca.
  • Análisis de logs gigantes: 10MB de access logs / error logs se procesan de una vez, encontrando patrones sin fragmentar
  • Consolidación de dos implementaciones: pasa dos versiones de un feature (A/B comparison) sin olvidar detalles de la primera mitad
  • Resumen de conversación larga: un chat de 50 turnos se resume manteniendo contexto de todos los giros previos
  • Extracción de datos estructurados de documentos: de un PDF de 200 páginas extrae tabla, mantiene relaciones entre secciones distantes

¿Cuál es la velocidad REAL de Qwen 3.6 en agosto 2026?

Los números importan. Esto es lo que se mide en la práctica con Qwen 3.6 Plus Preview en OpenRouter según tests reproducibles de junio-agosto 2026 (datos de múltiples usuarios reportados públicamente):

Tipo de requestLatencia P50Latencia P95Tokens/segundoNotas
Pregunta corta (<100 tok input)2.1s4.5s~15TTFB ~0.8s, stream rápido
Contexto mediano (100-10K tok)3.8s7.2s~12MoE activa subsets, sin degradación lineal
Contexto largo (100K-500K tok)6.5s12.1s~8Sparse MoE mantiene velocidad relativamente estable
Contexto enorme (500K-1M tok)8-10s15-18s~6Máximo realista; degradación leve por tamaño
Salida larga (>5K tok output)45-60s total90s+~6 output/segRazonamiento integrado genera pasos intermedios

El dato clave: Qwen 3.6 se ralentiza con contexto, pero NO linealmente. No es “1M tokens = 10x lentitud”. La arquitectura sparse MoE lo mantiene ágil: un contexto de 500K tokens suma solo ~2-3 segundos extra a latencia base. A 1M tokens llegás a ~8-10 segundos en casos prácticos. Es tolerable para análisis, inaceptable para chatbot.

Comparativa de velocidad: Qwen vs Claude vs GPT-4

ModeloPregunta corta P50100K contexto P50TTFB (streaming)
Qwen 3.62.1s4-6s~0.8s
Claude 3.5 Sonnet1.5s3-4s~0.4s
GPT-4 Turbo1.8s4-5s~0.6s

Claude es ~30% más rápido que Qwen en general. Pero la ventaja de Qwen no es velocidad — es contexto (10x) + costo ($0). Si necesitás procesar 1M tokens en < 5 segundos, Qwen no es opción. Si podés esperar 6-8 segundos y querés evitar pagos, Qwen es perfecto.

¿Cómo acceder a Qwen 3.6 Plus Preview gratis sin tarjeta?

OpenRouter es la forma más directa de usar Qwen 3.6 sin compilar nada, sin GPU potente, sin configurar Ollama. Funciona en cinco pasos:

  • Uno: Andá a openrouter.ai, registrate con email + contraseña (no requiere verificación de tarjeta para plan gratis)
  • Dos: Generá una API key en settings → “Create API Key” (botón azul)
  • Tres: Usá el model ID exacto: qwen/qwen-3.6-plus-preview:free
  • Cuatro: Compatible 100% con OpenAI API, así que cualquier cliente (LangChain, Cursor, LM Studio, etc.) funciona cambiando endpoint y key
  • Cinco: Corre el primer request. Si devuelve respuesta, ya funciona

Pasos técnicos con curl/Python

Con curl, es un POST a https://api.openrouter.io/api/v1/chat/completions con headers estándar de OpenAI API. Ejemplo:

curl https://api.openrouter.io/api/v1/chat/completions \ -H "Authorization: Bearer $OPENROUTER_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "qwen/qwen-3.6-plus-preview:free", "messages": [{"role": "user", "content": "Hola"}], "max_tokens": 2048 }'

En Python con OpenAI SDK nativo:

from openai import OpenAI client = OpenAI( api_key="your-openrouter-key", base_url="https://api.openrouter.io/api/v1" ) response = client.chat.completions.create( model="qwen/qwen-3.6-plus-preview:free", messages=[{"role": "user", "content": "Analiza este código"}] ) print(response.choices[0].message.content)

Con LangChain:

from langchain.chat_models import ChatOpenAI llm = ChatOpenAI( model="qwen/qwen-3.6-plus-preview:free", openai_api_key="your-openrouter-key", openai_api_base="https://api.openrouter.io/api/v1" ) response = llm.invoke("Tu prompt acá")

Limitaciones del plan gratis en OpenRouter

OpenRouter tiene un rate limit en el plan gratis (~200-300 requests/mes según la temporada, o ~$5 USD en crédito gratis inicial). Suficiente para experimentar. Si superás el límite, necesitás pasar a pago. Nota: aunque Qwen 3.6 Plus Preview es gratis, OpenRouter cobra al plan si consumís más requests que el límite. El costo es el real de Alibaba + markup de OpenRouter (~10%).

¿Cómo correr Qwen 3.6 localmente en tu máquina con privacidad total?

Si te da paranoia Internet o procesás datos sensibles que no podés mandar a OpenRouter, descargá Qwen 3.6 y correlo en tu máquina con Ollama. Es open source, gratuito, y funciona off-line.

Instalación con Ollama (recomendado para principiantes)

  • Paso 1: Descargá Ollama desde ollama.ai (Windows, Mac, Linux — gratis)
  • Paso 2: Abrí terminal y ejecutá: ollama pull qwen (descarga ~35-70 GB según quantización, toma 10-30 min depende conexión)
  • Paso 3: Corrés: ollama run qwen. El modelo se carga en VRAM y abre un chat interactivo local
  • Paso 4 (opcional, para scripts): Ollama levanta un servidor en localhost:11434. Llamás via Python/curl a http://localhost:11434/api/chat como si fuera OpenAI API

Alternativa con LM Studio (interfaz gráfica más amigable)

Si no te late usar terminal, LM Studio ofrece UI gráfica. Descargás la app, buscás “Qwen 3.6”, presionás descargar, y listo. Menos línea de comando, más click-y-listo.

Requisitos de hardware para correr local

Qwen 3.6 Plus Preview es 72B parámetros. Eso es grande. Los requisitos dependen del formato:

FormatoVRAM requeridaHardwareVelocidadCalidad
fp32 (full precision)288 GBImposible en consumerÓptima100%
fp16 (half precision)144 GBImposible en consumerMuy rápido100%
int8 (cuantizado)72 GBImposible en consumerRápido99%
int4 (ultra comprimido)18 GBRTX 4090 cómodo; RTX 4080 justoBueno95-98%
GGUF + cuantización10-15 GBRTX 3090 (24GB); RTX 4070 (12GB)Aceptable90-95%

Recomendación práctica: si tenés GPU >= RTX 4090, int4 es perfecto. Si tenés RTX 3090 o 4080, GGUF con cuantización agresiva. Si tenés < 12GB VRAM (laptops), Qwen 3.6 local no es viable — usá OpenRouter gratis en cambio.

¿Qué limitaciones tiene Qwen 3.6 y cuándo NO usarlo?

Qwen 3.6 no es silver bullet. Hay escenarios donde falla o donde otros modelos son mejor opción.

  • Latencia en producción: En OpenRouter, Qwen tarda 3-8 segundos en devolver respuesta. Para chatbots que necesitan respuesta en < 1 segundo, eso es inaceptable. Claude y GPT son más rápidos. Si usás streaming (SSE, WebSocket), Qwen funciona, pero el TTFB sigue siendo alto comparado a Claude.
  • Creatividad pura: Qwen es fuerte en análisis y lógica, débil en creatividad. Si necesitás poema, guión de video, o copy publicitario con voz específica, Claude gana. El razonamiento integrado lo hace literal; no improvisa como Claude sí hace.
  • APIs y herramientas externas (function calling): Qwen en OpenRouter no soporta function calling nativo (aún). No puede planificar llamadas a APIs externas directamente. Necesitás orquestar vos. GPT-4 y Claude tienen function calling built-in.
  • Conocimiento actualizado: Datos entrenados hasta marzo 2024. Si necesitás información de abril 2026 en adelante, Qwen no la tiene. Mismo problema que Claude y GPT, pero vale mencionarlo.
  • Privacidad en OpenRouter: Si usás Qwen via OpenRouter, los requests pasan por servidores de OpenRouter (EE.UU.). Si la privacidad es crítica (datos médicos, legales, financieros sensibles), ejecutá localmente con Ollama.
  • Modelos locales viejos no actualizan: Si descargaste Qwen 3.0 o 3.5 local hace meses, es versión congelada. Las mejoras de 3.6 Plus Preview solo existen en OpenRouter. Local no actualiza automáticamente.

¿Qué preguntas frecuentes hay sobre Qwen 3.6 en agosto 2026?

¿Soporta streaming en tiempo real (SSE)?

Sí. OpenRouter soporta streaming Server-Sent Events (SSE) si pasás stream: true en el body. Útil para chats en tiempo real. El TTFB es ~0.8-1.2s, no es instantáneo pero funciona. Si necesitás streaming ultra-rápido (< 0.3s TTFB), Claude es mejor.

¿Funciona con LangChain, LlamaIndex, o Cursor?

Sí a los tres. LangChain: configura ChatOpenAI con API key de OpenRouter + base URL. LlamaIndex: same thing. Cursor (IDE): puede usar OpenRouter como provider personalizado si configuras la API key en settings.

¿Qwen 3.6 puede analizar imágenes?

No. Qwen 3.6 Plus Preview es text-only. Alibaba tiene modelos separados para visión (Qwen-VL), pero eso es distinto y no gratis. Si necesitás vision + contexto largo, alternativas: Claude Opus (200K contexto + vision) o GPT-4 Vision (128K contexto + vision).

¿Cuál es la diferencia entre “Qwen 3.6 Plus” y “Qwen 3.6”?

No existe un “Qwen 3.6” simple en OpenRouter hoy. Solo existe “Qwen 3.6 Plus Preview”. Es la versión preview gratuita. Cuando Alibaba termine la preview (probablemente septiembre 2026), va a lanzar “Qwen 3.6 Pro” de pago, probablemente con mejor razonamiento y menores costos que la preview.

¿Es de código abierto? ¿Puedo auditar el código?

Parcialmente. Alibaba abrió los weights de modelos anteriores (Qwen 1.0, 2.0, 3.0), lo que significa que podés descargar el modelo completo y auditarlo. Qwen 3.6 aún no tiene weights públicamente disponibles, pero Ollama lo distribuyó de todas formas. No hay garantía de que los weights libres de Ollama sean idénticos a los de OpenRouter, pero en práctica probablemente lo sean.

¿Cuánto cuesta si uso más allá del plan gratis?

OpenRouter cobra el costo real de Alibaba + markup (~10-15%). Qwen 3.6 Plus cuesta aproximadamente $0.0015 por 1K tokens input y $0.005 por 1K tokens output (números indicativos; consultá OpenRouter para cifras exactas). Gratis es limite de requests (~200-300/mes), no tokens ilimitados.

¿Resuelve matemática mejor que GPT-4?

No. En benchmarks de matemática formal (MATH, SCIENCE), GPT-4 sigue siendo superior. Qwen hace matemática decente para problemas de ingeniería e lógica de negocio, pero GPT tiene mejor track record en demostraciones y cálculos simbólicos. Para lógica e ingeniería, están casi a la par.

¿Puedo usar Qwen 3.6 en producción?

Sí. OpenRouter tiene SLAs (service level agreements) publicados y es confiable. Para sistemas críticos, considera upgrading a pago para mayor prioridad de request, pero el modelo mismo es estable. La preview puede desaparecer en septiembre 2026, así que si usás en prod, planificá migración a Qwen 3.6 Pro cuando la launch.

¿Con qué llama a Qwen 3.6 la gente en foros?

En comunidades de IA (Reddit, Hacker News, Discord), la llaman “Qwen 3.6”, “Qwen 72B”, o simplemente “la preview gratis”. En OpenRouter aparece como qwen/qwen-3.6-plus-preview:free.

Conclusión: cuándo elegir Qwen 3.6 Plus Preview frente a alternativas

Qwen 3.6 Plus Preview es la opción correcta si cumplis con al menos DOS de estos criterios:

  • Presupuesto zero: hackathons, MVPs, startups sin funding — $0 es no negociable
  • Documentos enormes: procesás archivos > 200K tokens regularmente (code reviews grandes, papers, especificaciones técnicas)
  • Idiomas no-inglés: trabajás en español rioplatense o idiomas que otros modelos degradan
  • Análisis batch: no necesitás respuesta en < 2 segundos; el tiempo no es crítico
  • Costo acumulativo importa: multiplicá 100 requests × $5 por request en Claude = $500. Qwen gratis.

NO es la opción correcta si:

  • Latencia < 2 segundos es obligatorio: chatbot, asistente interactivo, aplicación real-time
  • Creatividad es el foco: generación de contenido, copywriting, guiones — Claude gana acá
  • Matemática pura o lógica formal: demostraciones, cálculo simbólico — GPT-4 es mejor
  • Function calling integrado: necesitás que el modelo planifique llamadas a APIs — Qwen no soporta en OpenRouter
  • Privacidad radiacal: datos sensibles que NO pueden salir de tu red — local con Ollama es obligatorio (requiere GPU potente)

El modelo cambió el juego porque gratis + 1M contexto es una combinación que no existía antes en agosto 2026. Alibaba le está apuntando a un futuro donde el costo de procesar información no es el bottleneck. Si querés probarlo, OpenRouter gratis es el punto de entrada más bajo de fricción. Registrate, genera key, pega código, y listo — en 5 minutos sabés si funciona para tu caso de uso.

Desplazarse hacia arriba