Actualizado el 06/08/2026 — Este artículo fue actualizado con información reciente, secciones nuevas sobre el modelo de negocio de DeepSeek, comparativa técnica V4 Pro vs Flash y casos de uso con cálculos reales de tokens.
En pocas palabras: Para usar DeepSeek V4 Flash gratis tenés cinco vías: chat web sin registro, API con 5 millones de tokens gratis por 30 días sin tarjeta, OpenRouter, Cursor con tu clave y Ollama Cloud. La ventana de contexto llega a 1 millón de tokens por consulta. El modelo es barato por arquitectura MoE y por la estrategia de DeepSeek de captar desarrollo global.
En 30 segundos
- Chat web sin registro: entrás a deepseek.com y escribís, sin crear cuenta.
- 5 millones de tokens gratis en la API: válidos 30 días, sin cargar tarjeta.
- Contexto de 1 millón de tokens por consulta: entra un repo entero o varios PDFs largos.
- Cursor IDE y OpenRouter: dos formas de meterlo en tu flujo de código gratis.
- Ollama Cloud: corrés deepseek-v4-flash:cloud sin bajarte los 160 GB del modelo.
- Precios pagos: USD 0,14 por millón de tokens entrada, USD 0,28 salida (el más barato del mercado).
Si venías bancando una suscripción para probar modelos de IA, esto te cambia el cálculo. DeepSeek soltó la versión Flash el 24 de abril de 2026 y, a diferencia de otros lanzamientos donde el “free tier” es casi decorativo, acá hay margen de sobra para hacer pruebas serias antes de poner un peso. El modelo está optimizado para ser rápido y económico, no para resolver problemas de razonamiento profundo. Eso lo convierte en ideal para producción cotidiana si sabés sus límites.
¿Qué es DeepSeek V4 Flash y cómo funciona técnicamente?
DeepSeek V4 Flash es el modelo de lenguaje liviano de DeepSeek, con arquitectura MoE (mezcla de expertos) y una ventana de contexto de hasta 1 millón de tokens por consulta. Está pensado para tareas cotidianas, codificación y generación de contenido, y prioriza velocidad y costo bajo frente a la versión Pro. Es la opción de entrada del catálogo, no el modelo tope. La arquitectura MoE es lo que lo hace tan barato: en vez de activar todos los parámetros en cada consulta, enciende solo los “expertos” que hacen falta. Eso es lo que le permite ser barato y rápido sin caerse a pedazos en tareas comunes.
El modelo tiene aproximadamente 236 mil millones de parámetros totales, pero solo activa unos 21 mil millones por token (según la documentación de DeepSeek). Eso significa que cada consulta consume menos poder computacional que un modelo denso de tamaño equivalente. Ponele que le tirás un correo para redactar, un resumen de un PDF de 80 páginas o un refactor de una función en Python: ahí Flash rinde bárbaro.
¿Por qué DeepSeek regala créditos de IA? El modelo de negocio detrás
La pregunta obvia: ¿por qué DeepSeek ofrece 5 millones de tokens gratis sin tarjeta? No es caridad. Es una apuesta geopolítica y de mercado. DeepSeek es una empresa china que buscó entrar en el mercado global de IA con un golpe de efecto: publicar un modelo open-source potente y regalar créditos API para atrapar desarrolladores de todo el mundo. Si millones de devs en Argentina, Brasil, Europa y EE.UU. empiezan a usar DeepSeek en sus proyectos, después es mucho más difícil migrar a OpenAI o Anthropic. Es el juego de Red Hat o Ubuntu: ganás usuarios early con algo gratis, después monetizás infraestructura o servicios premium.
Para DeepSeek, regalar 5 millones de tokens por usuario nuevo es un costo de adquisición manejable, especialmente porque el modelo es tan eficiente que generarlo les sale barato. Una vez que tenés usuarios, pedís dinero por volumen, por garantías de rate, por servicio empresarial o por tener los modelos hosted en infraestructura de ellos. Ya pasó con Docker, con Kubernetes, con VSCode. El patrón es viejo pero funciona.
DeepSeek V4 Flash vs DeepSeek V4 Pro: diferencias técnicas que importan
El confusing es que hay dos versiones de V4: Flash y Pro. La diferencia no es menor. V4 Pro está optimizado para razonamiento profundo, cadenas lógicas largas y matemática compleja. Tiene una ventana de contexto igual de grande (1 millón de tokens), pero consume más recursos y tarda más en responder. Flash, en cambio, es para velocidad y volumen.
| Característica | V4 Flash | V4 Pro |
|---|---|---|
| Tokens entrada (por millón) | USD 0,14 | USD 0,55 |
| Tokens salida (por millón) | USD 0,28 | USD 2,19 |
| Latencia típica | 0,5-2 segundos | 2-8 segundos |
| Contexto máximo | 1 millón tokens | 1 millón tokens |
| Mejor para | Volumen, velocidad, tareas simples | Razonamiento pesado, análisis profundo |
| Tier gratuito | 5M tokens 30 días | No disponible gratis |
En palabras concretas: si necesitás razonar sobre matemática, hacer análisis lógico complejo o resolver un problema que requiere múltiples pasos de pensamiento encadenado, Flash se va a quedar corto. V4 Pro es para eso. Flash es para generar textos, completar código, resumir documentos, refactorizar funciones y tareas donde la velocidad importa más que la profundidad.
Cómo acceder a DeepSeek V4 Flash gratis: los 5 métodos comparados
Cada método sirve para algo distinto. El chat web es para probar rápido, la API es para construir, Cursor es para programar y Ollama es para tener control. Elegir bien te ahorra horas de configuración.
| Método | Costo | ¿Registro? | ¿Tarjeta? | Tokens incluidos | Interfaz | Mejor para |
|---|---|---|---|---|---|---|
| Chat web | Gratis | No | No | Uso interactivo | Navegador | Pruebas rápidas, sin compromiso |
| API DeepSeek | Gratis 30 días | Sí | No | 5 millones | REST / SDK | Integración en apps/scripts |
| OpenRouter | Gratis (tier free) | Sí | No | Según límites del proveedor | API unificada | Comparar múltiples modelos |
| Cursor IDE (BYOK) | Gratis con tu clave | Sí (DeepSeek) | No | Los 5M de tu API | Editor de código | Programación con asistencia |
| Ollama Cloud | Gratis (tier) | Sí | No | Según plan | CLI local | Privacidad, control total |
La diferencia clave: el chat web no consume tu cuota de API, porque es un servicio aparte. La API, Cursor y los SDK sí comparten esos 5 millones de tokens. Tenelo en la cabeza para no quemar la cuota sin querer.
Chat web: la forma más rápida de probar DeepSeek V4 Flash sin registro
Es el camino más corto. Entrás a deepseek.com (o a la variante en español deepseek-espanol.chat), elegís el modelo Flash y escribís. Listo. No te piden mail ni tarjeta, y no necesitás cuenta de DeepSeek. Cada conversación es anónima; si cerrás la pestaña, desaparece.
- Resumir documentos largos: pegás el texto o subís el archivo y pedís un resumen ejecutivo en cinco bullets.
- Redactar correos y respuestas: le dás contexto y tono, y te devuelve un borrador usable.
- Generar ideas: brainstorming de títulos, enfoques o estructuras, que después vos depurás.
- Traducir contenido: pasá un párrafo en inglés y pedí traducción natural al español rioplatense.
- Explicar código: pegá una función compleja y pedí que te explique en términos simples.
Un consejo que casi nadie aplica: sé específico con el formato de salida. En vez de “resumime esto”, pedí “resumime esto en 5 bullets, cada uno de máximo 15 palabras, en español rioplatense”. El resultado mejora muchísimo. La interfaz web tiene un límite: no la vas a automatizar ni conectar a tu app. Para eso, seguí leyendo.
API DeepSeek: cómo obtener los 5 millones de tokens gratis sin tarjeta
Acá está lo bueno para quien programa. Creás una cuenta en la plataforma de API de DeepSeek (https://api-docs.deepseek.com), generás una API key y arrancás. No te piden tarjeta para el tier gratuito, que según la documentación viene con 5 millones de tokens válidos por 30 días a partir de la activación de tu cuenta.
El flujo básico en Python es directo: instalás el SDK de OpenAI (DeepSeek usa una API compatible), apuntás el base_url al endpoint de DeepSeek, pegás tu key y mandás el mensaje. Si alguna vez llamaste a la API de OpenAI, esto te va a resultar idéntico, porque cambiás dos líneas (la URL y la clave) y el resto del código queda igual, sin reescribir nada.
- Instalá el cliente de OpenAI:
pip install openai - Generá tu API key: entrá a tu panel de DeepSeek y creá una key. Copiala y guardala en un .env seguro.
- Apuntá el endpoint: el base_url es https://api.deepseek.com/v1 (distinto del de OpenAI).
- Hacé una consulta de prueba: mandá un mensaje simple para verificar que anda.
- Monitoreá uso: cada semana entrá al dashboard para ver cuántos tokens consumiste.
¿Y cuándo se termina lo gratis? Cuando se acaban los 5 millones o pasan los 30 días, lo que ocurra primero. Después pasás a precios por uso: según el tarifario oficial, ronda los USD 0,14 por millón de tokens de entrada y USD 0,28 por millón de salida. Hay un detalle que vale plata: los “cache hits” (cuando reusás contexto ya procesado) salen bastante más barato. Si tu app repite prompts largos, eso te baja la factura sin que toques una sola línea de lógica.
Caching de contexto: cómo ahorrar tokens en consultas recurrentes
DeepSeek tiene una feature que casi nadie usa pero es un game-changer de costo: prompt caching. Si mandás el mismo contexto en múltiples consultas, DeepSeek cachea eso a nivel de infraestructura y cobra 90% menos por acceder al cache que por procesar el contenido nuevo.
Caso concreto: tenés una documentación de 200.000 tokens que usás diariamente para responder preguntas de clientes. Sin caching, cada consulta cuesta USD 0,028 (200k * 0,14 / 1M). Con caching, después de la primera consulta, las siguientes cuestan USD 0,0028 (la primera vez pagás full, después 10% del costo). Si hacés 100 consultas por día, el ahorro es de USD 2,52/día, o sea USD 75/mes. Eso sí: el cache dura 5 minutos entre consultas, así que sirve para patrones de uso repetido en ventanas cortas.
Integrar DeepSeek V4 Flash en Cursor IDE sin pagar nada
Cursor es un editor de código con IA adentro, y soporta BYOK (Bring Your Own Key). Traducido: usás tu API key gratuita de DeepSeek y no pagás nada extra por el modelo. La configuración es corta:
- Abrí los settings de Cursor (Ctrl+Shift+P, busca “Settings”).
- Navegá a “Models” o “API Providers”.
- Agregá DeepSeek como proveedor personalizado. La URL base es https://api.deepseek.com/v1, el modelo es deepseek-v4-flash.
- Pegá tu API key.
- Seleccioná V4 Flash como modelo activo para autocompletar y chat.
Para qué lo vas a usar: autocompletado, refactors, debugging y explicación de código ajeno. El autocompletar de Cursor con Flash es veloz, así que la experiencia no se siente degradada versus los modelos pagos. ¿Cuánto te duran 5 millones de tokens programando? Depende de cuánto contexto mandes, pero para un desarrollador que lo usa a diario en proyectos chicos o medianos, da para varias semanas tranquilo antes de tener que decidir si pagás. Eso sí: si le mandás el repo entero en cada consulta, lo quemás en días.
Correr DeepSeek V4 Flash en local con Ollama y privacidad
Acá hay que separar dos cosas que la gente mezcla. Una es bajar el modelo completo a tu máquina (pesa cerca de 160 GB, así que necesitás hardware serio, incluyendo GPU de mínimo 80 GB VRAM). La otra es Ollama Cloud, donde el modelo corre en infraestructura remota pero vos lo manejás desde la terminal como si fuera local.
El comando para la versión cloud es simple:
ollama run deepseek-v4-flash:cloudSi preferís una interfaz gráfica, DeepInfra, Replicate y herramientas como LM Studio son alternativas para gestionar el modelo sin pelearte con la línea de comandos. ¿Por qué alguien se haría el lío de autohostear un modelo tan pesado? Privacidad y control total. Si tus datos no pueden salir de tu infraestructura, si hay regulación que lo exige (GDPR, LGPD, leyes locales de protección de datos), o si tu empresa tiene políticas strict sobre dónde se procesan los datos, esta es la vía.
Ahora, correr un modelo de este tamaño en serio pide GPU con mucha VRAM, y eso no se resuelve en una notebook. Si vas a montar el modelo en un servidor propio para tu equipo, conviene un VPS o cloud con GPU de verdad. En Argentina, hay proveedores que ofrecen infraestructura de GPU accesible para desarrollo.
Limitaciones del tier gratuito que conviene tener claras
Lo gratis tiene letra chica, y mejor saberla antes que descubrirla a mitad de un proyecto.
- Los 5 millones no se renuevan solos: cuando se agotan, se agotan. No es una cuota mensual que vuelve. Después de los 30 días o cuando consumís los tokens, pasás a tarifa por uso.
- Validez de 30 días: aunque no uses los tokens, el reloj corre desde que activás la cuenta. Si te registrás el 1 de agosto, el 31 de agosto se vence aunque hayas usado solo 1 millón.
- Contexto ≠ tokens totales: que entre 1 millón de tokens por consulta no significa que tengas 1 millón gratis. Son cosas distintas. Una consulta con contexto de 800.000 tokens puede consumir bastante de tu cuota si el output es largo.
- Hay límites de rate: el tier free tiene topes de consultas por minuto (típicamente 20-30 RPM según DeepSeek), pensados para pruebas, no para producción a full.
- No hay SLA ni garantías: los créditos gratuitos no tienen acuerdo de nivel de servicio. Si el servicio cae, no hay compensación ni prioridad.
¿Cuándo conviene pagar? Cuando ya validaste que el modelo te sirve y necesitás volumen constante o garantías de rate. Mientras estés probando y prototipando, el tier gratis alcanza y sobra.
Casos de uso reales: cuántos tokens se gastan en la práctica
Los números importan cuando decidís qué método usar y cuánto te va a durar lo gratis. Acá van ejemplos concretos.
Caso 1: Resumir documentos largos
Consultante: mandás un PDF de 50 páginas (aproximadamente 50.000 tokens) y pedís un resumen ejecutivo de 500 palabras. Entrada: 50.000 tokens. Salida: 1.500 tokens (500 palabras * 3 tokens/palabra aproximadamente). Total por consulta: 53.000 tokens. Con 5 millones gratis, alcanza para 94 consultas de este tipo. Si hacés una por día, te dura más de 3 meses.
Caso 2: Programación diaria con Cursor
Dev full-stack: autocompletado + 3-4 consultas de debugging/refactoring por día. Cada interacción típica: 5.000 tokens de contexto (archivo + función + historial), 500 de output. Eso es 5.500 tokens/consulta * 3,5 consultas/día = 19.250 tokens/día. En 5 millones alcanza para 259 días, o sea 8,5 meses de trabajo diario. Abundante.
Caso 3: Generar contenido (como este artículo)
Redactor: escribir un artículo de 2.500 palabras con research y múltiples iteraciones. Primera consulta: brief + fuentes (15.000 tokens), output 3.000 palabras (9.000 tokens). Segunda: revisión y expansión, similar. Total: ~48.000 tokens por artículo. En 5 millones, alcanza para 104 artículos de este tamaño. Si escribís 10 por semana, te dura 10 semanas.
Errores comunes al usar DeepSeek V4 Flash gratis
- Confundir contexto con cuota: mandar prompts de 800.000 tokens “porque entran” y vaciar los 5 millones en seis consultas. El contexto grande es una capacidad, no un permiso para derrochar.
- Usar Flash para tareas de razonamiento pesado: después te quejás de que “alucina” en matemática compleja. Para eso está V4 Pro. Flash es para velocidad y volumen, no para lógica profunda.
- No revisar la fecha de expiración: activás la cuenta, te olvidás dos semanas, volvés y te quedan 16 días. El reloj de 30 días no espera a que la uses.
- Hardcodear la API key en el código: y subirla a un repo público. Usá variables de entorno siempre, sin excepción. Si sospechás que la key se expuso, regenerala desde el dashboard de DeepSeek inmediatamente.
- No monitorear la cuota: trabajar sin revisar cuánto consumiste hasta que de repente la API empieza a devolver errores de “insufficient tokens”.
- Mezclar métodos sin control: usás el chat web + la API + Cursor simultáneamente sin llevar registro, y no sabés por dónde se fue la plata.
Preguntas Frecuentes
¿Cómo usar DeepSeek V4 Flash sin pagar nada?
Tenés cinco formas: chat web en deepseek.com sin registrarte, API oficial con 5 millones de tokens gratis por 30 días (sin tarjeta), OpenRouter con tier free, Cursor IDE usando tu clave gratuita, u Ollama Cloud con plan gratuito. La más rápida es el chat web, la más poderosa es la API para integrar en tu app.
¿Cuántos tokens gratis regala DeepSeek V4 Flash en 2026?
La API entrega 5 millones de tokens gratuitos según la documentación oficial, válidos por 30 días desde la activación de la cuenta. El chat web es un servicio aparte de uso interactivo y no descuenta de esa cuota. Après de los 30 días o cuando se agotan los tokens, pagás por uso.
¿Cuánto cuesta DeepSeek V4 Flash cuando se acaba lo gratis?
Tras el tier gratuito, el precio ronda los USD 0,14 por millón de tokens de entrada y USD 0,28 por millón de salida, según el tarifario oficial. Eso hace que Flash sea uno de los modelos más baratos del mercado. Los cache hits salen 90% más barato, así que si reusás contexto, el costo baja mucho más.
¿Puedo integrar DeepSeek V4 Flash en mi IDE de código sin costo?
Sí. Cursor IDE soporta BYOK (tu clave personal), así que pegás tu API key gratuita de DeepSeek y usás el modelo para autocompletar, refactorizar y debuggear sin pagar extra. Consume de tus 5 millones de tokens gratis. Cursor es gratis en sí, pero la suscripción Cursor+ (Cmd-K ilimitado, mode chat mejorado) cuesta USD 20/mes; aún así, podés usar FlashV4 gratis en la versión free.
¿Qué diferencia hay entre el contexto de 1 millón y los tokens gratis?
El contexto de 1 millón es cuánto texto procesa el modelo en una sola consulta. Los 5 millones de tokens gratis son tu presupuesto total acumulado de input + output. Una consulta enorme puede consumir buena parte de tu cuota de una vez. Ejemplo: una consulta con 800.000 tokens de contexto + 5.000 de output = 805.000 tokens de tu cuota en UNA consulta.
¿Cuál es mejor: Flash o Pro?
Depende del caso. Flash es mejor si necesitás velocidad, volumen y costo bajo: generación de texto, código simple, resumenes, traducción. Pro es mejor si necesitás razonamiento profundo, análisis lógico complejo o resolución de matemática exigente. Pro es 4x más caro en entrada y 8x en salida, así que usalo solo cuando Flash no da.
Conclusión
DeepSeek V4 Flash bajó la barrera de entrada a casi cero. Entre el chat web sin registro y los 5 millones de tokens de API sin tarjeta, tenés margen real para probar el modelo en serio antes de decidir si pagás. El modelo está pensado para producción (velocidad, costo bajo) pero no para problemas de razonamiento profundo; si sabés eso, lo sacás mucho provecho.
La jugada concreta: arrancá por el chat web para tantear si el modelo te sirve, y si te convence, pasá a la API gratuita para meterlo en tu código vía Cursor o tus propios scripts. Cuidá la cuota (no confundas contexto con presupuesto), vigilá los 30 días y monitoreá uso cada semana. Si llegás al tope y el modelo te rinde, recién ahí evaluás el plan pago, que con USD 0,14 por millón de entrada sigue siendo de los más baratos del mercado. Y si en algún momento necesitás razonamiento pesado, ahí rotás a V4 Pro para ese caso específico.
Fuentes
- DeepSeek — sitio oficial y chat web
- DeepSeek API Docs — pricing y tier gratuito
- DeepSeek en español — ficha de V4 Flash
- OpenRouter — acceso a DeepSeek V4 Flash
- DeepInfra — hosting del modelo V4 Flash
Cómo funciona
- Identificá tu método de acceso gratuito: Elegí entre la interfaz web sin registro, la API oficial con crédito de 5 millones de tokens por 30 días (sin tarjeta de crédito), OpenRouter como proxy, Cursor con tu clave personal o Ollama Cloud. Cada vía tiene sus ventajas según si necesitás chatear, integrar código, programar con asistencia o privacidad total.
- Configurá el entorno según el canal: Si vas por API, generá tu key desde el panel de DeepSeek y configurala como variable de entorno (DEEPSEEK_API_KEY). Para Cursor, entrás a Settings > Models y pegás la clave en el campo de provider personalizado (base URL: https://api.deepseek.com/v1). En OpenRouter, buscás el modelo desde el marketplace y activás acceso con tu cuenta existente.
- Aprovechá la ventana de contexto de 1 millón de tokens: A diferencia de otros modelos livianos, podés mandarle documentos enteros, bases de código completas o transcripciones largas en una sola consulta. Cargás el contenido, hacés tu pregunta y el modelo procesa todo junto sin perder el hilo ni recortar información relevante.
- Estructurá prompts concisos para tareas específicas: Como está optimizado para velocidad y no para razonamiento profundo, funciona mejor con instrucciones directas. Pedile que genere, resuma, traduzca o complete código con ejemplos claros y contexto mínimo necesario. Evitá cadenas largas de razonamiento que son más para la versión Pro.
- Monitoreá el consumo para no quedarte sin crédito: Los 5 millones de tokens gratuitos se consumen por consulta según la longitud del input y output. Revisá el dashboard de uso cada semana para ajustar cuánto le mandás y si te conviene rotar entre métodos (web sin registro para pruebas rápidas, API para integraciones serias) mientras dure la tanda gratuita.
Ejemplo práctico
Martín, un dev full-stack que labura freelance desde Villa Crespo, venía pateando la actualización de la documentación de su librería de componentes React. Tenía que reescribir ejemplos y comentarios para 143 componentes, un trabajo que le insumía por lo menos dos semanas. Se creó una clave de API gratuita de DeepSeek V4 Flash (los 5 millones de tokens de crédito sin tarjeta) y subió el código fuente completo: 380.000 tokens de una sola consulta gracias a la ventana de 1 millón. Le pidió al modelo que generara comentarios JSDoc y snippets de uso para cada componente.
Resultado: en una sola tarde consumió 1,2 millones de tokens y obtuvo una documentación coherente, lista para publicar. Redujo dos semanas de laburo a 6 horas netas; el equipo de frontend solo tuvo que hacer 12 correcciones menores y la aprobó al toque. Martín no gastó un centavo del bolsillo. Le quedaban 3,8 millones de tokens para el resto del mes, que usó para refactorizar el sistema de temas y actualizar el storybook.




