Chip Jalapeño de OpenAI: así le ganó a Blackwell

En pocas palabras: Sí, en eficiencia energética: presentado el 25 de agosto en Hot Chips 2026, el ASIC de inferencia que OpenAI diseñó junto a Broadcom entrega 13,4 PFLOPS en MXFP4 consumiendo 700 vatios y supera a las GPU de Nvidia, incluida la Blackwell, en tokens por segundo por megavatio.

OpenAI presentó este 25 de agosto en Hot Chips 2026 el chip Jalapeño: un ASIC de inferencia diseñado junto a Broadcom que, según las pruebas que SemiAnalysis verificó en persona en los laboratorios de la empresa, supera en tokens por segundo por megavatio a todas las GPU de Nvidia, AMD y Google que ese medio llegó a testear.

¿Qué es, técnicamente? Un ASIC (circuito integrado de aplicación específica) que OpenAI creó para ejecutar modelos de IA en fase de inferencia, no para entrenarlos. Lo diseñó junto a Broadcom, lo fabrica TSMC en nodo N3P y viene con memoria HBM4. Su revisión B0 entrega 13,4 PFLOPS en formato MXFP4 consumiendo 700 vatios, y hoy encabeza los rankings de eficiencia energética medidos de forma independiente.

En 30 segundos

  • Qué es: el primer chip diseñado por OpenAI, un ASIC generalista para inferencia de LLMs presentado en Hot Chips 2026, con diseño a cargo de Broadcom.
  • Velocidad: superó los 700 tokens por segundo por usuario con DeepSeek R1 en concurrencia 1, sin speculative decoding ni multi-token prediction.
  • Eficiencia: lidera tokens/s/MW contra todo chip testado; en GPT-OSS multiplica por más de 50 el resultado de GB200 en concurrencia 1.
  • Ficha técnica: HBM4, TDP de 700 W, 13,4 PFLOPS MXFP4 (stepping B0) fabricado por TSMC en nodo N3P.
  • Disponibilidad: solo muestras de ingeniería por ahora, sin fecha comercial, mientras Nvidia ya envía sus sistemas Vera Rubin a clientes.

¿Qué es el chip Jalapeño de OpenAI?

Es el primer procesador diseñado de punta a punta por OpenAI: un ASIC de propósito general para correr modelos de lenguaje, presentado en Hot Chips 2026 y desarrollado en sociedad con Broadcom. Nada de GPU genéricas: silicio hecho a medida para convertir electricidad en tokens.

La historia arrancó a mediados de 2024, cuando la empresa empezó a armar el equipo de diseño. Entre esas primeras contrataciones y el tapeout (el momento en que el diseño sale a fabricación) pasaron unos 16 meses, un ciclo velocísimo para un ASIC de primera generación. Cualquiera que haya seguido el desarrollo de chips sabe que un debutante suele tardar años, salir con bugs y rendir peor que la GPU madura del momento; OpenAI saltó ese guion entero. Los rumores de un tapeout exitoso venían dando vueltas hacía tiempo, y ahora hay fichas técnicas y números medidos.

OpenAI invitó a SemiAnalysis a sus laboratorios, donde el equipo del medio vio el chip funcionando y presenció los runs del benchmark InferenceX junto a los ingenieros de la compañía. Como guiño, le mostraron Jalapeño corriendo Doom, porteado al hardware usando únicamente prompts de Codex. (Sí, en serio.)

Ojo con un detalle que buena parte de la cobertura viene pifiando: varios titulares repiten que el chip está “optimizado para los modelos de OpenAI” de una manera que ningún otro hardware puede igualar. Según el análisis de SemiAnalysis, eso es falso: Jalapeño es un chip generalista capaz de correr toda clase de modelos y cargas de trabajo, y ahí está la sorpresa de verdad.

Especificaciones técnicas del chip Jalapeño

La ficha es corta pero contundente: HBM4, 700 vatios de TDP y una arquitectura orientada a inferencia. Que use HBM4 lo mete en la misma conversación que las GPU tope de gama de Nvidia y AMD, porque el ancho de banda de memoria es justo lo que define el rendimiento al generar texto. Relacionado: nuestra guía completa de Sora.

Existen dos revisiones de silicio. La A0, la que se puso a prueba, apareció cuando el programa llevaba apenas 9 meses. La B0 ya está en fabricación en TSMC y promete cerca de 25% más rendimiento por vatio. En cifras: 13,4 PFLOPS en formato MXFP4 dentro de un die de cómputo del tamaño de una retícula, contra los 17,5 PFLOPS densos en NVFP4 de un die de Rubin de tamaño similar sobre el mismo nodo. Suena a desventaja hasta que mirás el consumo: 700 vatios contra 900 a 1.150 vatios por die de Rubin.

CaracterísticaJalapeño (revisión B0)Rubin (die de cómputo)
FabricaciónTSMC N3PTSMC N3P
FLOPs pico13,4 PFLOPS MXFP417,5 PFLOPS densos NVFP4
TDP por die700 W900 a 1.150 W
MemoriaHBM4HBM4
EstadoB0 en fabricaciónEnviándose a clientes
chip jalapeño openai diagrama explicativo

La parte de entrada/salida queda resuelta con un chiplet de I/O en N3E: 32 lanes SerDes de 800G para la malla de cómputo, de las cuales 24 sirven al scale-up local dentro del rack (600 GB/s) y 8 al scale-up global que conecta dominios de hasta 2.048 XPUs entre racks. Al host x86 se llega por PCIe Gen 5. Con estos números, Jalapeño registra el mayor ancho de banda HBM por vatio del mercado y FLOPs por vatio comparables a la configuración Rubin Max-Q de 1.800 vatios.

Hay una decisión de arquitectura que vale la pena entender. OpenAI eligió no separar prefill y decode en pools de chips distintos: el modelo principal y el draft model comparten chips e interconexión. ¿Por qué? Porque la mezcla de carga cambia con el tiempo, la proporción entre tokens de entrada, escritura de caché, lectura de caché y salida mutó entre la era del conocimiento, la del razonamiento y la agéntica, y fijar de antemano cuánto silicio dedicás a cada fase puede volverse ineficiente. OpenAI fue por un pool homogéneo y apuntó a que el chip rinda bien en todo. Y rinde.

¿Cómo le fue a Jalapeño contra Nvidia Blackwell?

En el benchmark InferenceX de SemiAnalysis, Jalapeño lidera el ranking de throughput por megavatio contra cada chip testado, incluidas las mejores configuraciones de cada SKU de la competencia, todas con multi-token prediction activado. El chip de OpenAI logró lo mismo con predicción de token único, sin speculative decoding y sin separar prefill de decode.

Ganó por goleada.

Algunos números concretos, medidos en el laboratorio de OpenAI:

  • DeepSeek R1: más de 700 tokens por segundo por usuario en concurrencia 1, una interactividad destacable para un modelo de razonamiento, alcanzada sin speculative decoding ni desagregación prefill-decode.
  • Kimi K2.5 y GPT-OSS: alrededor de 1.400 tokens por segundo por usuario en cada caso (el Kimi K2.5, de paso, es el modelo en el que se basa Cursor Composer 2.5).
  • Kimi K2.5 a escala: cerca de 700 tokens/s/usuario y más de 9 veces el rendimiento del siguiente chip en el punto de 100 tokens/s por usuario.
  • GPT-OSS: el throughput por MW a igual interactividad casi duplica el mejor punto de GB200 y multiplica por más de 50 el resultado de GB200 en concurrencia 1; los puntos de alta concurrencia usaron expert parallelism EP8.
  • Calidad de salida: los evals de GSM8k dieron resultados a la par de los chips de Nvidia, así que la velocidad no salió cara en precisión.

¿Significa que Blackwell quedó obsoleto? No tan rápido. La propia SemiAnalysis aclara que la comparación con Blackwell es incompleta y algo injusta: el rival natural de Jalapeño es Rubin, que también usa HBM4 y recién empieza a llegar al mercado. Contra Blackwell gana en eficiencia en casi todos los escenarios, sí, pero la foto completa se saca mirando más adelante. Más contexto en las alternativas open source más económicas.

La pelea justa: Jalapeño vs Vera Rubin

Contra Vera Rubin, el chip de OpenAI sigue adelante en eficiencia: su throughput de tokens de salida por MW con predicción de token único supera los resultados MTP que Nvidia y CoreWeave publicaron en julio de 2026. Para dimensionar el salto generacional: los sistemas Vera Rubin NVL72 entregan 5,4 veces más rendimiento por vatio que un GB200 NVL72, y aun así Jalapeño los pasa en esa métrica.

En costo total de propiedad la cosa se emparda: ambos producen casi la misma cantidad de tokens de salida por dólar. Eso sí: hay un asterisco grande. Rubin corre con speculative decoding, una técnica que reduce el costo por token entre 3 y 5 veces. Jalapeño todavía no la implementó, de modo que cuando llegue, la balanza debería inclinarse del lado de OpenAI. Parte de la ventaja de TCO también viene de canjear los altos márgenes de Nvidia por los márgenes de Broadcom, elevados pero menores.

Matiz obligatorio: los dos chips atraviesan una etapa temprana de maduración de software, y el rendimiento de ambos va a seguir subiendo. Estos números son una foto del presente, no el techo.

¿Cuándo estará disponible comercialmente el chip Jalapeño?

Todavía no hay fecha. OpenAI no anunció disponibilidad comercial ni precios, y hoy solo existen muestras de ingeniería del stepping A0, mientras la revisión B0, con 25% más eficiencia, avanza en las fábricas de TSMC.

El contraste con Nvidia es evidente: los sistemas Vera Rubin ya se entregan a clientes, y de Jalapeño no hay nada más allá de esas unidades de prueba. Todo indica que el primer destino del chip será la propia infraestructura de inferencia de OpenAI, aunque la compañía no dio confirmación oficial al respecto. Si esperabas comprar uno para tu rack, preparate para esperar bastante. Esto se conecta con lo que analizamos en cómo se enfrenta a Claude.

¿Por qué el negocio acá son los tokens por megavatio?

¿Tanto énfasis en eficiencia y no en FLOPs brutos, por qué? Porque el cuello de botella de la industria ya no es el presupuesto ni el espacio físico: es la potencia eléctrica. “Si tenés 1 gigavatio de potencia, el throughput por vatio es ingresos”, dijo Jensen Huang en la keynote de Computex 2026, y Nvidia repitió la idea en Hot Chips 2026 durante la charla de Vera: “El centro de datos hoy está limitado por potencia”.

El tema es que conseguir más megavatios toma más tiempo que construir el edificio o comprar GPUs: las conexiones a la red eléctrica demoran más que los plazos de hardware, y por eso operadores como xAI con su Colossus 2 dependen de generación detrás del medidor, turbinas de gas instaladas en el propio predio, para no quedar a merced de la red pública. En ese contexto, tokens por segundo por MW es la métrica que manda, y equivale a tokens por joule: la capacidad de convertir energía en producto vendible. OpenAI está limitada por potencia, no por caja, y diseñó Jalapeño exactamente para esa realidad.

¿Y esto qué tiene que ver con vos? Si no operás un hiperscaler, en el corto plazo, poco. De quién gane esta pelea depende cuánto vas a pagar por token en la API de tu proveedor, no cómo montás tu servidor. Tu web sigue necesitando lo de siempre: un buen hosting, y para eso en Argentina contás con opciones locales como donweb.com, que no exigen firmar nada con TSMC.

¿Jalapeño sirve solo para modelos de OpenAI? Alcance y límites

No, y es el punto más malinterpretado de toda la noticia. Jalapeño es un chip de propósito general: en las pruebas corrió modelos de terceros y abiertos, DeepSeek R1, Kimi K2.5 y GPT-OSS, con calidad a la par de Nvidia, y hasta Doom. Dicho esto, conviene leer las letras chicas que SemiAnalysis dejó por escrito:

  • Cargas de prueba acotadas: los benchmarks fueron de tipo 8k1k (prompt de 8.000 tokens, respuesta de 1.000), un escenario sencillo de tunear. Falta AgentX, el suite multiturno y de contexto largo que estresa routers, caché de prefijos y gestión de caché, justo lo que imita una carga productiva real.
  • Nada de modelos frontera: Nvidia y AMD ya publicaron resultados con modelos más grandes y recientes como DeepSeek V4 Pro y Kimi K3, y en Jalapeño todavía no hay runs de ese calibre.
  • Verificación parcial: OpenAI proveyó los números. SemiAnalysis presenció los runs de InferenceX en vivo, pero no corrió el suite completo ni vio la totalidad de los resultados. ¿Auditoría integral independiente? Todavía no.

Levantar un modelo en un chip recién nacido exige portar kernels, validar evals, afinar el stack de serving y cruzar los dedos, y cuanto más reciente y grande es el modelo, más piezas pueden romperse en el camino, así que que no corra todavía los pesos pesados del mercado no habla mal del chip: habla de un programa que lleva meses, no años.

Qué está confirmado y qué todavía no

Para que nadie se lleve gato por liebre, acá va el estado real de cada afirmación:

ConfirmadoPendiente o sin confirmar
El chip existe y funciona: SemiAnalysis lo vio correr en el laboratorioFecha y precio de disponibilidad comercial
Runs de InferenceX presenciados en vivo junto a ingenieros de OpenAISuite completo de benchmarks corrido de forma independiente
Specs de B0: 13,4 PFLOPS MXFP4, 700 W, HBM4, TSMC N3PRendimiento con modelos frontera (DeepSeek V4 Pro, Kimi K3)
Diseño conjunto con Broadcom y fabricación en TSMCImplementación de speculative decoding en Jalapeño
Doom corriendo en el chip mediante prompts de CodexVentaja definitiva de TCO frente a Vera Rubin

Errores comunes al interpretar esta noticia

  • Dar por muerta a Nvidia. La comparación directa con Blackwell es, en palabras de SemiAnalysis, incompleta e injusta; la pelea real es contra Rubin, que además ya se vende hoy mientras Jalapeño no tiene fecha. El ecosistema CUDA acumula décadas de software y hábitos, y eso no desaparece con un benchmark.
  • Creer que es un chip “cerrado” para ChatGPT. Es generalista: corrió modelos de terceros y abiertos con resultados líderes. El mito nace de comentarios sueltos de OpenAI que la prensa amplificó sin verificar.
  • Asumir que la inferencia ya bajó de precio. Hoy Jalapeño emparda a Vera Rubin en tokens por dólar; la palanca de 3 a 5 veces llega cuando implementen speculative decoding. Hasta entonces, el ahorro es proyección, no factura.
  • Extrapolá los números 8k1k a producción. Las cargas agénticas reales con contexto largo castigan componentes que esos tests ni miran, como el router y la caché de prefijos. Esperá datos AgentX antes de sacar conclusiones de arquitectura.

Preguntas frecuentes

¿Qué es el chip Jalapeño de OpenAI?

Es un ASIC de inferencia diseñado por OpenAI junto a Broadcom y presentado en Hot Chips 2026, creado para ejecutar modelos de lenguaje con máxima eficiencia energética. Viene con HBM4, consume 700 vatios y su revisión B0 alcanza 13,4 PFLOPS en formato MXFP4 fabricado por TSMC en nodo N3P. Ya lo cubrimos antes en su batalla directa contra DeepSeek.

¿Qué ventajas tiene Jalapeño sobre Nvidia Blackwell?

Según las mediciones de InferenceX verificadas en laboratorio por SemiAnalysis, supera a Blackwell en tokens por segundo por megavatio en casi todos los escenarios, incluso contra configuraciones con multi-token prediction. En GPT-OSS, su throughput por MW casi duplica el mejor punto de GB200 y multiplica por más de 50 el resultado de GB200 en concurrencia 1.

¿Cuándo estará disponible comercialmente el chip Jalapeño?

OpenAI no anunció fecha de lanzamiento ni precios. Hoy solo existen muestras de ingeniería del stepping A0, mientras el B0, 25% más eficiente por vatio, ya está en fabricación en TSMC. En paralelo, Nvidia ya envía sus sistemas Vera Rubin a clientes, lo que agranda la brecha comercial.

¿Cuál es el costo de inferencia con el chip Jalapeño?

No hay precios públicos por unidad ni por hora. En costo total de propiedad, SemiAnalysis mide a Jalapeño cabeza a cabeza con Vera Rubin en tokens de salida por dólar, aunque Rubin usa speculative decoding, una palanca que baja el costo por token entre 3 y 5 veces y que Jalapeño todavía no implementó.

¿Jalapeño funciona solo con modelos de OpenAI?

No, es un chip de propósito general. En las pruebas corrió DeepSeek R1 a más de 700 tokens por segundo por usuario, Kimi K2.5 y GPT-OSS a unos 1.400 tokens por segundo, con evals GSM8k a la par de las GPU de Nvidia, y hasta le portaron Doom usando solo prompts de Codex.

Conclusión

Jalapeño demuestra tres cosas que hace un año sonaban a exageración: que OpenAI puede diseñar silicio competitivo, que un ASIC de primera generación puede ser líder de la industria (rarísimo en la historia del sector) y que usar IA para acelerar el diseño de chips es tangible, con 16 meses entre la primera contratación y el tapeout. Para el mercado, el mensaje es incómodo para Nvidia y excelente para Broadcom, y confirma que la próxima guerra de inferencia se pelea en vatios antes que en dólares.

Si operás inferencia a escala, guardá estos resultados como referencia y esperá los runs independientes de AgentX y el silicio B0 antes de replantear tu stack. Si consumís APIs, no cambiés nada hoy: los efectos llegarán de a poco vía precios. Y si tu proyecto es una web clásica, esta noticia no te afecta, salvo porque el chatbot de moda quizás te conteste un poco más rápido.

Fuentes

Desplazarse hacia arriba