Gateway LLM: el markup oculto en tu factura de tokens

En pocas palabras: No existe un markup único: cada gateway pone su precio por token en cada modelo, y sobre GPT-5 puede quedar 15% debajo de la lista oficial en uno y muy por encima en otro. Diecisiete líneas de Python comparan cada precio contra el del vendor y muestran la diferencia real.

El gateway LLM costo no está en la comisión que te muestran en la home, sino en el precio por token que cada servicio le pone a cada modelo. Un gateway puede cobrarte 15% menos que la lista del vendor en un modelo y estar muy por encima en otro. La única forma de saberlo es comparar, modelo por modelo, contra el precio oficial. Diecisiete líneas de Python alcanzan.

Un gateway LLM es un servicio que habla la API de OpenAI y reenvía tus pedidos a Anthropic, Google, OpenAI, xAI y el resto, así cambiar de modelo es cambiar un string en vez de instalar un SDK nuevo. Te da una sola credencial, una sola factura y reintentos automáticos cuando un proveedor se cae. A cambio, cada gateway le pone su propio precio por token a cada modelo, y ahí es donde varía el costo real.

En 30 segundos

  • No hay un “precio de gateway” único: hay un precio por modelo, y un mismo servicio puede estar debajo de la lista en uno y muy por encima en otro.
  • El output es lo caro: los tokens de salida cuestan entre 3 y 10 veces más que los de entrada, según el análisis de dev.to.
  • Se audita en 17 líneas: comparás el precio del gateway contra la lista oficial del vendor para el mismo modelo.
  • Markup 0% existe: con BYOK (tu propia key), LiteLLM self-host o Vercel AI Gateway no pagás recargo por token.
  • OpenRouter cobra 5,5% al cargar créditos, no un markup por token; LiteLLM open source es MIT y gratis si lo hosteás vos.

¿Qué es un gateway LLM y por qué sumarías un intermediario a tu stack?

Un gateway LLM es una capa que unifica el acceso a varios proveedores de modelos detrás de una sola API compatible con OpenAI. Querías probar tres modelos de tres vendors, así que hiciste lo lógico: apuntaste un cliente al gateway, pusiste una key en el entorno y te olvidaste. Ese es el 90% del atractivo.

Lo que comprás son tres cosas bien distintas. Una: una sola key y una sola factura (aburrido, pero te ahorra tres altas y tres pantallas de billing). Dos: routing y fallback, o sea que si un proveedor devuelve un 529 o se cae una región, el gateway reintenta en otro lado. Tres: un precio por token, que es el que varía en un orden de magnitud entre servicios. Relacionado: cómo evolucionaron los precios de GPT.

¿Cuándo se justifica? En tráfico de producción, el fallback vale plata. En un proyecto de fin de semana, no vale nada.

¿Dónde se esconde el costo real de un gateway LLM?

El costo real de un gateway LLM está en el precio por token, no en la comisión visible. Los otros dos componentes de la tarifa (la factura unificada y el routing) son fáciles de comparar. El precio por token es el que nadie pone en una tabla comparativa, porque no existe un número único: hay un precio por cada modelo.

  • Credencial e invoice unificados: real y aburrido. Te saca tres signups de encima y listo.
  • Routing y fallback: cuando un proveedor tira 529 o una región se apaga, el gateway reintenta en otro. Sirve en producción, cero en un experimento.
  • Precio por token: input y output se cobran por separado, con el output entre 3 y 10 veces más caro. Un token es más o menos ¾ de una palabra. La lista del vendor es tu línea de base, y el gateway está por debajo, igual, o cobrando markup encima.

El tema es que ese markup, si existe, se paga para siempre. Un 10% sobre USD 5 por millón de tokens no es “medio dólar y ya”: es USD 0,50 de recargo que pagás por cada millón, mientras uses ese modelo.

¿Cómo auditar el markup de tu gateway en 17 líneas de Python?

Para auditar el markup de tu gateway compará, modelo por modelo, lo que te factura el gateway contra el precio de lista que el vendor publica en su propia página. Si el gateway está por encima, pagás recargo. Si está por debajo, te hace un descuento. El script no necesita más que un diccionario con ambos precios y una resta. Cubrimos ese tema en detalle en herramientas modernas para desarrolladores.

import requests

# precio de lista del vendor para tu volumen del mes (USD)
LISTA = {"claude-sonnet-5": 800.0, "gpt-5.6": 1100.0}

# lo que te facturo el gateway por el mismo uso
GATEWAY = {"claude-sonnet-5": 677.91, "gpt-5.6": 935.09}

for modelo, precio_lista in LISTA.items():
 precio_gw = GATEWAY[modelo]
 diff = (precio_gw - precio_lista) / precio_lista * 100
 etiqueta = "MARKUP" if diff > 0 else "descuento"
 print(f"{modelo:16} {diff:+6.1f}% ({etiqueta})")

# claude-sonnet-5 -15.3% (descuento)
# gpt-5.6 -15.0% (descuento)

Con los números que trae el ejemplo de dev.to, ese gateway cobra 15,3% menos que la lista en Claude Sonnet 5 y 15% menos en GPT-5.6. Descuento en ambos. Pero ojo: probá con TODOS los modelos que usás, porque el mismo servicio que te descuenta en dos puede cobrarte de más en el tercero.

¿Cuánto pagás con gateway vs API directa en tu caso de uso?

Con la API directa pagás exactamente la lista del vendor. Con un gateway pagás lista más (o menos) su ajuste por modelo, y eso depende del gateway. No hay una respuesta única: para el mismo volumen, un gateway BYOK te sale igual que la API directa, OpenRouter suma su fee de créditos, y LiteLLM self-host no agrega nada salvo el costo de tu propio servidor.

OpciónMarkup por tokenModelo de costoCuándo conviene
API directa (vendor)0% (lista)Pagás la lista oficialUn solo proveedor, sin fallback
OpenRouter5,5% al cargar créditosFee sobre el saldoProbar muchos modelos rápido
LiteLLM (self-host)0%Tu servidor + mantenimientoEquipo con infra propia
LLM Gateway (BYOK)0% con tu keyPagás lista al vendorUnificar sin recargo
Vercel AI Gateway0% de token markupSin recargo por tokenYa estás en Vercel

Los precios de gateway cambian seguido, así que tomá esta tabla como punto de partida y corré el script con tus modelos antes de decidir.

¿Qué gateway no cobra markup y qué preguntar antes de migrar?

Los gateways sin markup por token son tres: BYOK (traés tu propia key y pagás lista directo al vendor), LiteLLM self-hosteado, y Vercel AI Gateway, que no suma recargo por token. En los tres, el “precio del gateway” es igual al de la API directa. La diferencia está en qué te dan alrededor y en cuánto te cuesta mantenerlo.

Si vas por el camino self-host, acordate de sumar el costo del servidor donde corre LiteLLM. Para eso, un VPS con buen ancho de banda en donweb.com te alcanza y sabés qué estás pagando (a diferencia del markup, que se disuelve en la factura).

Antes de cambiar de gateway, preguntá esto:

  • ¿El streaming funciona igual? Algunos gateways rompen el stream token a token o lo bufferean.
  • ¿Los tool calls llegan completos? Verificá que las llamadas a funciones no se corten ni se reformateen.
  • ¿El fallback es real o es solo un retry? Reintentar contra el mismo proveedor caído no es fallback.
  • ¿Cuánto cuesta salir? Si el gateway usa features propias, migrar después tiene su costo.

¿Qué te da un gateway más allá del precio? Routing y fallback en producción

Más allá del markup, un gateway te da gestión de outages, caché semántica y circuit breakers. Ponele que tu proveedor principal empieza a devolver 529 un martes a las tres de la tarde: el gateway rutea el tráfico a otro modelo sin que vos toques nada. En un pico real, esa capa de routing puede recortar la factura bastante si mandás cada pedido al modelo más barato que cumple con la calidad que necesitás. Lo explicamos a fondo en automatización de flujos en equipos.

Acá viene lo bueno: si dos gateways te cotizan el mismo precio, gana el que tenga mejor fallback y observabilidad. Portkey, por ejemplo, agrega guardrails y governance, que en una empresa con datos sensibles no es un detalle. La “inteligencia” del routing recién importa cuando tenés tráfico real que proteger.

Alternativas 2026: LiteLLM vs Portkey vs LLM Gateway vs OpenRouter vs Vercel

Las alternativas se eligen por caso de uso, no por un ranking único. Para una startup que quiere costo cero, LiteLLM self-host (licencia MIT, open source) es lo lógico. Para una empresa que necesita guardrails y auditoría, Portkey (Apache 2.0, con soporte para 1.600+ modelos) tiene más sentido. Para optimizar puro costo, BYOK en LLM Gateway te deja en 0% de markup.

  • LiteLLM: open source, MIT, gratis. Ideal si tenés infra propia y querés control total.
  • Portkey: Apache 2.0, 1.600+ modelos, guardrails y governance. Para equipos que necesitan compliance.
  • LLM Gateway: 0% de markup con BYOK. Unificás sin pagar recargo por token.
  • OpenRouter: 5,5% de fee al cargar créditos. El más rápido para probar muchos modelos.
  • Vercel AI Gateway: 0% de token markup. Encaja si tu app ya vive en Vercel.

Errores comunes al elegir un gateway LLM

  • Mirar solo la comisión de la home: el recargo real está en el precio por token de cada modelo, no en el número grande que te muestran.
  • Comparar un solo modelo: el gateway te descuenta en Claude y te cobra de más en GPT. Corré el script con todos los que usás.
  • Ignorar el costo de salida: el output cuesta entre 3 y 10 veces más que el input, así que una app que genera texto largo paga muy distinto que una que clasifica.
  • Confundir retry con fallback: reintentar contra el proveedor caído no te salva. Pedí fallback a otro modelo de verdad.

Preguntas Frecuentes

¿Cuánto cobra realmente un gateway LLM por encima del vendor?

Depende del modelo, no del gateway. Un mismo servicio puede estar 15% debajo de la lista en un modelo y por encima en otro. En el ejemplo de dev.to, el gateway cobraba 15,3% menos en Claude Sonnet 5 y 15% menos en GPT-5.6, pero eso no se generaliza a los demás modelos.

¿Cómo calculo si mi gateway me está cobrando de más?

Compará el precio que te factura el gateway contra el precio de lista oficial del vendor, modelo por modelo. Con 17 líneas de Python y un diccionario de precios sacás el porcentaje de diferencia. Si da positivo, hay markup; si da negativo, hay descuento. Esto se conecta con lo que analizamos en comparativa de modelos por costo.

¿Qué gateway LLM no tiene markup de tokens?

Tres opciones dan 0% de markup por token: BYOK (tu propia key) en LLM Gateway, LiteLLM self-hosteado, y Vercel AI Gateway. En los tres pagás el precio de lista directo al vendor, sin recargo intermedio.

¿Conviene un gateway o conectarse directo a la API?

La API directa te sale la lista exacta y sin intermediarios, ideal si usás un solo proveedor. El gateway conviene cuando necesitás fallback en outages, probar varios modelos o unificar la facturación. En producción con tráfico real, el routing suele pagar su costo.

¿Cuánto cobra OpenRouter de comisión?

OpenRouter cobra un 5,5% al cargar créditos, no un markup por token en cada llamada. Es un fee sobre el saldo que ponés, distinto del recargo por modelo que aplican otros gateways. Sirve sobre todo para probar muchos modelos rápido con una sola cuenta.

Conclusión

Lo que cambió es que ya no podés confiar en la comisión que el gateway pone en su home. El costo real vive en el precio por token de cada modelo, y como no hay un número único, la única defensa es medir. Corré el script contra los modelos que de verdad usás, guardá el resultado, y repetí la medición cada tanto porque estos precios se mueven.

Si buscás costo cero, andá por LiteLLM self-host o BYOK. Si necesitás governance, Portkey. Si ya estás en Vercel, su gateway no te suma markup. Y si el precio empata, decidí por el fallback y la observabilidad, que es lo que te salva un martes a las tres de la tarde.

Fuentes

Desplazarse hacia arriba