Cuánto markup te cobra tu gateway LLM (y cómo medirlo)

En pocas palabras: El margen que un gateway LLM te cobra sobre el precio de lista varía en un orden de magnitud entre servicios: en un mismo modelo va de 0% a más de 10x. Con 17 líneas de Python medís el markup real comparando tu factura contra el precio del proveedor.

Un gateway LLM te cobra por los mismos tokens que el proveedor te vendería directo, y ese margen varía en un orden de magnitud entre servicios. El costo de un gateway LLM casi nadie lo audita: pusiste una sola API key, apuntaste el cliente y dejaste de pensar. Con 17 líneas de Python podés medir cuánto se queda comparando la factura real contra el precio de lista.

Un gateway LLM es un servicio intermediario que implementa la API de OpenAI y reenvía tus pedidos a Anthropic, Google, OpenAI, xAI y otros proveedores, así cambiar de modelo pasa a ser modificar un string en vez de integrar un SDK nuevo. A cambio te da tres cosas: una sola factura, ruteo con fallback automático y un precio por token que puede estar por debajo, igual o por encima del precio de lista del proveedor.

En 30 segundos

  • No existe “el precio del gateway”: hay un precio por modelo, y un mismo servicio puede estar debajo del precio de lista en un modelo y muy por encima en otro.
  • El markup varía en un orden de magnitud entre gateways, según el artículo original de Altrouter en dev.to (agosto 2026).
  • 17 líneas de Python alcanzan para calcular el margen: costo total facturado dividido por (tokens × precio de lista del proveedor).
  • El output cuesta 3 a 10 veces más que el input, así que ahí es donde el markup pega más fuerte.
  • LiteLLM es open source y self-hosteable; si el volumen justifica, hosteás tu propio gateway y el markup baja a cero.

¿Cuál es la diferencia entre el precio de lista y la tarifa del gateway?

El precio de lista es lo que el proveedor publica en su propia página de pricing, y es tu línea de base: el gateway está por debajo, igual, o cobrando un markup encima. Los modelos se facturan por token (un token es más o menos ¾ de una palabra), con input y output cobrados por separado.

Acá viene lo importante: no hay un “precio de gateway” único. Hay un precio por modelo. Un servicio puede estar por debajo del precio de lista en un modelo popular (para engancharte) y cobrarte muy por encima en otro que usás menos. Por eso nadie lo mete en una tabla comparativa: no hay un número que resuma la cosa. Relacionado: cómo evolucionaron los precios de GPT.

Ponele que pediste tres modelos de tres proveedores. Hiciste lo sensato: un cliente, una key, listo. Lo que casi nadie chequea después es qué cobra el gateway por exactamente los mismos tokens que el proveedor te habría vendido directo.

¿Qué pagás realmente con un gateway? Tres valores distintos

Comprás tres cosas, y valen cantidades muy diferentes. Dos son honestas y una es la que te sorprende en la factura.

  • Una key y una factura: real y aburrido. Te ahorra tres registros y tres páginas de billing. Valioso, sí, pero no vale un porcentaje sobre cada token.
  • Ruteo y fallback: si un proveedor devuelve 529 o una región se cae, el gateway reintenta en otro lado. Vale plata en tráfico de producción, cero en un proyecto de fin de semana.
  • Un precio por token: este es el que varía en un orden de magnitud y el que nadie pone en la comparación. Es el que te muerde.

El tema es que la mayoría paga los tres como si fueran uno. Estás tercerizando el billing y de yapa pagando un peaje por token que ni mediste.

¿Cómo calcular el markup exacto de tu gateway con Python?

Comparás el costo que te facturó el gateway contra lo que habrías pagado al precio de lista del proveedor: markup = costo_facturado / (tokens_input × precio_input + tokens_output × precio_output). Si el resultado da 1,0 es pass-through puro; si da 1,15 te están cobrando un 15% encima. El artículo original lo resuelve en 17 líneas. Cubrimos ese tema en detalle en herramientas de desarrollo que usan LLM.

Los pasos son estos: agarrás la respuesta del gateway (que suele traer usage con tokens de input y output), buscás el precio de lista publicado por el proveedor para ese modelo exacto, multiplicás, y dividís el costo real por ese teórico. La respuesta que te devuelve el gateway ya trae los tokens, así que no hay que estimar nada.

¿Vale la pena hacerlo a mano? Para un modelo, sí, es media hora. Para diez modelos rotando en producción, mejor lo automatizás con herramientas de introspección tipo LiteLLM o Langfuse, que te loguean el costo por request y te arman el dashboard solas.

Ruteo inteligente: mandar cada pedido al modelo más barato que resuelva

El ruteo inteligente manda cada consulta al modelo más barato capaz de resolverla: una pregunta trivial va a un modelo chico y liviano, un análisis complejo va a un modelo grande. Bien configurado, el ahorro es enorme porque el grueso de las consultas reales no necesita el modelo más caro.

El caso típico: tenés un chatbot donde el 80% de las preguntas son “¿cuál es tu horario?” y el 20% requiere razonamiento pesado. Si mandás todo al modelo top, pagás precio premium por responder horarios. Ruteás las simples a un modelo barato y de golpe la factura se desploma sin que el usuario note la diferencia.

Eso sí: el ruteo agrega su propia complejidad. Necesitás un clasificador que decida qué modelo usar, y ese clasificador también cuesta (tokens o latencia). Si el pedido de clasificación cuesta más que el ahorro, estás peor. Tomalo con pinzas y medí antes de dar por hecho que ganás. Complementá con agentes que consumen APIs de LLM.

Hosting Cloud Servers Vps — DonWebHosting Cloud Servers Vps — DonWebHosting Cloud Servers Vps — DonWeb

Fallback automático: proteger producción cuando un proveedor se cae

El fallback automático reintenta el pedido en otro proveedor cuando el primario falla: si OpenAI devuelve un 529 por sobrecarga, el gateway reenvía el mismo request a Claude o Gemini sin que tu app se entere. Es el argumento fuerte para pagar el markup en producción, donde un minuto caído cuesta más que la comisión.

Lo tienen Vercel AI Gateway, OpenRouter y Portkey, entre otros. La lógica es simple: definís un orden de preferencia de modelos y el gateway baja la cascada hasta que uno responde. En la documentación de Vercel AI Gateway el fallback se configura como una lista ordenada de modelos.

Ahora bien, hay dos costos ocultos. Uno es la latencia: cada reintento suma tiempo, y si el primario tarda en fallar, el usuario espera. El otro es la consistencia: el modelo de respaldo no responde igual que el primario, así que tu output cambia de tono o de formato justo cuando hay incidente. Un fallback silencioso puede meterte respuestas raras sin que sepas por qué.

Comparativa de gateways LLM en 2026: OpenRouter, LiteLLM, Vercel y Portkey

No hay un gateway “mejor” universal: depende de si sos un proyecto chico, una startup que escala o un equipo que quiere control total sobre el costo. Esta tabla resume el perfil de cada uno según modelo de negocio y capacidades.

GatewayModelo de costoAuto-hostingPara quién conviene
OpenRouterMarkup por modelo (varía)NoProbar muchos modelos rápido con una key
LiteLLMOpen source, sin markup si lo hosteásEquipos que quieren costo cero de intermediación
Vercel AI GatewayIntegrado al ecosistema VercelNoApps ya desplegadas en Vercel
PortkeyGateway + observabilidadSí (core open source)Producción que necesita métricas y control

Si tu volumen es serio, la jugada de hostear tu propio gateway (LiteLLM o el core de Portkey) sobre un VPS en donweb.com te saca el markup de encima: pagás la infra y hablás directo con el proveedor al precio de lista. Para un fin de semana, no vale la pena; el gateway comercial zafa.

¿Cómo auditar los costos de forma automática en tu app?

La forma práctica es loguear cada request con sus tokens y su costo, y disparar una alerta cuando un modelo se sale del rango esperado. Langfuse te arma dashboards de gasto por modelo, LiteLLM te devuelve el costo inline en cada respuesta, y con eso configurás un umbral: si un modelo de golpe cuesta 3 veces más, te enterás el mismo día y no a fin de mes. Ya lo cubrimos antes en comparar el costo entre los modelos.

Lo mínimo indispensable: guardá el usage de cada llamada y el modelo que respondió (importa mucho cuando hay fallback, porque el respaldo puede ser más caro). Con eso ya podés correr el cálculo de markup una vez por semana y ver si tu gateway cambió las reglas sin avisar.

¿Qué está confirmado y qué no?

  • Confirmado: el markup por token varía en un orden de magnitud entre gateways, según el artículo de Altrouter publicado el 14 de agosto de 2026.
  • Confirmado: el output se factura típicamente 3 a 10 veces más caro que el input, en la mayoría de los proveedores.
  • Confirmado: LiteLLM es open source y self-hosteable, lo que elimina el markup de intermediación.
  • No confirmado: los porcentajes exactos de markup por gateway y por modelo. Cambian seguido y dependen del modelo puntual, así que hay que medirlos vos mismo con tu propio tráfico.

Errores comunes al elegir un gateway LLM

  • Asumir un “precio único” del gateway: el error clásico. Comparás por un modelo, ves que está barato, y no notás que otro modelo que usás igual de seguido tiene un markup del “solo” 18%. Medí modelo por modelo.
  • No loguear qué modelo respondió: con fallback activo, la mitad de tus requests en un incidente pueden estar yendo al modelo de respaldo, más caro. Si no guardás cuál respondió, la factura te sorprende y no sabés por qué.
  • Pagar markup por un solo modelo: si usás un único proveedor y no necesitás fallback, el gateway te suma peaje sin darte el beneficio de la multi-provider. Ahí conviene ir directo a la API del proveedor.
  • Ignorar la latencia del ruteo: el clasificador que decide el modelo también cuesta tokens y tiempo. Si no lo medís, capaz gastás en clasificar más de lo que ahorrás.

Preguntas Frecuentes

¿Qué es un gateway LLM y para qué sirve?

Un gateway LLM es un servicio que implementa la API de OpenAI y reenvía tus pedidos a distintos proveedores (Anthropic, Google, OpenAI, xAI). Sirve para usar varios modelos con una sola key y una sola factura, y para cambiar de modelo modificando un string en vez de integrar un SDK nuevo.

¿Cuánto markup cobra un gateway sobre el precio directo?

Depende del gateway y del modelo, y varía en un orden de magnitud entre servicios. Un mismo gateway puede estar por debajo del precio de lista en un modelo y muy por encima en otro, por eso no existe un número único: hay que calcularlo por modelo comparando la factura real contra el precio de lista del proveedor.

¿Conviene usar un gateway si solo necesito un modelo?

Con un solo modelo y sin necesidad de fallback, el gateway te suma un markup sin darte el beneficio multi-provider. En ese caso conviene llamar directo a la API del proveedor al precio de lista. El gateway rinde cuando rotás modelos o cuando necesitás fallback en producción.

¿Hay gateways LLM open source y gratis?

Sí. LiteLLM es open source y self-hosteable, y el core de Portkey también. Al hostearlos vos, eliminás el markup de intermediación y hablás directo con el proveedor: pagás la infraestructura del servidor, no un porcentaje por token.

¿Cómo mido el costo real de mi gateway LLM?

Dividís el costo facturado por el costo teórico al precio de lista: (tokens_input × precio_input + tokens_output × precio_output). Si da más de 1,0 hay markup. Los tokens vienen en el campo usage de cada respuesta, así que el cálculo se automatiza con LiteLLM o Langfuse sin estimar nada.

Conclusión

El gateway te vendió comodidad y vos la compraste sin leer la letra chica. Está bien: una sola key y una sola factura valen algo. Lo que no vale es pagar un peaje por token que nunca mediste, sobre todo cuando el output cuesta hasta 10 veces más que el input y ahí el markup pega donde más duele.

La acción concreta es una sola: corré el cálculo de markup para tus modelos más usados esta semana. Si el número te incomoda y el volumen lo justifica, hosteá tu propio LiteLLM y hablá directo con los proveedores. Si es un proyecto chico, quedate en el gateway comercial, pero al menos ahora sabés cuánto se está quedando.

Fuentes

Desplazarse hacia arriba