IBM Granite 4.2: modelos LLM locales con agentes

En pocas palabras: IBM lanzó Granite 4.2 el 25 de agosto de 2026: familia de modelos LLM de código abierto (Apache 2.0) en tres tamaños (3B, 8B y 30B) que corren localmente sin depender de una API en la nube, con razonamiento opcional y hasta 512.000 tokens de contexto para tareas de agentes.

IBM lanzó Granite 4.2 el 25 de agosto de 2026: una familia de modelos LLM locales de código abierto (licencia Apache 2.0) en tres tamaños (3B, 8B y 30B parámetros), con razonamiento nativo, ventana de contexto de hasta 512.000 tokens y entrenamiento específico para trabajo de agentes en las versiones grandes.

Granite 4.2 es la familia de modelos de lenguaje de código abierto de IBM presentada el 25 de agosto de 2026. Son modelos densos, decoder-only, entrenados desde cero con 15 billones de tokens y disponibles en 3B, 8B y 30B parámetros bajo licencia Apache 2.0. Corren de forma local, sin depender de una API en la nube, y suman razonamiento opcional y llamado a herramientas para tareas de agentes.

En 30 segundos

  • Tres tamaños: 3B, 8B y 30B de parámetros, todos densos y decoder-only, entrenados desde cero.
  • Contexto enorme: hasta 512.000 tokens (la versión publicada soporta 128K de forma nativa).
  • Razonamiento opcional: modos thinking, non-thinking y un low-effort que gasta pocos tokens en preguntas fáciles.
  • Agentes de verdad: el 8B y el 30B pasaron por reinforcement learning agéntico para usar herramientas, correr código y buscar en la web.
  • Gratis y auditable: Apache 2.0, descargables desde Hugging Face. Eso sí: en coding, Qwen 3.8 27B les gana.

¿Por qué tantas empresas prefieren modelos LLM locales en 2026?

Porque hay datos que no pueden salir de la empresa. Un modelo LLM local es un LLM que corre en tu propia infraestructura (una notebook, un servidor con GPU, un VPS) en vez de mandar cada prompt a la API de un tercero. La diferencia con GPT, Claude o Gemini es que acá los tokens nunca cruzan tu firewall.

Ponele que sos un banco y querés que un asistente lea legajos crediticios. Con una API en la nube, esos legajos viajan a un servidor que no controlás. Con un modelo local, se quedan puertas adentro. Para sectores con cumplimiento regulatorio (salud, finanzas, legal) eso no es un lujo, es un requisito.

Hay otras dos razones que empujan la adopción. Una es la latencia: sin viaje de ida y vuelta a un datacenter remoto, la respuesta llega más rápido. La otra es el costo operativo: a alto volumen, pagar por token en una API se vuelve caro, y un modelo chico corriendo 24/7 en hardware propio te sale fijo. Para eso necesitás un servidor o VPS con GPU, y si buscás alojamiento en Argentina lo podés armar en donweb.com.

¿Qué es Granite 4.2 y cuáles son sus características técnicas?

Granite 4.2 es la última familia de LLMs open-weight de IBM, presentada el 25 de agosto de 2026 según el reporte de The New Stack. Viene en 3B, 8B y 30B parámetros, con arquitectura densa y decoder-only, y licencia Apache 2.0. IBM lo describe como un “reasoning-focused release”: el razonamiento, antes opcional, ahora es una pieza central.

Acá viene un dato interesante de arquitectura. Muchos modelos recientes se pasaron a diseños híbridos Mamba/attention (Nvidia entre ellos). IBM lo probó con Granite 4.0, volvió atrás en 4.1 a un Transformer all-attention denso, y con 4.2 se queda ahí. ¿El argumento? Que una arquitectura más simple es más flexible para fine-tuning en tareas downstream. Más contexto en modelos seguros para empresas.

Los números del entrenamiento: 15 billones de tokens en cinco fases, con una etapa de long-context que lleva la ventana a 512.000 tokens (aunque la versión publicada soporta 128K de forma nativa). Dentro de ese corpus entró 1 billón de tokens de código sintético generado por herramientas propias de IBM. Y ojo con esto: pese a todo ese código, el desempeño en programación quedó, según la propia cobertura, apenas “promedio”.

Una salvedad importante: Granite 4.2 es text-only. No procesa imágenes. Otros modelos de su tamaño (Muse Glimmer 30B, Gemma 4 31B de Google) sí son multimodales. IBM tiene un Granite Vision 4.1 4B por separado, y no se descarta una versión 4.2 de visión más adelante. El 25 de agosto de 2026, IBM también lanzó dos modelos nuevos de reconocimiento de voz en la familia Granite Speech.

¿Qué capacidades de razonamiento y agentes trae Granite 4.2?

Granite 4.2 puede razonar antes de responder y llamar herramientas para ejecutar tareas. Los tres modos de pensamiento (thinking, non-thinking y low-effort) dejan elegir cuánto “piensa” el modelo: en una pregunta trivial no gasta tokens de razonamiento de más, y en una compleja despliega cadena de pensamiento completa.

La parte agéntica es donde IBM puso el foco. El 8B y el 30B pasaron por un paso extra de reinforcement learning agéntico que los entrena para llamar herramientas, editar y correr código, trabajar en la terminal y buscar en la web. Sumado al alineamiento con RLHF (reinforcement learning from human feedback), IBM dice que quedan mejor preparados para trabajo multi-paso del mundo real.

El 3B también soporta tool calling. Pero no esperes milagros de un modelo tan chico: para un agente que tiene que encadenar varios pasos, el 8B es el piso razonable. En alternativas a ChatGPT profundizamos sobre esto.

En el anuncio, IBM lo resume así: “Ya no alcanza con responder de forma clara y concisa. Un sistema de IA tiene que planificar, llamar aplicaciones y ejecutar tareas complejas de manera confiable y consistente, y hacerlo lo bastante liviano como para usarlo sin fundir el presupuesto”.

¿Cómo se compara Granite 4.2 con Qwen, Gemma y otros modelos locales?

En benchmarks, Granite 4.2 no rompe ningún techo, y conviene ser honesto con eso. El dato más útil es que el 8B suele quedar muy cerca del 30B en resultados, lo que lo vuelve la opción más eficiente de la familia. Pero Qwen 3.8 27B les gana en toda la línea, sobre todo en coding, donde los modelos de IBM dan resultados inconsistentes.

ModeloParámetrosContextoMultimodalLicenciaFuerte en
Granite 4.2 (IBM)3B / 8B / 30Bhasta 512K (128K nativo)No (text-only)Apache 2.0Tareas agénticas, tool calling
Qwen 3.8 27B27BAmplioSegún varianteAbiertaCoding, benchmarks generales
Gemma 4 31B (Google)31BAmplioAbiertaMultimodalidad
Muse Glimmer 30B30BAmplioAbiertaMultimodalidad
Comparativa según datos publicados por IBM y la cobertura de The New Stack (agosto 2026). Los benchmarks varían según la tarea.
modelos llm locales diagrama explicativo

Como siempre, el benchmark cuenta solo una parte. Para muchos casos, un modelo de frontera es sobredimensionado, y ahí IBM planta su bandera: dice que la ventaja de Granite es el rendimiento en tareas agénticas de alto throughput, no ganar tablas de coding. Habría que verlo en tu carga real antes de casarse con el argumento.

¿Qué hardware necesito para correr Granite 4.2?

Depende del tamaño, y acá el 8B es la estrella. Según la cobertura, el modelo de 8B se acerca a los resultados del 30B y es fácil de correr en cualquier Mac moderna e incluso en algunas GPU Nvidia RTX de gama relativamente baja. Es el punto dulce entre capacidad y accesibilidad.

  • Granite 3B: el más liviano. Ideal para pruebas, prototipos y ruteo inicial. Corre en hardware modesto, pero sus capacidades de agente son básicas.
  • Granite 8B: el equilibrio. Se ejecuta en una Mac reciente o en una RTX de consumo, y rinde casi como el 30B. Para la mayoría de los equipos, es por donde empezar.
  • Granite 30B: el tope de la familia. Pensado para producción con GPU de servidor y cargas agénticas pesadas.

Para llevarlo a producción real, el modelo se sirve mejor con un motor de inferencia dedicado sobre GPU en un servidor. Ahí es donde importa tener infraestructura estable, más que probarlo en tu notebook un rato. Te puede servir nuestra cobertura de panorama completo de modelos de lenguaje.

¿Dónde descargo Granite 4.2 y cómo lo pongo a andar?

Los pesos están en Hugging Face bajo la organización ibm-granite de IBM, con licencia Apache 2.0. Al ser abierto, lo descargás, lo inspeccionás y lo desplegás sin pedir permiso ni pagar por token.

El flujo típico para dev local es simple: bajás una versión cuantizada, la levantás con un runner de escritorio y en unos minutos tenés un endpoint local hablándote. Para producción cambia el juego: ahí querés un motor de inferencia orientado a servir muchas peticiones concurrentes sobre GPU, con control de colas y batching. Subís el modelo, lo probás en local, funciona bárbaro, lo mandás a un servidor con carga real y recién ahí ves si el throughput aguanta, si la cuantización te comió calidad y si el contexto de 128K te entra en memoria.

La guía de Hugging Face cubre la configuración de los modos de razonamiento y el tool calling.

¿Para qué casos de uso conviene Granite 4.2?

Agentes de DevOps y automatización de terminal

El 8B y el 30B fueron entrenados para trabajar en la terminal, correr código y buscar en la web. Eso los hace candidatos para agentes que naveguen un codebase, ejecuten comandos y encadenen varios pasos sin supervisión constante. Es el escenario donde IBM apunta con la parte agéntica.

RAG local sobre datos sensibles

Con 128K de contexto nativo (y hasta 512K), Granite 4.2 se presta para retrieval-augmented generation sobre documentos que no pueden salir de la empresa: contratos, historias clínicas, expedientes. Todo el pipeline queda puertas adentro, que es justo el motivo por el que muchos eligen modelos locales.

Ruteo y clasificación de alto volumen

Para centros de contacto o triage de tickets, el 3B alcanza para clasificar y rutear la mayoría de los casos, escalando al 8B cuando la consulta se complica. El low-effort mode ayuda a no gastar tokens de razonamiento en lo que es trivial, y eso baja el costo por interacción. Para más detalles técnicos, mirá soluciones de Google en inteligencia artificial.

Errores comunes al adoptar Granite 4.2

  • Elegirlo esperando un rey del coding. No lo es: Qwen 3.8 27B le gana en programación y los resultados de Granite ahí son inconsistentes. Si tu caso es generar código pesado, evaluá otra opción o el modelo grande con expectativas realistas.
  • Confundir 512K con lo que corre por defecto. La familia llega a 512.000 tokens de contexto, pero la versión publicada soporta 128K de forma nativa. Planificá memoria y despliegue sobre 128K, no sobre el número de marketing.
  • Pedirle imágenes. Granite 4.2 es text-only. Si necesitás analizar imágenes, esto no es lo tuyo (para eso está Granite Vision, que es otro modelo).
  • Poner el 3B a hacer trabajo de agente serio. Soporta tool calling, sí, pero para flujos multi-paso confiables el piso es el 8B.

Preguntas Frecuentes

¿Qué es Granite 4.2 de IBM?

Granite 4.2 es una familia de modelos LLM locales de código abierto que IBM presentó el 25 de agosto de 2026. Viene en 3B, 8B y 30B parámetros, es densa y decoder-only, y se distribuye bajo licencia Apache 2.0 en Hugging Face.

¿Cuánta ventana de contexto tiene Granite 4.2?

Llega hasta 512.000 tokens gracias a una fase de entrenamiento de contexto largo. La versión publicada soporta 128.000 tokens de forma nativa, que es el valor con el que conviene planificar el despliegue.

¿Granite 4.2 es mejor que Qwen para programar?

No. Según la cobertura de agosto de 2026, Qwen 3.8 27B supera a Granite en toda la línea y en especial en coding, donde los modelos de IBM dan resultados inconsistentes. Granite se defiende mejor en tareas agénticas y tool calling.

¿Cuánto cuesta usar Granite 4.2?

Los pesos son gratuitos bajo licencia Apache 2.0: no pagás por token ni licencia. El costo real es el hardware para correrlo, que va desde una Mac moderna para el 8B hasta GPU de servidor para el 30B en producción.

¿Granite 4.2 puede procesar imágenes?

No, Granite 4.2 es un modelo text-only. Para tareas con imágenes, IBM ofrece Granite Vision 4.1 4B como modelo aparte, y no descartó una versión 4.2 de visión más adelante.

Conclusión

Granite 4.2 no viene a ganar tablas de benchmarks, y a IBM parece no importarle demasiado. La apuesta es clara: modelos abiertos, densos y livianos, con razonamiento opcional y una parte agéntica entrenada a propósito para que planifiquen, usen herramientas y trabajen en la terminal sin fundir el presupuesto.

¿Qué hacer con esto? Si tu caso son agentes o RAG sobre datos que no pueden salir de tu red, bajá el 8B desde Hugging Face y probalo en tu carga real: es el punto dulce entre capacidad y hardware accesible. Si buscás el mejor coding, mirá para otro lado. Y si necesitás correrlo en producción, armá un servidor con GPU y medí throughput antes de decidir el tamaño. La licencia Apache 2.0 hace que la única barrera sea el fierro, no el permiso.

Fuentes

Desplazarse hacia arriba