En pocas palabras: AirLLM, desde agosto de 2026, permite correr modelos de 70 000 millones de parámetros (como Llama 70B) en una GPU de 4 GB mediante streaming por capas: carga solo la capa activa en VRAM y mantiene precisión BF16 sin cuantización ni poda.
Mirá, si me decías hace un año que podías correr un modelo de 70 mil millones de parámetros en una GPU de 4GB, te decía que estabas flasheando. Hoy, con AirLLM GPU 4GB, eso es exactamente lo que pasa: inferencia local de modelos bestiales sin alquilar medio data center y sin vender un riñón. La biblioteca logró en agosto de 2026 lo que parecía imposible mediante una técnica de streaming que carga el modelo por capas, nunca completo, en la memoria de video. El resultado es que podés usar Llama 70B, DeepSeek-V3 o el Kimi K3 (agosto 2026) en hardware que antes solo servía para modelos chiquitos.
AirLLM es una biblioteca open-source de Python que implementa inferencia de grandes modelos de lenguaje (LLMs) mediante streaming por capas y por expertos, permitiendo que modelos como Llama 70B o DeepSeek-V3 corran en GPUs de consumo con apenas 4 GB de VRAM. Desarrollada por el equipo de lyogavin en GitHub, la herramienta elimina la necesidad de cuantización, destilación o poda del modelo, cargando solo las porciones necesarias en cada paso de cómputo y liberando la memoria inmediatamente después. Esto baja la barrera de entrada de la experimentación local con IA de manera brutal, especialmente para equipos y desarrolladores en Latinoamérica con acceso limitado a hardware de alto costo.
En 30 segundos
- AirLLM ejecuta Llama 70B con solo 4 GB de VRAM usando streaming por capas, sin cuantización ni destilación.
- El modelo Kimi K3 corre con 3.72 GB de VRAM en MoE, cargando únicamente los expertos activos por token (agosto 2026).
- La versión 2.5 (lanzada en 2025) introdujo prefetching que acelera la inferencia hasta 3 veces respecto del streaming puro.
- No necesitás GPU de datacenter: una RTX 3050 de 4 GB o una GTX 1060 alcanzan (con paciencia).
- La calidad de las respuestas es idéntica al modelo original porque el proceso no toca los pesos.
¿Por qué AirLLM permite correr modelos enormes en tan poca VRAM?
El truco es tan simple como efectivo: el modelo nunca se carga completo en la GPU. En lugar de eso, AirLLM lo parte en capas (o en expertos, si es un MoE) y las va subiendo de a una, justo antes de que el cómputo las necesite, y las borra apenas termina. Es como leer un libro de mil páginas con una linterna que solo ilumina un párrafo por vez: no necesitás tener todo el libro abierto, solo la página correcta en el momento justo. Este enfoque, que los autores llaman layer streaming, elimina la dependencia de tener toda la VRAM del mundo y —esto es clave— no recurre a cuantización (que puede degradar calidad), destilación (que requiere reentrenar) ni poda (que también afecta precisión).
En modelos de mezcla de expertos (MoE) como DeepSeek-V3 o Kimi K3, la cosa se pone todavía más interesante: AirLLM solo carga los expertos que se activan para cada token, que suelen ser un subconjunto chico del total. El resultado neto es que el modelo completo puede ocupar cientos de gigas en disco, pero la VRAM que necesitás en runtime se desploma. Según el informe de El Solitario (agosto 2026), Kimi K3 corrió con apenas 3.72 GB de VRAM usando esta técnica, en una configuración que cualquier gamer de fin de semana tiene en su casa.
¿Qué modelos puedo ejecutar con AirLLM y cuánta VRAM necesito?
La compatibilidad creció bastante en 2026. Ya no es solo para Llama: desde 2026 entran modelos MoE, arquitecturas más nuevas y hasta bestias de 405B de parámetros. La tabla de abajo está armada con datos del repositorio oficial de AirLLM y pruebas reportadas por la comunidad:
| Modelo | Parámetros | VRAM mínima | Tipo |
|---|---|---|---|
| Qwen3 8B | 8 mil millones | 1-2 GB | Denso |
| Llama 70B | 70 mil millones | ~4 GB | Denso |
| Llama 405B | 405 mil millones | ~8 GB | Denso |
| DeepSeek-V3 | 671 mil millones (total) | ~12 GB | MoE |
| Kimi K3 | ~1 billón (total) | 3.72 GB | MoE |

Ojo con una cosa: en los MoE, la VRAM reportada es la que se usa en tiempo de inferencia porque solo se activan unos pocos expertos por token. El modelo completo en disco sigue siendo enorme (Kimi K3 ocupa más de 2 TB), pero eso va al almacenamiento, no a la GPU. Si tenés un SSD rápido, ni te enterás. Relacionado: gestión de seguridad con Intune.
¿Cómo funciona el streaming por capas y expertos en AirLLM?
Ponele que tenés el modelo Llama 70B bajado en tu disco, con sus 140 GB de pesos en formato float16. En una carga tradicional, necesitás meter todo eso en VRAM más el overhead de atención y el contexto —imposible en una GPU de 4 GB. Lo que hace AirLLM es particionar el modelo en las capas del transformer (o en los expertos, si es MoE), guardar cada bloque como un archivo separado en disco, y cargar a la GPU solo el bloque que se va a computar en ese paso. Terminó la cuenta de esa capa, se libera la memoria, se carga la siguiente. Así, capa por capa, el modelo avanza sin que la VRAM se entere de que está procesando algo gigantesco.
¿La contra? Bueno, el disco pasa a ser el cuello de botella. Cada capa entra y sale constantemente, y si no tenés un NVMe rápido, la latencia se siente. Pero para una consulta, un prototipo o un fine-tuning ligero, es un golazo. Y desde la versión 2.5 (lanzada en 2025), AirLLM mete prefetching: mientras la GPU computa la capa actual, la siguiente ya se está cargando en segundo plano. Eso reduce el tiempo muerto bastante (hablamos de entre 2x y 3x de aceleración respecto del streaming secuencial puro, según los benchmarks del repo).
¿AirLLM afecta la velocidad de inferencia y cómo se optimiza?
Sí, afecta. No hay magia: mover datos entre disco y GPU tiene un costo. En un modelo denso como Llama 70B, la latencia puede ser alta si comparás con una A100 cargada completa (que, dicho sea de paso, cuesta más que un auto usado). Pero la pregunta no es si es más lento que un datacenter, sino si es usable en hardware de consumo. Y la respuesta es que sí, con matices. La comunidad reporta velocidades aceptables para tareas interactivas (unos pocos tokens por segundo en GPUs viejas, bastante más en RTX 3060 para arriba). Más contexto en profundizamos en ChatGPT.
AirLLM 2.5 (lanzada en 2025) introdujo dos optimizaciones clave: prefetching de capas (la capa N+1 se carga mientras se computa la N) y compresión por bloques, que reduce el footprint en disco y acelera la lectura. En la práctica, esto significa que una RTX 3060 de 12 GB puede correr DeepSeek-V3 (un MoE de 671B) a velocidades que, sin ser de producción, permiten prototipado local. ¿Para un chatbot en tiempo real? Probablemente no. ¿Para pruebas, experimentos y desarrollo? Absolutamente.
¿Cuáles son los requisitos técnicos para usar AirLLM?
La instalación base es un simple pip install airllm, pero según el modelo que quieras correr, vas a necesitar dependencias extra. Para el caso concreto de Kimi K3 (agosto 2026), los requisitos que relevó El Solitario incluyen compressed-tensors, flash-attn, PyTorch con CUDA 12 (no necesita CUDA 13, un respiro para los que no actualizaron), y transformers en su versión 4.56.x. Lo bueno es que no pide hardware exótico: corre en Windows y Linux, con cualquier GPU NVIDIA que soporte CUDA 12. Si tenés AMD, la compatibilidad todavía está verde (ROCM es un dolor de cabeza, pero hay forks experimentales).
¿Cómo instalar y ejecutar tu primer modelo con AirLLM?
Vamos a lo concreto. Si querés probar Llama 70B en tu máquina con 4 GB de VRAM, los pasos son estos (probado en agosto 2026 con la versión 2.5 de AirLLM):
- Instalá AirLLM:
pip install airllmen tu entorno (recomendado Python 3.10+). - Bajá el modelo: podés usar cualquier checkpoint de Hugging Face compatible con Llama 2 o 3 (por ejemplo
meta-llama/Llama-2-70b-chat-hf). - Escribí el script de inferencia: importás
AirLLMLlama2(oAutoModelen las versiones nuevas), cargás el modelo y generás texto. El modelo se particiona solo en el primer arranque.
Un snippet mínimo se ve así:
from airllm import AirLLMLlama2 Complementá con modelos de lenguaje de razonamiento.
model = AirLLMLlama2.from_pretrained("meta-llama/Llama-2-70b-chat-hf", compression='4bit')
output = model.generate("Explicame qué es AirLLM en 20 palabras:")
print(output)
Ese compression='4bit' es opcional pero reduce el uso de disco y acelera la carga. La primera ejecución tarda porque particiona el modelo y lo guarda en un directorio cache; las siguientes son más rápidas porque levanta los chunks preprocesados. Si tenés un SSD NVMe, la diferencia se nota —y bastante.
Errores comunes al usar AirLLM
He visto varios tropezones repetidos en foros y en la comunidad. Estos son los tres más frecuentes y cómo esquivarlos:
- Subestimar la RAM del sistema. Que la VRAM sea poca no significa que la RAM no importe. El modelo se almacena en disco pero las estructuras de control, el tokenizer y partes del runtime viven en RAM. Con 16 GB de RAM del sistema vas justo para modelos de 70B; para 405B o MoE grandes, 32 GB es lo recomendable.
- Esperar velocidad de producción. AirLLM está pensado para prototipado, experimentación y aprendizaje. Pretender latencias de servidor con una GTX 1060 de 4 GB es pedirle peras al olmo. Usalo para probar prompts, evaluar modelos y desarrollar; para deploy productivo, vas a necesitar hardware más serio o un proveedor cloud.
- Ignorar las dependencias específicas del modelo. Cada modelo puede requerir versiones clavadas de transformers, flash-attn o PyTorch. Si instalás todo a lo loco sin leer el README del modelo en Hugging Face, preparate para errores de compatibilidad. Kimi K3, por ejemplo, necesita transformers 4.56.x sí o sí.
Preguntas Frecuentes
¿AirLLM reduce la calidad de las respuestas del modelo?
No. AirLLM no modifica los pesos del modelo ni aplica cuantización (salvo que actives compresión por bloques para almacenamiento, que es reversible). La salida es idéntica bit a bit a la del modelo original ejecutado en una GPU grande, solo que más lenta. La calidad no se negocia; el tiempo, sí. En herramientas de Google disponibles profundizamos sobre esto.
¿AirLLM funciona sin conexión a internet?
Sí, completamente offline. Una vez que descargaste el modelo en disco, toda la inferencia es local. No manda datos a ningún servidor, no requiere API keys, nada. Es ideal para entornos air-gapped o para quien valora la privacidad por sobre todas las cosas.
¿Qué tan rápido corre AirLLM 70B en una GPU de 4GB comparado con llama.cpp o GGUF?
En hardware limitado (4 GB de VRAM), AirLLM suele ser más lento que un GGUF bien cuantizado con llama.cpp porque el streaming a disco tiene más overhead que la cuantización directa en memoria. Pero ojo: AirLLM gana en calidad porque no pierde precisión por cuantización. Es un trade-off: velocidad (llama.cpp + GGUF) versus fidelidad total al modelo original (AirLLM). Para prototipado donde necesitás la respuesta exacta del modelo sin degradación, AirLLM es la opción.
¿Puedo ejecutar DeepSeek-V3 en mi GPU de 12GB con AirLLM?
Sí, según los datos del repositorio oficial, DeepSeek-V3 (MoE de 671B) requiere aproximadamente 12 GB de VRAM con AirLLM porque solo carga los expertos activos. Una RTX 3060 de 12 GB lo corre sin problemas. Con 8 GB o menos, el modelo no entra porque el overhead de atención y contexto se come la diferencia.
¿AirLLM soporta Windows además de Linux?
Sí, el paquete es multiplataforma (Windows y Linux). La instalación con pip funciona en ambos sistemas, aunque en Windows puede haber roce con dependencias como flash-attn o bitsandbytes que tienen compilación nativa. Nada que un WSL2 no resuelva si te trabás con la instalación nativa.
Conclusión
AirLLM cambió las reglas de juego en 2026 para cualquiera que quiera experimentar con modelos grandes sin depender de hardware de cinco cifras. Lo que antes requería alquilar una A100 por hora, hoy lo podés hacer en tu propia máquina con una GPU de 4 GB mientras te tomás un café. La magia del streaming por capas y expertos elimina la barrera de VRAM sin tocar la calidad del modelo, y con las optimizaciones de prefetching y compresión, la velocidad ya no es un castigo.
¿Para producción en tiempo real? No, probablemente no. Pero para desarrollo, prototipado, evaluación de modelos y aprendizaje, es una herramienta que democratiza el acceso a la IA de punta de una manera impensada hace solo un año. Si tenés una GPU modesta y ganas de meter mano, instalalo. El comando es un pip install y el primer modelo lo tenés corriendo en menos de una hora.
Fuentes
- Repositorio oficial de AirLLM en GitHub — código fuente, documentación y benchmarks actualizados a agosto de 2026.
- AirLLM y Kimi K3: inferencia con VRAM mínima (agosto 2026) — análisis de requisitos y pruebas con el modelo MoE Kimi K3.
