NanoGPT Speedrun Frontier: el récord de 90 segundos

En pocas palabras: NanoGPT Speedrun Frontier es el benchmark de Prime Intellect donde agentes de IA autónomos entrenan un GPT-2 de 124 millones de parámetros hasta una pérdida de 3.28 en 8 GPUs H100. A agosto de 2026, el récord quedó en menos de 90 segundos, tras 153 ejecuciones de 18 modelos de frontera.

Prime Intellect convirtió el entrenamiento veloz de modelos de IA en una competencia con tablero de posiciones: su benchmark NanoGPT Speedrun Frontier acumula, a agosto de 2026, 153 ejecuciones autónomas de 18 modelos de frontera que intentan entrenar un GPT-2 de 124 millones de parámetros hasta una pérdida de 3.28. El récord de la disciplina quedó en menos de 90 segundos.

NanoGPT Speedrun Frontier es un benchmark competitivo creado por Prime Intellect donde agentes de IA autónomos optimizan el entrenamiento de un GPT-2 de 124 millones de parámetros sobre el dataset FineWeb, buscando una pérdida de 3.28 en el menor tiempo posible sobre 8 GPUs H100. La iniciativa une dos planos: el speedrun comunitario de modded-nanogpt, que llevó el entrenamiento de 45 minutos a menos de 90 segundos, y una liga donde modelos como Fable 5, Opus 5 y DeepSeek V4 Pro cierran ese mismo gap sin intervención humana.

En 30 segundos

  • Récord actual: menos de 90 segundos para llevar un GPT-2 de 124M de parámetros a pérdida 3.28 en 8 GPUs H100, unas 30 veces más rápido que el baseline de 45 minutos (que no es poco).
  • Escala del experimento: Prime Intellect registró 153 ejecuciones autónomas con 18 modelos de frontera, según su página de investigación.
  • Ganador: según el tablero a agosto de 2026, Fable 5 cerró el 81,7% del gap con un score de 2726, tras 8,7 días de trabajo y 800M de tokens procesados.
  • Clave técnica: el optimizador Muon recortó el entrenamiento de 45 a 5 minutos; Flash Attention 3 y Polar Express hicieron el resto.
  • Calidad fija: la pérdida objetivo queda clavada en 3.28; si el modelo no llega, el run no puntúa.

¿Quién creó el NanoGPT Speedrun y cuál es su objetivo?

La idea original es de Keller Jordan, que transformó el entrenamiento de GPT-2 en un speedrun abierto con código y tablero públicos en el repositorio modded-nanogpt. La regla es una: llegar a pérdida 3.28 sobre FineWeb en el menor tiempo posible. Prime Intellect tomó esa base y le agregó la capa competitiva actual, con agentes de IA de frontera ejecutando todo el proceso de optimización de punta a punta.

Ponele que te dan ocho GPUs H100, un script que entrena GPT-2 en poco menos de una hora y una consigna: bajá ese tiempo como puedas, pero el modelo final tiene que quedar igual de bien. Eso es el speedrun. La calidad no se negocia, así que cada segundo que recortás tiene que salir de ingeniería de verdad y no de recortes sucios en el entrenamiento.

¿Por qué tanto interés del mundo de la investigación? Porque el benchmark mide algo que los laboratorios necesitan entender: qué tan capaz es un modelo de IA de hacer investigación en IA. METR, la organización que evalúa capacidades de modelos frontera, le dedicó una nota de progreso el 21 de abril de 2026. Si un agente comprime 45 minutos de entrenamiento en 90 segundos sin ayuda humana, está mostrando habilidad de investigación aplicada, algo muy distinto de responder preguntas.

¿Cuánto tarda el NanoGPT Speedrun en entrenar un GPT-2?

Depende de a qué punto de la historia mires: el baseline original necesitaba 45 minutos, las primeras optimizaciones bajaron la marca a unos 5 minutos y el récord actual quedó por debajo de los 90 segundos sobre 8 GPUs H100, según el historial público del repositorio. Una mejora de más de 30 veces con el mismo hardware: un golazo de ingeniería.

¿Y cómo se apila semejante salto? Le metés el optimizador Muon y el tiempo cae de 45 a 5 minutos (spoiler: funcionó), después cambiás la atención por kernels de Flash Attention 3, ajustás la regularización, afinás los learning rates capa por capa, trabajás con precisión mixta, reordenás operaciones para que la GPU nunca quede esperando datos y, cuando levantás la vista del perfilador, esos 45 minutos iniciales ya son menos de minuto y medio.

Tyler Romero documentó su bitácora completa del speedrun, y sirve para dimensionar cuánta prueba y error hay detrás de cada segundo recortado. La verdad es que el camino fue todo menos prolijo: gente rompiéndose la cabeza con ideas que en su mayoría no funcionan, hasta que una zafa.

¿Cómo funciona la competencia de optimización?

La métrica central es el porcentaje del gap cerrado: cada agente arranca desde el baseline original (3290) y la referencia a batir es el récord humano (2600). Cuanto más cerca del récord termine el agente, mayor porcentaje cierra. Todo corre, además, bajo las mismas restricciones para que la comparación sea limpia; estas son las reglas del juego:

  • Presupuesto fijo: 24 horas de cómputo sobre 8 GPUs H100 por ejecución, idéntico para todos los participantes.
  • Cuenta verificable: con Fable 5 en 2726, el cálculo da (3290-2726)/(3290-2600) = 81,7% del gap cerrado; la misma fórmula ubica a Opus 5 en 53,6%.
  • Dimensiones medidas: días de agente, tokens totales consumidos, tokens de salida, cantidad de experimentos y de llamadas a funciones.
  • Participación abierta: el código y las reglas del speedrun base son públicos en GitHub, así que podés estudiarlos o proponer mejoras vos mismo.

El punto de fijar el presupuesto es separar capacidad de gasto. Sin esa regla, cualquier modelo con bolsillo ilimitado ganaría por saturación de experimentos. Con 24 horas de cómputo parejas, el ranking dice quién investiga mejor, no quién puede quemar más plata.

¿Qué modelos de IA ganaron la competencia NanoGPT 2026?

Fable 5 dominó la tabla con el 81,7% del gap cerrado y un score de 2726, Opus 5 quedó segunda con 53,6% y DeepSeek V4 Pro cerró apenas 12,3%, aunque con un consumo de recursos muchísimo menor. Estos resultados salen de las 153 ejecuciones autónomas que Prime Intellect registró en su página de investigación.

ModeloGap cerradoScoreTokens usadosDías de agente
Fable 581,7%2726800M8,7
Opus 553,6%2920n/dn/d
DeepSeek V4 Pro12,3%n/d26M1,1
entrenar modelos ia rápido diagrama explicativo

Los campos n/d corresponden a valores que no figuran en el resumen público del benchmark.

Fable 5 gastó de más para ganar de más: 800M de tokens y 8,7 días de trabajo autónomo le alcanzaron para encadenar muchos más experimentos que sus rivales. DeepSeek V4 Pro eligió el camino inverso y cerró su brecha con apenas 26M de tokens en 1,1 día, una “eficiencia” notable si tu variable es el costo, aunque su resultado viene flojo si la variable es el gap.

¿Cuál conviene? Depende de la pregunta que quieras responder. Para máximo resultado con presupuesto holgado, el patrón de Fable 5 gana claro. Mirando el caso de DeepSeek V4 Pro, aparece otra lectura: quizás el futuro de la investigación automatizada pase por modelos chicos que prueban mucho gastando poco.

El debate público siguió vivo en el thread de Hacker News, con la comunidad revisando cada decisión metodológica.

¿Qué técnicas permiten entrenar modelos de IA rápido?

Tres familias de técnicas explican la mayor parte de la mejora: el optimizador Muon, la atención eficiente con Flash Attention 3 y FlexAttention, y las implementaciones especializadas como Polar Express, todas corriendo sobre el mismo hardware de 8 GPUs H100, sin cambios de infraestructura. En cómo funciona la arquitectura GPT por dentro profundizamos sobre esto.

  • Muon: el optimizador que cambió la escala del juego. Ortogonaliza el momento del gradiente mediante iteraciones de Newton-Schulz y permite converger en una fracción de los pasos habituales; el trabajo tiene discusión pública en este foro de OpenReview.
  • Flash Attention 3 y FlexAttention: kernels que calculan la atención exprimiendo la memoria y los núcleos de la H100, atacando el cuello de botella clásico de los transformers.
  • Polar Express: implementación especializada que acelera el cálculo dentro del loop de entrenamiento.
  • Regularización y precisión mixta: escalados por capa y formatos de baja precisión donde corresponde, para que cada paso de entrenamiento valga más.

Ojo con esto: ninguna de estas piezas funciona aislada. Muon sin buena regularización se descontrola, la atención rápida sin un pipeline bien ordenado deja la GPU esperando, y cada cambio obliga a retocar los demás. El speedrun premia la ingeniería sistemática; el truco suelto no alcanza.

¿Por qué importa entrenar rápido si el modelo es pequeño?

Porque la velocidad de entrenamiento define cuántas ideas podés probar por semana, y esa es la moneda fuerte de la investigación en IA. Un ciclo corto multiplica la cantidad de hipótesis evaluadas con el mismo presupuesto, y eso vale más que cualquier mejora cosmética.

Hacé la cuenta: un equipo que entrena su modelo experimental en 90 segundos puede evaluar cientos de configuraciones en una tarde. El mismo equipo con runs de 45 minutos necesita días para recorrer el mismo espacio de ideas, y para cuando termina, la hipótesis ya envejeció. Menos horas de GPU significan además menos energía y menos costo, un detalle nada menor cuando cada peso de cómputo cuenta.

Hay otro efecto que me parece el más valioso: democratización. Lo re piola es que técnicas como Muon o Flash Attention son públicas y gratuitas, así que un laboratorio chico o un grupo universitario de la región, pagando GPUs a precio dolarizado, puede competir en condiciones mucho más parejas que antes. No vas a entrenar un modelo frontera en tu garage, pero el gap para hacer investigación seria se achicó bastante.

Y el malentendido típico: asumir que rápido implica peor. Acá la trampa se desarma sola, porque la pérdida objetivo queda fija en 3.28 y un run que no llega no puntúa. Ganás velocidad con mejores algoritmos y la calidad queda intacta. Lo explicamos a fondo en las novedades de GPT-5.6 Sol.

¿Qué generaliza del speedrun a modelos de producción?

Las técnicas del speedrun trasladan bien a modelos más grandes porque atacan problemas generales: convergencia del optimizador y eficiencia de la atención. NanoGPT es simple, pero representativo: tiene la misma arquitectura transformer y los mismos cuellos de botella que un modelo de 7B o 70B.

Por eso los SLM de 3 a 4 mil millones de parámetros que hoy corren en producción, como Phi-3 Mini, Gemma 2 o Llama 3.2, usan variaciones de estas mismas optimizaciones para dar respuestas rápidas a costo contenido. La línea entre el juguete de investigación y el producto comercial es más corta de lo que parece.

Dicho esto, tomalo con pinzas: que una técnica funcione en 124M de parámetros no garantiza que escale limpio a tamaños mayores. Cada salto de escala trae sorpresas propias, y buena parte de la investigación actual consiste en verificar cuáles de estas ganancias sobreviven el viaje.

Errores comunes al interpretar el NanoGPT Speedrun

Antes de sacar conclusiones apuradas, estos equívocos aparecen una y otra vez en las discusiones sobre el benchmark.

  • Asumir que rápido significa peor modelo: falso. La pérdida objetivo queda fijada en 3.28 y Prime Intellect valida la calidad de cada run; si el modelo no alcanza ese valor, el tiempo no cuenta.
  • Atribuir el récord al hardware: el baseline y el récord corrieron sobre las mismas 8 GPUs H100. Los 30x de mejora salieron del software.
  • Confundir la liga de agentes con el récord global: los agentes compiten sobre referencias fijas del benchmark (baseline 3290, récord humano 2600), mientras el récord absoluto de la disciplina ya quedó debajo de los 90 segundos. Conviven ambas escalas (sí, en serio).
  • Querer replicarlo en una laptop: las configuraciones récord exigen 8 H100. Podés estudiar el código y correr versiones reducidas, pero tus tiempos no van a ser comparables con el tablero.

Preguntas Frecuentes

¿Cómo se entrena un modelo de lenguaje en menos de 90 segundos?

Combinando el optimizador Muon, kernels de atención como Flash Attention 3, regularización fina y precisión mixta sobre 8 GPUs H100. Las reglas aseguran la calidad: el run solo cuenta si el GPT-2 de 124M de parámetros alcanza una pérdida de 3.28 sobre FineWeb. Cubrimos ese tema en detalle en armar un recepcionista virtual con IA.

¿Cuánto cuesta entrenar un modelo con el NanoGPT Speedrun?

El benchmark fija el presupuesto en 24 horas de cómputo sobre 8 GPUs H100 por ejecución, así que el costo depende del precio de alquiler de esas GPUs en cada proveedor. En la liga de agentes, el gasto en tokens fue de 26M en DeepSeek V4 Pro y de 800M en Fable 5.

¿Puedo correr el NanoGPT Speedrun en mi propia computadora?

Podés bajar el código desde el repositorio modded-nanogpt, pero las configuraciones récord exigen 8 GPUs H100. En hardware menor podés ejecutar versiones reducidas para aprender, aunque tus tiempos no serán comparables con el tablero oficial.

¿Qué diferencia hay entre entrenar rápido y entrenar bien?

En este benchmark, la calidad es prerequisito: la pérdida tiene que llegar a 3.28 sí o sí, y recién ahí empieza a contar el tiempo. Fuera del speedrun la lógica se repite en producción, donde un checkpoint veloz pero flojo no le sirve a nadie.

¿Este método sirve para entrenar modelos tan grandes como GPT-4 o Claude?

Las técnicas generales (optimizadores modernos y atención eficiente) transfieren en parte a modelos de 7B o 70B, pero el speedrun las valida sobre un modelo de 124M de parámetros. Extrapolarse a escala frontera exige experimentos adicionales que este benchmark no cubre. Si querés entender cómo funciona esta familia de modelos por dentro, arrancá por nuestra guía completa de ChatGPT.

Conclusión

El NanoGPT Speedrun Frontier dejó dos resultados concretos en 2026: el entrenamiento de un GPT-2 pasó de 45 minutos a menos de 90 segundos con técnicas públicas, y los agentes de IA demostraron que pueden cerrar por su cuenta una porción importante de un problema real de optimización, con Fable 5 llegando al 81,7% del gap. La primera noticia abarata y acelera la investigación de cualquiera que entrene modelos. La segunda es una medición seria de hacia dónde va la automatización de la investigación en IA.

Si entrenás modelos, probá Muon y los kernels de atención eficiente en tu próximo run: son gratis, tienen documentación y el speedrun les dio el mejor banco de pruebas posible. Si seguís el tema desde afuera, guardá esta clase de benchmarks como referencia: dicen más sobre el estado real de la IA que cualquier demo llamativa.

Fuentes

Desplazarse hacia arriba