En pocas palabras: From Gradients to ChatGPT es un curso gratuito de 20 módulos más un repaso, alojado en mister-meeseeks.github.io, donde escribís vos mismo el autodiff, el tokenizer, el transformer y un asistente con RAG. Todo corre en una MacBook con chip serie M: cero GPUs y cero costo.
From Gradients to ChatGPT es un curso de autoestudio, alojado en mister-meeseeks.github.io, que enseña a construir un stack completo de modelos de lenguaje escribiendo cada pieza por tu cuenta. Son veinte módulos más un repaso inicial, divididos en dos partes: la primera levanta el modelo (de la derivada escalar a un transformer que genera texto) y la segunda arma el sistema alrededor, hasta terminar en un asistente de chat con herramientas y RAG.
En 30 segundos
- Cero costo de cómputo: la restricción dura del curso es que todo corre en una MacBook con chip serie M, sin GPUs en la nube ni servicios pagos.
- 20 módulos más un repaso: el esfuerzo estimado es de una semana por módulo, a nivel de curso universitario exigente.
- Arrancás en la derivada: el módulo 1 empieza con autodiff escalar y el último entrega un asistente de chat con RAG y herramientas, armado de punta a punta por vos.
- Escala toy a propósito: el transformer final tiene unos pocos millones de parámetros, un corpus que entra en RAM y un tokenizer que se entrena en diez minutos.
- Sin experiencia previa en deep learning: alcanzan Python, cálculo básico y álgebra lineal; el módulo 0 cubre lo que falte.
¿Qué es From Gradients to ChatGPT y por qué deberías mirarlo?
Es un currículo estructurado que responde la pregunta que casi nadie se hace aunque use el producto todos los días: ¿cómo funciona por dentro un modelo de lenguaje? Según la página oficial del curso, millones de personas interactúan con LLMs a diario, pero pocos se molestan en entender qué es un modelo, cómo aprende o cómo una multiplicación de matrices termina produciendo respuestas que parecen “inteligentes”.
La apuesta pedagógica es contraintuitiva: todo chico a propósito. Un tokenizer que se entrena en diez minutos, un transformer de pocos millones de parámetros, un corpus que entra en la RAM de tu laptop. “Una vez que construiste cada capa a escala toy, las versiones de producción dejan de ser magia”, resume el sitio oficial. Después de debuggear atención con tus propias manos, los papers de gran escala se leen distinto, te lo aseguro.
¿Por qué importa esto ahora, a agosto de 2026? Porque la brecha entre usar IA y entender IA se está volviendo una ventaja competitiva concreta para desarrolladores. Lo explicamos a fondo en nuestra guía completa sobre ChatGPT.
¿Cuál es el camino desde gradientes hasta ChatGPT?
Ponele que abrís el módulo 1 y lo único que tenés es una función que calcula derivadas de números escalares. Suena a poco. De ese grano sale todo.
La Parte I, bautizada “de gradientes a un modelo de lenguaje”, crece capa por capa: autodiff escalar, tensores, tu primera red neuronal, embeddings y posiciones, predicción del próximo token, el bloque transformer y, al final, sampling y decodificación. Cada pieza se apoya en la anterior y no hay cajas negras en el camino. Cuando terminás, tenés un modelo que genera texto legible en tu laptop, con cada capa escrita por vos. El sitio es claro en que cerrar esta parte “es un logro real”, y les creo.
¿Qué son los transformers y por qué son tan importantes?
Un transformer es la arquitectura de red neuronal que usan los LLM modernos, incluida toda la familia GPT. Su aporte clave es la atención: un mecanismo que permite ponderar qué partes del contexto importan para predecir el siguiente token. En el curso no es un objeto de culto sino un módulo más, que escribís, rompés y debuggeás como cualquier otro.
Ahí también aparece el tokenizer, otra pieza que muchos dan por sentada. Si alguna vez viste cómo un modelo corta el texto en pedazos raros, ese misterio se resuelve acá, entrenando uno propio en minutos. Cubrimos ese tema en detalle en cómo funciona GPT desde sus orígenes.
¿Cómo se convierte un modelo crudo en un asistente tipo ChatGPT?
Con pretraining solamente obtenés un autocompletador estadístico muy bueno. El salto hacia el asistente ocurre en la Parte II, que cambia de materia: menos derivación, más ingeniería de sistemas. Los módulos cubren instruction tuning con SFT, ajuste de preferencias con DPO, alucinaciones y evaluación, modelos locales preentrenados e inferencia, generación aumentada por recuperación (RAG) y un capstone final: tu propio mini ChatGPT.
El recorrido de esta mitad es una cadena: entrenás el modelo con instrucciones, lo afinás con preferencias humanas, medís cuánto alucina, lo conectás con documentos externos vía RAG, le sumás herramientas y al final lo envolvés en un loop de agente que decide cuándo consultar cada cosa. Suena a mucho, y lo es, pero el orden evita que nada parezca un conjuro.
Dato útil para quienes ya tienen base: la Parte II admite entrada directa. Si dominás los fundamentos y solo querés el material de sistemas, podés saltar sin culpa. Ojo con el detalle del capstone, además: el asistente final tiene backend intercambiable, así que podés enchufar tu modelo toy o un modelo abierto local más potente “cuando querés respuestas de verdad útiles”, como dicen los autores. Honesto hasta el final.
¿Qué requisitos técnicos y de hardware necesitás?
Necesitás tres cosas: una MacBook con chip Apple Silicon de la serie M, Python con soltura y la matemática de primer año universitario. El resto, el propio curso lo construye contigo. Para más detalles técnicos, mirá las novedades de GPT-5.6 Sol para Plus.
- Hardware: cualquier MacBook con chip serie M. Es la restricción dura del proyecto: nada de GPUs en la nube ni cómputo pago. La escala toy (millones de parámetros, corpus en RAM) hace viable el entrenamiento local.
- Python domado. Cada semana implementás un subpaquete nuevo dentro del paquete principal del curso, así que conviene tener el lenguaje bajo control.
- Matemática de grado básica. Regla de cadena, gradientes y álgebra lineal elemental. No hace falta experiencia previa en deep learning: el módulo 0 repasa prerrequisitos y los módulos 1 a 3 construyen la base matemática desde cero.
- Ganas de debuggear sin red de protección. El sitio lo pide sin rodeos: disposición a leer papers de vez en cuando y a depurar tu propio código sin un framework que esconda el modo de fallo.
¿Cómo se compara con otros cursos de IA?
Su rasgo diferencial es el enfoque bottom-up: mientras la mayoría de los cursos te hace consumir PyTorch o TensorFlow como cajas negras, acá cada capa pasa por tus manos, así que entendés por qué funciona cada pieza y no solo cómo llamarla. El sitio reconoce la deuda con los videos de Andrej Karpathy y lo plantea sin vueltas: si los viste y deseaste un currículo estructurado con ejercicios, entregables y tests, esto es eso, tal cual.
| Criterio | From Gradients to ChatGPT | Curso típico con frameworks | Videos sueltos estilo Karpathy |
|---|---|---|---|
| Punto de partida | Autodiff escalar escrito por vos | Librerías ya instaladas | Depende del video |
| Costo de cómputo | Cero, todo en una MacBook M-series | Generalmente GPUs en la nube | Cero |
| Cajas negras | Ninguna | El framework entero | Algunas |
| Estructura | 20 módulos con entregables y tests | Variable | Sin ejercicios formales |
| Producto final | Asistente con RAG, herramientas y backend intercambiable | Notebooks temáticos | Modelos toy puntuales |
| Ritmo sugerido | Una semana por módulo | Libre | Libre |

Ojo con la columna del medio: describe el patrón típico, no un curso específico. ¿Y el costo oculto de la primera columna? Tu tiempo, veinte semanas de él.
Eso sí: este formato exige más que un curso de prompts de cuatro horas. Si buscás resultados rápidos para consumir APIs, no es tu terreno; si querés criterio propio para diagnosticar modelos, sí. Para quienes estamos en Latinoamérica, el dato del costo cero pesa doble, porque una factura mensual de GPU en dólares puede descarrilar cualquier plan de estudio.
¿Cómo es la estructura semanal de cada módulo?
Cada semana sigue el mismo ciclo de tres pasos. Leés la página de lección, implementás el subpaquete de la semana dentro del paquete Python del curso y cerrás con ejercicios en un Jupyter notebook. Las lecciones viven en el sitio y también como markdown en el repositorio, y el quickstart del README deja todo configurado en tu máquina.
Los autores dejan dos consejos que valen oro. Primero, seguir avanzando: si un módulo te tiene trabado, devolvé la implementación de referencia de ese bloque y continuá con tu propio código en el resto. Segundo, avisar dónde te perdiste, porque nada del curso “llama a casa”: si un módulo hace perder gente en silencio, ellos nunca se enteran salvo que lo digas. Detalle de diseño que habla bien de quiénes lo escribieron.
Errores comunes al intentar aprender LLMs desde primeros principios
Ninguno de estos tropiezos es teórico: los vi repetirse en equipos con los que trabajé, y el diseño del curso ataca cada uno de forma explícita. Más contexto en armar tu propio recepcionista virtual con IA.
- Consumir frameworks como cajas negras. El tutorial corre a la primera y nadie pregunta qué hace el backward pass. Cuando escribís autodiff escalar a mano, el gradiente deja de ser un número que aparece de la nada.
- Saltarse la matemática que parece innecesaria. La regla de cadena parece trivia de primer año hasta que sos vos quien tiene que propagar gradientes a través de cinco capas. Los módulos 0 a 3 existen justo por eso; no los quemes.
- Arrancar directamente por el transformer. Todos queremos atención y embeddings ya. Sin tensores y sin next-token prediction previos, el bloque transformer se vuelve un objeto misterioso que no podés debuggear.
- Subestimar la carga horaria. Veinte semanas a ritmo universitario exigente no entran en un fin de semana motivado. Tratalo como una materia de semestre, con franja fija en la agenda, o el abandono llega antes de la mitad.
Preguntas Frecuentes
¿From Gradients to ChatGPT es gratis?
Sí. El material es público: las lecciones están en el sitio oficial y el código en un repositorio abierto de GitHub. Como todo corre en tu propia Mac, tampoco hay costo de cómputo; lo único que invertís es tiempo.
¿Cuánto tiempo demanda completar el curso?
Veinte módulos más un repaso de prerrequisitos, con un esfuerzo estimado de una semana por módulo a nivel de curso universitario exigente. En la práctica, hablamos de un semestre de estudio serio. La Parte I sola ya cuenta como un logro considerable según el propio sitio.
¿Necesito una GPU o servicios en la nube?
No. La restricción dura del curso es que todo corre en una MacBook con chip serie M, sin GPUs en la nube ni cómputo pago. El modelo toy tiene unos pocos millones de parámetros y el corpus entra en memoria RAM.
¿Puedo hacerlo si nunca estudié deep learning?
Sí. Pedís Python, cálculo de grado (regla de cadena, gradientes) y álgebra lineal básica. El módulo 0 repasa los prerrequisitos y los módulos 1 a 3 construyen la base matemática desde cero, así que la experiencia previa en deep learning no es necesaria.
¿El chatbot final sirve para trabajar o es solo didáctico?
El modelo que entrenás es pequeño (millones de parámetros) y sirve para entender, no para producir. Pero el capstone tiene backend intercambiable: podés conectar un modelo abierto local más potente cuando necesitás respuestas de verdad útiles, manteniendo tu arquitectura de RAG y herramientas.
Conclusión
Lo que cambia con este tipo de recursos no es la tecnología sino el acceso: entender un LLM de punta a punta dejó de exigir factura de cloud ni credenciales académicas, y hoy alcanza una Mac y unas veinte semanas. En un mercado lleno de tutoriales que enseñan a llamar APIs, un curso que construye criterio desde la derivada destaca solo.
Mi recomendación práctica, después de recorrer el material: revisá los prerrequisitos esta misma semana, bloqueá una franja horaria fija en tu agenda y arrancá por el módulo 0 aunque te parezca básico. Si algún módulo te pierde, avisales; el ciclo de mejora depende de eso. Tu versión futura, la que diagnostica por qué su asistente alucina en vez de rezarle al prompt, te lo va a agradecer.
