Los LLM no son solo predictores de tokens

En pocas palabras: Los LLMs modernos trascienden la predicción de tokens gracias al RLVR, técnica implementada masivamente en 2024. Modelos como o1 no solo imitan datos, sino que optimizan estrategias mediante recompensas verificables, funcionando como agentes autónomos que aprenden por prueba y error.

Dejar de pensar en los LLMs como simples “predictores del siguiente token” es clave para entender su evolución actual. Aunque la arquitectura base emite tokens autoregresivamente, el post-training con RLVR permite que el modelo explore y aprenda de resultados, no solo imite datos existentes.

En 30 segundos

  • La analogía clásica queda corta: Decir que un LLM solo predice el próximo token describe el mecanismo, pero ignora cómo aprende realmente en producción.
  • El rol del RLVR: El Reinforcement Learning with Verifiable Rewards cambia el juego: el modelo genera secuencias nuevas y aprende si ganaron o perdieron, no solo copia lo visto.
  • El ejemplo del ajedrez: Un motor entrenado en partidas reales predice jugadas; uno que explora todas las posibilidades busca ganar. Los LLM modernos se parecen más al segundo.
  • Implicación práctica: Entender esto mejora tus prompts: no pedís una estadística, guiás a un agente que optimiza estrategias para un objetivo.

Si alguna vez te preguntaron qué son los LLM y respondiste “máquinas que predicen la siguiente palabra”, tenías razón… hace tres años. Hoy esa definición es incompleta. Es como decir que un auto es “un montón de piezas metálicas”. Técnicamente cierto, pero no explica por qué funciona ni para qué sirve. La verdad es que la distinción entre pre-training y post-training cambió todo el paradigma operativo de estos modelos.

Los transformers siguen emitiendo tokens uno tras otro (P(x_t|x_el análisis publicado este 4 de septiembre de 2026, el uso de RLVR (Reinforcement Learning with Verifiable Rewards) permite que el modelo descubra soluciones mediante exploración autónoma. O sea, aprende de sus propios errores y aciertos generados en tiempo real, algo que la simple predicción de tokens no contempla.

¿Por qué la definición de ‘next-token predictor’ es incompleta?

Es una aproximación de orden cero válida, pero limitada. Durante el pre-training, el modelo toma una secuencia de tokens previos y ajusta sus pesos para hacer más probable el token que efectivamente siguió en los datos de entrenamiento. Conceptualmente, el bucle de entrenamiento es directo: mirás el pasado, acertás el futuro inmediato, recibís feedback. Eso es imitación pura. Te puede servir nuestra cobertura de fundamentos de modelos de lenguaje.

El problema surge cuando asumimos que eso es todo lo que pasa. Porque los LLMs que usamos hoy no son modelos base crudos. Son productos post-trained. Y ahí entra el RLVR. En esta fase, el modelo no espera a ver qué token apareció en un dataset estático. Genera él mismo una secuencia nueva, evalúa el resultado (recompensa verificable), y ajusta sus parámetros basándose en si esa exploración tuvo éxito. No aprende porque “esa palabra estaba ahí”, sino porque “esa cadena de palabras resolvió el problema”.

(Spoiler: esta diferencia es enorme si querés escribir buenos prompts).

Diferencia clave entre Pre-training y RLVR en los LLM

qué son los llm diagrama explicativo

Para verlo claro, comparémoslos lado a lado. En pre-training, el actor humano (o el dataset) define la verdad. El modelo minimiza la pérdida al copiar patrones observados. En RLVR, el modelo es el explorador. Genera hipótesis, las prueba contra un entorno o un verificador lógico, y aprende de la consecuencia.

Fase de EntrenamientoFuente de AprendizajeMecanismo de AjusteCapacidad Resultante
Pre-trainingDatos existentes (corpus)Predicción del token observadoImitación de patrones lingüísticos
RLVR (Post-training)Secuencias generadas por el modeloMaximización de recompensa verificableRazonamiento y resolución de problemas

Lo interesante es que el bucle técnico sigue siendo autoregresivo. El modelo sigue emitiendo tokens uno a uno. Pero la señal de gradiente ya no viene de “acertar la próxima palabra del libro”, sino de “lograr el objetivo final de la tarea”. Esto significa que un LLM puede aprender ideas que nunca existieron en su corpus de entrenamiento original. Si el modelo descubre una forma novedosa de resolver una ecuación matemática y el verificador le da +1 punto, refuerza esa ruta. No importa si ningún humano escribió esa solución antes. Esa capacidad de descubrimiento es lo que rompe la analogía del autocompletado. Esto se conecta con lo que analizamos en arquitectura interna de GPT.

La analogía del motor de ajedrez para entender el cambio de paradigma

Ponele que tenés dos sistemas de IA jugando al ajedrez. El primero está entrenado sobre una base de datos gigante de partidas de Grandes Maestros. Ante una posición dada, calcula cuál sería la jugada más probable que haría un GM. Es un predictor de próximos movimientos. Funciona bien para imitar estilo, pero si el rival hace una jugada extraña fuera del manual, el sistema puede fallar porque no sabe cómo responder a algo que no vio.

El segundo sistema es un motor idealizado que ha explorado cada posible partida hasta el fin. Conoce la probabilidad de victoria desde cualquier tablero. No le importa qué jugó Kasparov en 1985; le importa qué jugada maximiza la probabilidad de ganar ahora. No intenta predecir qué movimiento apareció después en un conjunto de datos, sino elegir aquel que lleve a la victoria. Esta distinción ilustra por qué llamar al segundo sistema “predicador de siguientes movimientos” resulta extraño.

Los LLMs post-trained con RLVR se parecen más al segundo motor. Dejan de ser predictores pasivos de texto para convertirse en buscadores activos de soluciones válidas. La “innovación” aquí no está en la arquitectura transformer, que sigue igual, sino en la función de pérdida que guía el aprendizaje. Más contexto en uso práctico de ChatGPT.

Cómo afecta esto al uso real de la Inteligencia Artificial

Si entendés que el modelo no solo “completa frases” sino que “evalúa estrategias”, cambia tu forma de interactuar. Cuando le pedís a Claude o Gemini que arme una query SQL, no esperes que recite una sintaxis común. Esperá que construya una lógica de ejecución y valide internamente si esa lógica resuelve tu consulta. Por eso los prompts que especifican criterios de éxito (“verificá que no haya columnas ambiguas”) funcionan mejor que los vagos (“dame un código”).

Además, técnicas como RLHF (Reinforcement Learning from Human Feedback) ya habían movido la aguja hacia la simulación de un asistente útil. Pero RLVR profundiza esto permitiendo el descubrimiento autónomo. El modelo puede proponer una solución creativa a un bug de software, y si el compilador no tira error, el modelo aprende que esa creatividad tiene valor. Esto abre la puerta a agentes que no solo responden preguntas, sino que ejecutan tareas complejas donde el camino óptimo no estaba documentado en internet.

Ojo con esto: no significa que el modelo sea consciente o tenga intención. Sigue siendo matemáticas puras. Pero la matemática dejó de ser estadística descriptiva para volverse optimización funcional. Y eso, para vos como desarrollador o usuario avanzado, implica que podés confiar más en el razonamiento emergente que en la memoria memorizada. Lo explicamos a fondo en enfoque de razonamiento en Claude.

Errores comunes al conceptualizar los LLMs

  • Creer que la longitud del contexto es memoria: Mucha gente piensa que poner 1 millón de tokens en el prompt hace que el modelo “recuerde” todo. Falso. El modelo procesa atención, no almacenamiento. Si no aplica RLVR o fine-tuning específico, simplemente prioriza según peso atencional, no comprensión profunda de toda la secuencia.
  • Asumir que “alucinar” es un bug de predicción: Las alucinaciones no son errores de “no saber la siguiente palabra”. Son fallos en la evaluación de recompensas durante la generación. El modelo encontró una ruta plausible gramaticalmente pero falsa lógicamente, y el verificador (si existe) no lo frenó a tiempo.
  • Ignorar el impacto del post-training: Dos modelos con la misma arquitectura base pueden comportarse radicalmente distinto según cómo fueron entrenados con RLVR. Juzgar a un LLM solo por su tamaño de parámetros es quedarse en la superficie del iceberg.

Preguntas Frecuentes

¿Qué son los LLM exactamente?

Son modelos de lenguaje grandes basados en arquitecturas Transformer que generan texto de forma autoregresiva. Sin embargo, su comportamiento actual está dominado por técnicas de post-training como RLVR, que les permiten optimizar resultados funcionales además de predecir tokens estadísticamente probables.

Qué es el RLVR y cómo cambia el entrenamiento de los LLM?

RLVR significa Reinforcement Learning with Verifiable Rewards. Cambia el entrenamiento porque el modelo no aprende solo copiando datos de entrenamiento, sino generando sus propias respuestas y ajustándose según si esas respuestas cumplen criterios objetivos de éxito (como pasar un test unitario o resolver una ecuación).

Por qué la analogía de ajedrez explica mejor el funcionamiento de los LLM?

Porque distingue entre imitar jugadas vistas (pre-training) y buscar la victoria mediante exploración (RLVR). Los LLM modernos operan más como el segundo caso: evalúan consecuencias de sus salidas para maximizar la utilidad, no solo la coherencia superficial.

Cómo influye el post-training en las capacidades actuales de la IA?

El post-training transforma un modelo de “autocompletado” en un “razonador”. Técnicas como RLHF y RLVR alinean al modelo con intenciones humanas y objetivos verificables, permitiéndole manejar tareas complejas que requieren planificación y validación lógica, no solo fluidez textual.

Conclusión

Seguir pensando en los LLMs únicamente como predictores del siguiente token es quedarse con la foto vieja. La realidad técnica de 2026 muestra que el verdadero poder viene de la etapa de post-training, especialmente con RLVR. Esto convierte a los modelos en sistemas de optimización de resultados, capaces de descubrir soluciones no vistas en los datos. Para vos, esto significa tratarlos menos como oráculos de texto y más como motores de búsqueda de soluciones eficientes. Probalo: dale un objetivo verificable al modelo y mirá cómo adapta su estrategia. Vas a ver la diferencia.

Fuentes

Desplazarse hacia arriba