Qué matemáticas hacen bien los LLMs, según Tim Gowers

En pocas palabras: Los LLMs rinden en álgebra simbólica, combinatoria y formalización de pruebas en Lean, pero fallan en intuición geométrica y aritmética exacta. En agosto de 2026 el sistema de OpenAI resolvió 10 problemas abiertos, aunque el medallista Fields Tim Gowers advierte que siguen sin razonar como matemáticos.

¿Qué tipo de matemáticas hacen bien los modelos de lenguaje? Las capacidades matemáticas de LLMs brillan en álgebra simbólica, combinatoria y verificación de pruebas formales, pero flaquean en intuición geométrica y aritmética exacta. En agosto de 2026 OpenAI anunció que su sistema resolvió diez problemas abiertos, y el medallista Fields Tim Gowers salió a ponerle marco a lo que se puede y lo que no.

Los LLMs (grandes modelos de lenguaje) son sistemas de IA entrenados para predecir texto que, con técnicas de razonamiento paso a paso, atacan problemas matemáticos. Sus capacidades matemáticas abarcan manipulación algebraica, combinatoria, análisis de patrones formales y formalización de pruebas en asistentes como Lean. Tim Gowers, matemático de la Universidad de Cambridge y medalla Fields, publicó su análisis de estos límites en su blog el 12 de agosto de 2026.

En 30 segundos

  • OpenAI resolvió 10 problemas abiertos: entre ellos la primera construcción de un grupo no-sofic y una prueba de que el número de Ramsey multicolor crece superexponencialmente, según reportó Gowers el 12 de agosto de 2026.
  • Fortalezas reales: álgebra simbólica, combinatoria y verificación de pasos en demostraciones formales.
  • Debilidades reales: intuición geométrica, comprensión conceptual y aritmética larga sin herramientas.
  • La clave técnica: pruebas certificadas en Lean, o sea validadas por máquina paso a paso, no solo “escritas”.
  • La postura de Gowers: impresionante, pero todavía no son mejores que todos los humanos en todos los aspectos de la matemática.

¿Qué problemas matemáticos resolvieron los LLMs en agosto de 2026?

OpenAI anunció que su sistema resolvió diez problemas mayores de matemática y ciencias de la computación teórica, y dos se destacan por encima del resto: la primera construcción de un grupo no-sofic y una prueba de que el número de Ramsey multicolor crece superexponencialmente. Lo cuenta el propio Tim Gowers en su blog, que es máxima autoridad en el tema.

Para dimensionarlo: Gowers dice que el problema del grupo no-sofic era, según varias charlas a las que asistió, uno de los abiertos más importantes de la teoría de grupos. Y lo del número de Ramsey era algo que “no necesariamente esperaba ver resuelto en su vida”. Viniendo de una medalla Fields, eso pesa.

Según reportes de wwwhatsnew, el sistema (que circula con el nombre Astra) formalizó los argumentos en Lean para que cada paso quedara verificado por máquina. Ojo con el nombre y las cifras de páginas o costo que circulan: son de fuentes secundarias, no del paper oficial. Volvemos a eso más abajo.

¿En qué tipo de matemáticas sobresalen los LLMs?

Los LLMs rinden mejor donde la matemática es simbólica, combinatoria y verificable: manipular expresiones algebraicas, buscar contraejemplos en espacios discretos, seguir cadenas largas de deducción y chequear que cada paso de una prueba encaje. Ahí la velocidad de la máquina juega a favor y el terreno está bien pavimentado por décadas de notación formal. Más contexto en nuestras guías de seguridad corporativa.

El tema es que no todos los modelos son iguales. Los especializados, entrenados con datasets pesados en matemática (arXiv, bibliotecas de Lean, la OEIS), suelen ganarle a los generalistas en tareas puras. Los reasoning models, esos que generan trazas internas antes de contestar, cambiaron el piso en los últimos 18 meses, desde aproximadamente febrero 2025.

Tipo de modeloEjemplosEnfoqueDónde brilla
Reasoning generalistaFamilia Opus de OpenAI, DeepSeek-R1Cadena de pensamiento antes de responderProblemas multi-paso, olimpiadas
Especializado en matemáticaLLEMMA, Qwen2.5-MathEntrenado en corpus math-heavyÁlgebra, combinatoria, formalización
Generalista amplioClaude, GPTFlexibilidad, uso de herramientasExplicar, traducir a Lean, verificar
Con herramientas externasCualquiera + Lean/MathematicaDelega el cálculo a un motor exactoAritmética exacta, chequeo formal
Comparativa cualitativa. Evité poner porcentajes de benchmarks que no puedo verificar de forma independiente.

¿Dónde fallan los LLMs cuando abordan matemáticas?

Fallan en tres frentes bastante claros: intuición geométrica, comprensión conceptual profunda y aritmética exacta sin ayuda. Saben patrones, no siempre conceptos. Y cuando el cálculo se hace largo, los errores se acumulan.

Ponele que le pedís a un modelo una cuenta de varios pasos con números grandes. Te la puede escribir divina, formateada, convincente, y en el paso siete se comió un acarreo y el resultado final está mal. Por eso los equipos serios delegan la aritmética a un motor externo (Python, Mathematica) en vez de confiar en el modelo “a mano”.

Hay un punto de Gowers que es oro para entender el límite de fondo: cuando a un humano le cuesta distinguir una prueba correcta de una que solo suena plausible, al LLM también le cuesta. La “inteligencia” acá no adivina lo que ni el experto puede chequear a ojo. Si algo es difícil de verificar, es difícil de generar bien. Tema relacionado: como explicamos sobre ChatGPT.

¿Cómo razonan los LLMs un problema matemático complejo?

Razonan generando una cadena de pasos intermedios (chain-of-thought) antes de dar la respuesta, y en los casos duros vuelcan esas trazas en un asistente de pruebas como Lean, que valida sintaxis y lógica de forma automática. La diferencia con un modelo “clásico” es que dedican tiempo de cómputo en la inferencia a pensar, no solo a completar la frase más probable.

Acá viene lo bueno: formalizar en Lean no es lo mismo que escribir una demostración en un PDF. La máquina te obliga a justificar cada renglón. Si un paso no cierra, no compila. Eso elimina la ambigüedad y, encima, permite que cualquiera audite la prueba de forma independiente sin fe ciega en el modelo.

Correr estos reasoning models en serio quema cómputo, y mucho. Generan páginas y páginas de razonamiento interno por cada problema, así que la factura de tokens no es un detalle. Si estás montando infraestructura para experimentar con IA en la región y necesitás cloud o servidores, donweb.com es una opción para tener el backend cerca.

¿Qué dice Tim Gowers sobre la IA y las matemáticas?

Gowers es una de las voces más medidas del tema, y su lectura es de doble filo: reconoce que los resultados son “extraordinariamente impresionantes”, pero aclara que “todavía no parece ser el caso de que los LLMs sean mejores que todos los humanos en todos los aspectos de la matemática”. Su argumento es elegante y sencillo.

¿Cuál es el razonamiento? Si los LLMs ya fueran mejores que cualquier humano en todo, su enorme ventaja de velocidad significaría una catarata de resultados nuevos cada semana. Y eso no está pasando. Todavía. Ya lo cubrimos antes en en nuestro análisis de razonamiento en LLMs.

Gowers también avisa algo que conviene tatuarse: escribe esto sabiendo que las capacidades van a cambiar rápido, y que dentro de poco su nota va a valer sobre todo como registro de cómo se veía el panorama a principios de agosto de 2026. Tomá cualquier afirmación tajante sobre “lo que la IA puede o no puede” con pinzas, porque tiene fecha de vencimiento corta.

¿Qué problemas matemáticos todavía no pueden resolver los LLMs?

Los grandes abiertos siguen abiertos: la hipótesis de Riemann, P versus NP, la conjetura de Hodge y el resto de los Millennium Prize Problems no cayeron. Resolver diez problemas duros es enorme, pero es distinto a domar los que exigen un salto conceptual que nadie dio antes.

La distinción fina es esta: buena parte de lo resuelto pedía razonamiento intensivo sobre estructuras ya conocidas, no inventar un marco nuevo desde cero. Los LLMs hoy son buenísimos para explorar, verificar y cerrar huecos técnicos. Para los problemas auténticamente nuevos, los que necesitan una idea que no está en ningún corpus, todavía hacen falta insights humanos. Un estudiante de doctorado ya los usa para lo que su modelo no cierra solo, y ahí está el punto de equilibrio actual.

Qué está confirmado y qué no

  • Confirmado: OpenAI anunció la resolución de 10 problemas, incluidos el grupo no-sofic y el número de Ramsey multicolor superexponencial. Lo respalda el análisis público de Gowers.
  • Confirmado: Gowers es medalla Fields y publicó su nota el 12 de agosto de 2026.
  • Pendiente de verificación: el nombre “Astra”, el costo exacto en tokens y la cantidad de páginas de razonamiento circulan por medios secundarios, no por el paper primario.
  • Pendiente: revisión independiente y publicación completa de las pruebas por la comunidad matemática, más allá de la certificación en Lean.

Errores comunes al evaluar la matemática de los LLMs

  • Confiar en la aritmética “a mano” del modelo: en cuentas largas se acumulan errores. Corrección: forzá el uso de una herramienta externa (Python, Mathematica) para el cálculo exacto.
  • Confundir “prueba escrita” con “prueba verificada”: un texto convincente no es una demostración válida. Corrección: exigí formalización en Lean o revisión humana antes de dar algo por probado.
  • Extrapolar de un titular a “la IA ya hace toda la matemática”: resolver 10 problemas no es dominar el campo. Corrección: separá reasoning sobre estructuras conocidas de la creación de marcos conceptuales nuevos.
  • Tratar a todos los modelos como equivalentes: un generalista y un reasoning model especializado dan resultados muy distintos en tareas puras. Corrección: elegí el modelo según la tarea, no por moda.

Preguntas Frecuentes

¿Qué tipo de matemáticas resuelven bien los LLMs?

Resuelven bien álgebra simbólica, combinatoria, teoría de números discreta y verificación de pruebas formales. Rinden donde el problema es simbólico y verificable paso a paso. En cambio, la intuición geométrica y la aritmética exacta larga siguen siendo puntos débiles. Te puede servir nuestra cobertura de según nuestro análisis de Google.

¿Qué problemas resolvió OpenAI con IA en 2026?

OpenAI anunció en agosto de 2026 la resolución de diez problemas abiertos de matemática y computación teórica. Los más citados son la primera construcción de un grupo no-sofic y una prueba de que el número de Ramsey multicolor crece superexponencialmente, según reportó Tim Gowers.

¿Qué es formalizar una prueba en Lean?

Lean es un asistente de pruebas que valida cada paso de una demostración de forma automática. Formalizar en Lean significa escribir el argumento en un lenguaje que la máquina chequea línea por línea, así que si algo no cierra, no compila. Elimina ambigüedad y permite auditar la prueba sin confiar a ciegas en el modelo.

¿La IA puede resolver la hipótesis de Riemann?

No, todavía no. La hipótesis de Riemann y el resto de los Millennium Prize Problems siguen abiertos. Requieren saltos conceptuales que no están en ningún corpus de entrenamiento, y ahí los LLMs aún dependen de insights humanos.

¿Los modelos especializados son mejores que los generalistas en matemática?

En tareas matemáticas puras, los modelos entrenados con datasets math-heavy como LLEMMA o Qwen2.5-Math suelen superar a los generalistas. Los generalistas ganan en flexibilidad y en traducir enunciados a Lean o explicar el resultado. La mejor combinación hoy es un reasoning model con acceso a herramientas de cálculo.

Conclusión

Lo que cambió es concreto: los LLMs pasaron de resolver ejercicios a cerrar problemas que matemáticos serios daban por lejanos, y encima con pruebas certificadas en Lean que cualquiera puede auditar. Eso ya no se discute.

Pero la lectura de Gowers es la que hay que llevarse: impresionante no es lo mismo que omnisciente. Si de verdad fueran mejores que todos los humanos en todo, tendríamos una avalancha de resultados nuevos y no la tenemos. ¿Qué hacer con esto? Si trabajás con matemática o programás, usá los modelos para explorar, verificar y formalizar, no como oráculo. Delegá la aritmética a un motor exacto, exigí formalización antes de creer una prueba, y elegí modelo según la tarea. El piso de contribución humana se corrió, no desapareció.

Fuentes

Desplazarse hacia arriba