En pocas palabras: Los LLMs rinden en matemática verificable: problemas cuya respuesta correcta se puede chequear. Según Tim Gowers (medallista Fields, 12 de agosto de 2026), OpenAI resolvió diez problemas abiertos, pero la IA falla cuando ni un experto distingue a simple vista una demostración correcta de una incorrecta.
Tim Gowers, medallista Fields, publicó el 12 de agosto de 2026 un análisis sobre las capacidades matemáticas de los LLMs. Su tesis: aunque OpenAI resolvió diez problemas que habían estado abiertos durante décadas, la IA todavía no supera a todos los humanos en toda la matemática, y él explica por qué.
Las capacidades matemáticas de los LLMs describen qué tipo de problemas puede resolver un modelo de lenguaje: desde aritmética y verificación formal hasta demostraciones originales. Tim Gowers, matemático británico y ganador de la Medalla Fields en 1998, sostiene en su blog que los LLMs ya resuelven problemas abiertos difíciles, pero se topan con un límite claro cuando ni un humano experto puede distinguir a simple vista una respuesta correcta de una incorrecta.
En 30 segundos
- OpenAI anunció a comienzos de agosto de 2026 que su sistema resolvió diez problemas abiertos de matemática y ciencias de la computación teórica.
- Entre ellos, la primera construcción de un grupo no-sófico y una cota superexponencial para un número de Ramsey multicolor, dos problemas que llevaban décadas sin respuesta.
- Gowers avisa: si los LLMs fueran mejores que todos los humanos en todo, ya habría una avalancha de resultados nuevos. Y no la hay.
- El principio que propone: donde un humano no logra chequear si una respuesta está bien, el LLM tampoco.
- El rol más útil hoy es el de asistente de investigación, no el de matemático autónomo.
¿Qué 10 problemas matemáticos resolvió OpenAI en 2026?
OpenAI comunicó a principios de agosto de 2026 que su sistema resolvió diez problemas mayores de matemática y ciencias de la computación teórica, varios de ellos abiertos desde hacía más de 30 años, según reportes de la prensa tecnológica. El propio Gowers detalla los dos que más ruido hicieron.
El primero es la construcción de un grupo no-sófico. En palabras de Gowers, es uno de los problemas abiertos más importantes de la teoría de grupos, un problema que se resistía desde hacía años. El segundo es una demostración de que cierto número de Ramsey multicolor crece de forma superexponencial, un resultado que él admite no esperaba ver resuelto en su vida.
Los otros ocho completan una lista que Gowers califica de “extraordinariamente impresionante”. Una cosa es que el modelo tire una idea, otra es que la idea resista una verificación completa.
¿En qué tipos de matemáticas rinden mejor los LLMs?
Los LLMs rinden mejor en tareas donde la respuesta se puede verificar de forma mecánica: aritmética y cálculo, manipulación algebraica, y sobre todo demostraciones que se pueden formalizar en un sistema como Lean. Ahí el modelo tiene una brújula clara de si va bien o mal. En privacidad y seguridad en IA profundizamos sobre esto.
Fijate que el hilo conductor de los diez problemas de OpenAI es justamente ese. No son intuiciones sueltas. Son cadenas de razonamiento largas que un verificador formal puede recorrer entera y decir “esto cierra”.
El punto es que hay una jerarquía bastante clara según el dominio:
- Cálculo simbólico y aritmético. Muy sólido, sobre todo cuando el modelo puede apoyarse en herramientas externas o en verificación paso a paso.
- Verificación formal de demostraciones. Acá es donde se dieron los saltos más grandes de 2026, porque el sistema formal actúa de juez imparcial.
- Demostraciones algorítmicas. Bien, siempre que exista un criterio objetivo de corrección.
- Razonamiento abstracto y creativo. Limitado. Es el terreno donde el humano todavía manda.
Hubo modelos especializados que empujaron esta frontera antes del anuncio de OpenAI. La lección es vieja: un modelo afinado para matemática le gana a uno generalista en su cancha.
¿Cuáles son las limitaciones que identifica Tim Gowers?
La limitación central según Gowers es de verificación: donde un humano tiene dificultad para distinguir una respuesta correcta de una incorrecta, un LLM tampoco va a poder. La IA brilla cuando existe un criterio de corrección chequeable, y patina cuando el juicio depende de gusto, importancia o elegancia matemática.
Su evidencia es elegante por lo simple. Si los LLMs fueran mejores que todos los humanos en todos los aspectos de la matemática, su enorme ventaja de velocidad se traduciría en una catarata de resultados nuevos cada semana. Eso no está pasando. Diez problemas resueltos es enorme, pero es un goteo, no una inundación.
Gowers también deja una advertencia sobre el momento en que escribe. Dice, textualmente, que su análisis probablemente sirva sobre todo “como un registro de cómo se veía la situación a principios de agosto de 2026”, porque espera que las capacidades sigan cambiando rápido. Es honesto: no está clavando una bandera eterna, está sacando una foto. Esto se conecta con lo que analizamos en desempeño matemático de ChatGPT.
Ponele que le pedís a un modelo que decida cuál de dos conjeturas vale más la pena atacar. No hay verificador formal para “vale la pena”. Ahí, dice Gowers, la IA no tiene con qué orientarse.
¿Qué matemáticas todavía NO pueden resolver los LLMs?
Los LLMs todavía flaquean en el razonamiento abstracto profundo, en la intuición matemática pura y, sobre todo, en la formulación de problemas nuevos y en juzgar cuáles importan. Buena parte de su desempeño sigue apoyada en pattern-matching sobre lo que vieron en el entrenamiento, más que en comprensión genuina.
Hay un detalle incómodo que aparece en la práctica. El rendimiento tiende a deteriorarse a medida que sube la complejidad, al punto de fallar en operaciones de nivel primario cuando se encadenan varios pasos poco habituales. Traducido: el modelo que resuelve un problema de Ramsey puede tropezar con una cuenta larga que un chico de escuela resolvería con paciencia.
¿Contradictorio? No tanto. Reconocer un patrón que aparece millones de veces en el corpus es una cosa. Seguir una cadena original y larga que nunca vio, otra distinta. Cuando el problema se sale del molde aprendido, el andamiaje cruje.
La “inteligencia” de estos sistemas, entre comillas, sigue siendo estadística. Impresionante, pero estadística. Más contexto en razonamiento en modelos de lenguaje.
¿Cómo ayudan hoy los LLMs a los matemáticos en investigación?
Hoy los LLMs funcionan como asistentes de investigación sofisticados: verifican demostraciones, generan contraejemplos, exploran espacios de casos y sugieren patrones. Pero necesitan un humano que formule el problema correcto y que juzgue si el resultado es relevante. No automatizan la investigación de punta a punta.
La herramienta acelera partes del trabajo, pero no lo reemplaza. El matemático sigue eligiendo la pregunta.
El flujo real termina siendo colaborativo. Vos planteás la conjetura, el modelo tira quince variantes de ataque, descarta trece que no van, formaliza las dos que sobreviven, y vos decidís cuál persiga. Ganás velocidad en la parte mecánica, no en la parte donde hace falta criterio.
Velocidad contra comprensión: la tabla que ordena el debate
La ventaja de los LLMs es la velocidad bruta: ejecutan miles de cálculos y barren espacios de casos que a un humano le llevarían meses. La ventaja humana es la intuición y la formulación de lo que vale la pena preguntar. Esta tabla resume dónde pisa fuerte cada uno.
| Capacidad | LLMs (2026) | Matemático humano |
|---|---|---|
| Cálculo y verificación formal (Lean) | Excelente | Lento y propenso a error |
| Exploración masiva de casos | Excelente | Limitado por tiempo |
| Demostraciones con criterio de corrección claro | Muy bueno | Bueno |
| Distinguir respuesta correcta cuando no hay verificador | Débil | Fuerte |
| Formular problemas nuevos y juzgar importancia | Débil | Fuerte |
| Intuición matemática profunda | Limitado | Distintivo |
Leída así, la conclusión de Gowers cierra. Los LLMs son aceleradores potentísimos en la mitad verificable del trabajo. En la otra mitad, la del gusto y la pregunta, el humano todavía no tiene reemplazo. Tema relacionado: Google y sus modelos de IA.
Qué significa para equipos técnicos en Latinoamérica
Si trabajás en un equipo de datos o de ingeniería en la región, el mensaje práctico es doble. Primero: usá los LLMs para lo verificable (chequear una derivación, generar contraejemplos, formalizar) y desconfiá de sus veredictos cuando no hay forma automática de comprobar el resultado.
Segundo: el cómputo para experimentar con estos modelos ya no exige un datacenter propio. Con infraestructura cloud o un VPS bien dimensionado, ponele en donweb.com para alojar tus servicios y pruebas, un equipo chico puede montar sus propios pipelines de verificación sin fundir el presupuesto. La barrera de entrada bajó, y eso es lo que vuelve accionable todo este debate.
Errores comunes al interpretar lo que pueden hacer los LLMs en matemática
- Creer que “resolvió diez problemas” equivale a “reemplaza matemáticos”. Son cosas distintas. Los diez casos tenían verificación formal disponible; la mayoría de la investigación no la tiene todavía.
- Confiar en una demostración sin chequearla. Si no hay verificador formal ni revisión humana, una demostración generada puede tener un error que ni vos ni el modelo detectan. Es exactamente el escenario que advierte Gowers.
- Asumir que más complejo siempre le rinde mejor al modelo. Al revés: el rendimiento tiende a caer con la complejidad encadenada, incluso en aritmética básica.
- Tomar los benchmarks del fabricante como palabra final. El anuncio de OpenAI es serio, pero la verificación independiente y reproducible es lo que da confianza real.
Preguntas Frecuentes
¿Qué dice Tim Gowers sobre la IA y la matemática?
Tim Gowers sostiene que los LLMs ya resuelven problemas abiertos difíciles pero no superan a los humanos en todos los aspectos de la matemática. Su argumento clave: donde un humano no puede distinguir una respuesta correcta de una incorrecta, el LLM tampoco. Y como no hay una avalancha de resultados nuevos, deduce que las limitaciones persisten.
¿En qué tipos de matemática resuelven mejor los LLMs?
Los LLMs resuelven mejor tareas con un criterio de corrección verificable: aritmética, cálculo simbólico y demostraciones formalizables en asistentes como Lean. En terrenos que dependen de intuición, creatividad o juicio sobre qué problema importa, su desempeño baja mucho.
¿Puede la IA reemplazar a los matemáticos humanos?
No, al menos no en agosto de 2026. Los LLMs aceleran la parte mecánica y verificable del trabajo, pero dependen de un humano para formular problemas, elegir qué vale la pena investigar y validar resultados sin verificador automático. Hoy son asistentes potentes, no investigadores autónomos.
¿Cuáles son las limitaciones de los LLMs en matemática?
Las limitaciones principales son el razonamiento abstracto profundo, la intuición pura, la formulación de problemas nuevos y el deterioro del rendimiento cuando la complejidad se encadena. El rendimiento puede caer incluso en operaciones de nivel primario cuando se encadenan varios pasos poco habituales.
¿Por qué es importante que las demostraciones se hagan en Lean?
Lean es un asistente de prueba formal que verifica cada paso de una demostración con una computadora. Cuando una demostración se entrega verificable en un sistema formal, se puede confiar en ella sin depender solo de revisión humana, y eso explica por qué la IA rinde tan bien justo en ese terreno.
Conclusión
Lo que cambió en agosto de 2026 es concreto: una IA resolvió diez problemas que la comunidad matemática consideraba muy difíciles, con verificación formal incluida. Eso ya no se discute.
Lo que Gowers ordena es igual de valioso. Las capacidades matemáticas de los LLMs son enormes donde hay un juez objetivo (un verificador formal, un cálculo chequeable) y frágiles donde el trabajo depende de intuición y criterio. Su regla práctica (si nadie puede chequear la respuesta, la IA tampoco) es la mejor brújula que tenés hoy para decidir dónde apoyarte en estos modelos y dónde no. Usalos para acelerar lo verificable, reservá el juicio para vos, y no confundas un goteo brillante de resultados con una revolución que reemplaza al matemático. Todavía no.
Fuentes
- Tim Gowers – “What sort of maths are LLMs good at?” (blog oficial, 12/08/2026)
- WWWhat’s New – OpenAI y los 10 problemas matemáticos resueltos con verificación en Lean
- Infobae – La IA resolvió problemas matemáticos que llevaban más de 30 años sin respuesta
- Universidad de Chile – Expertos de Google analizan el uso de LLMs en investigación matemática



