Actualizado el 12/08/2026: Salieron los números finos del avance. Claude empujó una cota vinculada a la Hipótesis de Riemann de 41,6% a 67,2%, y Anthropic dice que produjo una versión formalmente verificable en Lean, revisada por teóricos de números externos como Brian Conrey y Dan Goldston.
En pocas palabras: El 11 de agosto de 2026 Anthropic reveló que un modelo todavía sin lanzar mejoró una cota inferior de la Hipótesis de Riemann. No la resolvió: coordinó 60 subagentes, probó 650 ideas y gastó 31 millones de tokens en día y medio para correr esa frontera.
El 11 de agosto de 2026 Anthropic anunció que un modelo todavía sin lanzar hizo un avance real sobre la Hipótesis de Riemann. El avance de Claude sobre la Hipótesis de Riemann salió de coordinar 60 subagentes, probar 650 ideas y gastar 31 millones de tokens en día y medio. No la resolvió. Pero corrió la frontera un poco más lejos.
La Hipótesis de Riemann es una conjetura matemática que planteó Bernhard Riemann en 1859 sobre cómo se distribuyen los números primos. Es uno de los siete Problemas del Milenio del Clay Mathematics Institute, cada uno con un premio de un millón de dólares para quien lo demuestre. Lleva más de 150 años sin resolverse. Lo que hizo Anthropic no es la demostración, es un empujón en un frente puntual.
En 30 segundos
- No la resolvió: el modelo mejoró una cota inferior donde la hipótesis se verifica, no dio una demostración general.
- La cifra fina: corrió una cota relacionada de 41,6% a 67,2%, el salto más grande en ese frente en décadas.
- 60 subagentes coordinados: 2 desarrollaron las ideas clave, 13 aportaron, 30 lo intentaron sin éxito, 13 validaron y 2 escribieron el paper inicial.
- Verificación formal: Anthropic dice que produjo una prueba chequeable en Lean, revisada por teóricos de números externos.
- El modelo no está disponible: el sistema que logró el avance todavía no fue lanzado al público.
Claude es un modelo de lenguaje grande desarrollado por Anthropic, diseñado para generar texto, responder preguntas y asistir en tareas de análisis e investigación. Fue lanzado en 2023.
Anthropic es una empresa estadounidense de inteligencia artificial fundada en 2021 que desarrolla modelos de lenguaje, siendo Claude su principal producto. Se especializa en investigación sobre seguridad de IA e interpretabilidad de sistemas.
¿Qué es la Hipótesis de Riemann y por qué importa?
La Hipótesis de Riemann afirma que todos los ceros no triviales de la función zeta de Riemann tienen parte real igual a 1/2. En criollo: predice un patrón muy preciso en la distribución de los números primos, esos que solo se dividen por 1 y por sí mismos. Riemann la formuló en 1859 y desde entonces nadie la demostró ni la refutó. Lo explicamos a fondo en todo lo que necesitás saber de Claude.
¿Por qué le dan tanta bola? Porque si fuera verdad (y todos los indicios apuntan a que sí), un montón de resultados en teoría de números quedarían confirmados de un saque. Los primos son la materia prima de la criptografía moderna, esa que protege tu home banking y tus contraseñas. Entender su distribución con precisión no es un capricho académico. Cubrimos ese tema en detalle en nuestra comparativa Claude frente a Gemini.
El Clay Mathematics Institute la puso en el año 2000 en su lista de siete Problemas del Milenio, con un premio de un millón de dólares por una demostración general válida. Ese premio sigue sin reclamar. Ojo con esto: hubo cientos de intentos serios en 150 años y ninguno cerró. No es un problema que se resuelve en una tarde.
¿Qué progreso exacto hizo el modelo de Anthropic?
El modelo elevó la cota inferior de soluciones para las que se verifica la hipótesis, según el reporte de TechCrunch. En reportes como el de The AI Insider se menciona que la cota asociada a la zeta se movió hacia arriba. Traducido: no hay demostración nueva de la conjetura, hay una mejora medible en un resultado parcial que ya existía.
Los números del operativo llaman la atención. El modelo probó 650 ideas distintas para atacar el problema, coordinó 60 subagentes y gastó 31 millones de tokens de salida en total, todo en aproximadamente un día y medio de trabajo continuo. Un empleado de Anthropic sin formación matemática seria le pidió que “le metiera en serio” a demostrar la hipótesis y lo dejó laburando.
Eso sí: que un dato venga del propio fabricante obliga a tomarlo con pinzas hasta que la comunidad matemática lo revise a fondo. Anthropic publicó el trabajo, pero una cosa es publicar y otra es que el resultado pase la revisión independiente. Con la actualización del 12 de agosto ya hay nombres externos mirándolo, algo que reduce el margen de duda pero no lo cierra del todo.
¿Qué precisó Anthropic sobre el razonamiento matemático de Claude?
La cifra que faltaba ya tiene contorno: el modelo llevó una cota vinculada a la zeta de Riemann de 41,6% a 67,2%, de acuerdo con el reporte de Neowin y el anuncio de investigación de Anthropic. Ese porcentaje mide qué proporción de un rango relevante queda cubierta por el argumento. Pasar de menos de la mitad a dos tercios es, en este terreno, un salto grande.
Lo nuevo del razonamiento matemático de Claude no es solo el número, es cómo lo respaldó. Anthropic afirma que el sistema produjo una versión formalmente verificable en Lean, el asistente de pruebas que chequea cada paso de forma mecánica. En matemática eso pesa: una demostración validada en Lean no depende de que un humano no se haya distraído revisando. El argumento se sostiene o el software lo rechaza.
El otro dato fresco es la validación externa. Según los reportes, teóricos de números como Brian Conrey y Dan Goldston revisaron el trabajo, no solo el equipo interno de Anthropic. Que especialistas de afuera le den una mirada cambia el peso del anuncio. Habría que ver si esa revisión deriva en una publicación con arbitraje formal, que es el estándar que la comunidad va a pedir antes de darlo por cerrado. Cubrimos ese tema en detalle en comparar modelos de Claude.
En detalle de proceso, la actualización suma textura: tras cientos de intentos que no llegaron a nada, la corrida efectiva combinó 60 agentes en paralelo durante alrededor de 36 horas, con más de 2.400 comandos de shell, cientos de scripts en Python y miles de chequeos numéricos. No fue un modelo pensando en silencio, fue una máquina de ensayo y error a escala industrial.
| Dato | Lo que se sabía el 11/08 | Lo confirmado el 12/08 |
|---|---|---|
| Valor de la cota | Mención de “672” en reportes, sin cifra central | De 41,6% a 67,2% |
| Verificación formal | No mencionada | Prueba chequeable en Lean |
| Revisión externa | Sin nombres, revisión pendiente | Teóricos de números externos (Conrey, Goldston) |
| Detalle del cómputo | 60 subagentes, 650 ideas, 31M tokens | +2.400 comandos shell, cientos de scripts Python, ~36 horas |

¿Cómo funcionó el sistema de 60 subagentes?
El truco no fue un modelo gigante pensando solo, sino una orquesta de 60 subagentes con roles repartidos. Según una nota al pie del paper, cada grupo tenía una función concreta y bien delimitada. Esto se parece más a un equipo de investigación que a una calculadora. Como detallamos en Claude versus GPT-4O.
Acá viene lo bueno: la mayoría de los agentes fracasó. De los 60, apenas dos generaron las ideas matemáticas clave. El resto aportó, validó, escribió o directamente pegó contra la pared. Es la misma proporción que ves en cualquier grupo humano de investigación, donde pocas ideas prosperan y muchas quedan en el camino.
| Rol del subagente | Cantidad | Qué hizo |
|---|---|---|
| Desarrolladores clave | 2 | Generaron las ideas matemáticas que sirvieron |
| Contribuidores | 13 | Aportaron ideas a los desarrolladores clave |
| Exploradores | 30 | Intentaron ideas nuevas sin lograrlo |
| Validadores | 13 | Chequearon la corrección de los argumentos |
| Escritores | 2 | Redactaron el paper inicial |

Fijate que hubo 13 agentes dedicados solo a validar. En matemática eso es media batalla: una idea linda que después no cierra formalmente no vale nada. Meter validadores separados de los que proponen es una decisión de diseño interesante, porque separa al que tira la idea del que la audita. Y con la verificación en Lean sumada, esa auditoría dejó de depender solo del criterio de otro agente.
¿Cuál es la diferencia entre “avanzar” y “resolver”?
Avanzar es correr una frontera, resolver es cerrar el problema para siempre. Claude corrió una frontera. La Hipótesis de Riemann sigue abierta, sin demostración general, y el premio del millón de dólares sigue arriba de la mesa. Cualquier titular que diga “Claude resolvió Riemann” está mintiendo o no entendió.
La diferencia importa. Mejorar esa cota de 41,6% a 67,2% significa demostrar que cierto resultado se cumple para un rango más amplio de casos, pero no para todos. Una demostración general de la conjetura tiene que cubrir infinitos casos de una sola vez, con un argumento cerrado. Son dos cosas de peso distinto. Te puede servir nuestro análisis de Claude frente a GPT-5.
¿Por qué sigue siendo un problema abierto entonces? Porque nadie encontró el argumento que lo cierre. Ni Claude, ni 150 años de matemáticos humanos. Lo que cambió es que ahora una IA aportó una piedra más a un muro que se construye de a poco. Es real, pero es una piedra, no el muro terminado. Sobre eso hablamos en integraciones disponibles de Claude.
¿Qué significa esto para la investigación científica con IA?
El dato fuerte no es la matemática en sí, es el método: un sistema de agentes especializados atacando un problema abierto sin un experto humano manejando el timón. Si esto escala, cambia cómo se hace ciencia asistida por IA. Podés imaginar el mismo esquema apuntando a otros Problemas del Milenio, a plegamiento de proteínas o a demostración de teoremas.
Pero bajemos un cambio. El costo computacional no es menor: 31 millones de tokens y unas 36 horas de cómputo por un avance parcial en un solo problema es carísimo, y no todo el mundo puede tirar esa cantidad de recursos a una corazonada. Montar infraestructura para experimentar con agentes IA a esta escala requiere servidores y presupuesto reales, y ahí conviene mirar opciones de cloud y hosting como donweb.com antes de asumir que esto se corre en cualquier notebook.
La otra limitación es la verificación. Un modelo puede generar 650 ideas, pero alguien tiene que confirmar que la que sobrevivió es correcta de verdad. Acá el paso a Lean ayuda, porque delega el chequeo a un software formal en vez de dejar todo en manos humanas. El diferencial de fondo sigue siendo la coordinación multiagente, no un modelo solo pensando más tiempo.
¿Puedo usar Claude para resolver problemas matemáticos complejos?
Sí, pero no el modelo del paper. El que corrió Riemann es una versión de investigación sin lanzar. Lo que tenés a mano son las versiones públicas de Claude, que hoy resuelven bien álgebra, cálculo de nivel medio, verificación de código matemático y pasos de razonamiento estructurado, sobre todo con el modo de pensamiento extendido activado.
El razonamiento matemático de Claude en producción sirve para tareas acotadas y verificables: chequear una demostración corta, despejar ecuaciones, detectar un error en una fórmula, armar el esqueleto de un argumento. No es un demostrador de teoremas automático ni te va a atacar un problema abierto. Si le pedís algo de frontera, lo más probable es que alucine un paso o se frene, y ahí la intervención humana sigue siendo obligatoria.
El consejo práctico: usalo como asistente que propone y ordena, no como oráculo que sentencia. Verificá siempre el resultado, más aún si hay números o pasos formales de por medio. Para eso te puede servir nuestro análisis de benchmarks, donde comparamos cómo rinde en tareas de razonamiento frente a otros modelos.
¿Cuándo se lanza el modelo y cómo se accede hoy?
El modelo que logró el avance todavía no está lanzado al público y Anthropic no dio fecha oficial de lanzamiento. Por ahora el sistema de 60 subagentes que corrió Riemann no está disponible para que cualquiera lo use. Tema relacionado: capacidades reales de Opus.
O sea: si esperabas entrar a una web y pedirle que resuelva tu problema abierto favorito, todavía no. El sistema que corrió Riemann fue una configuración multiagente puntual, no un producto que puedas abrir hoy. Conviene no confundir el anuncio con algo accesible al público.
Qué está confirmado y qué no
- Confirmado: Anthropic anunció el 11 de agosto de 2026 un avance en la Hipótesis de Riemann con un modelo sin lanzar.
- Confirmado: el operativo usó 60 subagentes, 650 ideas y 31 millones de tokens, según el paper y TechCrunch.
- Confirmado: mejoró una cota relacionada de 41,6% a 67,2%, no demostró la conjetura general.
- Confirmado (12/08): Anthropic dice haber producido una versión formalmente verificable en Lean, con revisión de teóricos de números externos.
- Pendiente: una publicación con arbitraje formal de la comunidad matemática que dé el resultado por cerrado.
- Pendiente: la fecha de lanzamiento del modelo experimental.
Errores comunes al leer esta noticia
- Creer que Claude “resolvió” la Hipótesis de Riemann: no la resolvió. Mejoró un resultado parcial. El problema sigue abierto y el premio del millón, sin reclamar.
- Pensar que podés usar ese modelo hoy: el modelo del paper no está lanzado al público.
- Confundir “verificado en Lean” con “aceptado por la comunidad”: que la prueba pase un chequeo formal es fuerte, pero el aval definitivo llega con la revisión por pares.
Preguntas Frecuentes
¿Qué es la Hipótesis de Riemann?
Es una conjetura matemática planteada por Bernhard Riemann en 1859 que describe cómo se distribuyen los números primos. Afirma que todos los ceros no triviales de la función zeta de Riemann tienen parte real 1/2. Es uno de los siete Problemas del Milenio y lleva más de 150 años sin demostrarse.
¿Claude resolvió la Hipótesis de Riemann?
No. Un modelo sin lanzar de Anthropic mejoró una cota relacionada de 41,6% a 67,2%, lo que es un avance parcial. La demostración general del problema sigue abierta y el premio de un millón de dólares del Clay Mathematics Institute sigue sin reclamar.
¿De cuánto a cuánto mejoró Claude la cota de la zeta de Riemann?
De 41,6% a 67,2%, según el anuncio de investigación de Anthropic y reportes como el de Neowin. Ese porcentaje indica qué proporción de un rango relevante queda cubierta por el argumento. Es el salto más grande en ese frente en décadas, aunque no equivale a demostrar la conjetura.
¿La prueba de Claude fue verificada por matemáticos?
Anthropic afirma que produjo una versión formalmente verificable en Lean, un asistente de pruebas que chequea cada paso de forma mecánica. Además, teóricos de números externos como Brian Conrey y Dan Goldston revisaron el trabajo. Falta todavía una publicación con arbitraje formal para darlo por cerrado.
¿Puedo usar Claude para resolver problemas matemáticos?
Podés usar las versiones públicas de Claude para álgebra, cálculo de nivel medio, verificación de código matemático y razonamiento estructurado, mejor con el modo de pensamiento extendido. No es el modelo experimental del paper ni un demostrador de teoremas automático, así que verificá siempre los resultados de frontera con criterio humano.
Conclusión
Con la actualización del 12 de agosto el cuadro queda más nítido. No es la demostración de Riemann, es un avance parcial pero medible: una cota relacionada pasó de 41,6% a 67,2%, con una prueba chequeada en Lean y revisada por teóricos de números de afuera de Anthropic. Eso lo saca del terreno del anuncio suelto y lo acerca a un resultado verificable.
Lo que importa para quien trabaja en tecnología no es “la IA ya hace matemática de frontera”. Es que la coordinación multiagente empieza a rendir en problemas duros, aunque a un costo de cómputo alto y con la revisión por pares todavía pendiente. De acá en adelante, lo que hay que seguir es si el resultado deriva en una publicación arbitrada y cuándo Anthropic lanza ese modelo experimental. Hasta entonces, tomá cada titular triunfalista con pinzas.
Fuentes
- Anthropic Research – Progreso sobre la función zeta de Riemann (anuncio oficial)
- Neowin – Un modelo sin lanzar de Claude avanza en el problema centenario de Riemann
- The AI Insider – Anthropic dice que Claude mejoró una cota histórica ligada a Riemann
- Kingy AI – El resultado del 67% de Claude sobre la Hipótesis de Riemann
- TechCrunch – Un modelo sin lanzar de Anthropic avanzó en uno de los mayores problemas sin resolver




