InicioCentro de noticias de LBank
La IA acaba de resolver un problema matemático de 350 años escribiendo la demostración más larga jamás realizada
ai-solved-350-year-old-math-problem
La IA acaba de resolver un problema matemático de 350 años escribiendo la demostración más larga jamás realizada
Anthropic dice que Claude pasó 11 días convirtiendo el último teorema de Fermat en 13 millones de líneas de código que una computadora puede verificar por sí misma, sin necesidad de confiar en un humano
2026-09-05 Fuente:decrypt.co

En resumen

  • Anthropic afirma que su IA Claude produjo la primera prueba completamente verificada por computadora del Último Teorema de Fermat en 11 días, en gran parte por sí misma, escribiendo lo que ahora es la prueba matemática más larga jamás construida.
  • Un proyecto liderado por humanos que realiza exactamente el mismo trabajo ha estado en marcha en el Imperial College London desde 2024 y no está ni cerca de terminar. Claude le ganó en la meta.
  • Kevin Buzzard, el matemático que lidera ese proyecto humano, revisó la prueba de Claude y confirmó que se sostiene utilizando solo las reglas lógicas más básicas de las matemáticas.

Anthropic afirma que su IA Claude acaba de escribir la prueba matemática más larga jamás realizada y la utilizó para probar formalmente el Último Teorema de Fermat, un problema que desconcertó a los matemáticos durante 358 años.

Claude lo hizo en 11 días, en gran parte por sí mismo, produciendo 13 millones de líneas de código que una computadora puede verificar línea por línea, en lugar de simplemente aceptar la palabra de un matemático.

Myriad: ¿Cuándo estará GPT-6 disponible al público? Haz clic para hacer tu predicción.

El último teorema de Fermat dice que no se pueden tomar tres números enteros positivos, elevar cada uno a una potencia superior a 2 y que los dos primeros sumen el tercero. Él garabateó esa afirmación en el margen de un libro de matemáticas en 1637, añadiendo que tenía una "prueba verdaderamente maravillosa" que el margen era demasiado pequeño para contener.

Luego murió. Los matemáticos pasaron los siguientes 358 años tratando de reconstruir lo que él creyó tener.

Probar algo y verificarlo son dos trabajos diferentes

Una prueba matemática es una cadena de pasos lógicos, y si un eslabón se rompe, todo se derrumba. Encontrar ese eslabón roto, enterrado en algún lugar entre cien páginas de argumento denso, puede llevar a otros matemáticos años de sus vidas.

Formalizar una prueba significa traducirla a un lenguaje tan dolorosamente literal que una computadora puede verificar cada paso por sí misma sin entrar en subjetividades.

Los matemáticos han sido malos controlando esto durante un tiempo. Un premio alemán de 1908, valorado aproximadamente entre 1 y 2 millones de dólares actuales, ofrecido por la primera prueba válida del teorema, atrajo 621 presentaciones erróneas solo en su primer año.

Verificar que una prueba matemática importante sea correcta puede llevar años. La formalización —convertir el razonamiento matemático en una forma que los asistentes de prueba de computadora como Lean puedan verificar— puede ayudar.

El mes pasado, Claude completó la primera prueba formalizada del Último Teorema de Fermat, uno de… pic.twitter.com/pdT8zwlV4A

— Anthropic (@AnthropicAI) 4 de septiembre de 2026

La prueba real no apareció hasta 1995, de la mano del matemático británico Andrew Wiles, y vino con un giro argumental. Wiles anunció su solución en tres conferencias en junio de 1993, solo para que un revisor encontrara un fallo en ella más tarde.

Pasó casi un año arreglándolo con un exalumno, Richard Taylor, casi se dio por vencido y finalmente publicó una prueba corregida de 129 páginas en mayo de 1995. Se basaba en matemáticas que no existían en vida de Fermat, lo cual es una gran razón por la que los matemáticos ahora dudan que la propia "prueba maravillosa" de Fermat realmente funcionara.

El matemático del Imperial College London, Kevin Buzzard, inició un proyecto en 2024 para hacer exactamente lo que Claude acaba de hacer: traducir la prueba de Wiles a Lean, un lenguaje que las computadoras pueden verificar. Es el tipo de trabajo que necesita un ejército de matemáticos voluntarios; el esquema del proyecto tiene 86 páginas y su financiación está asegurada hasta 2029.

Claude terminó todo en 11 días.

Cómo Claude lo logró realmente

Anthropic explica en una publicación más detallada que Tianyi Peng, quien construye herramientas de formalización de IA con un equipo en Columbia, decidió ver hasta dónde podía llegar Claude por sí mismo. Docenas de agentes Claude trabajaron en paralelo, escribiendo definiciones, demostrando pequeños resultados y apilándolos en otros más grandes, con casi ninguna intervención humana más allá de algún empujón ocasional como "priorizar este teorema a continuación".

Al principio no fue sencillo. Al principio, los agentes perdían el rastro de lo que ya habían probado y dejaron de colaborar, y esos falsos comienzos aún constituyen alrededor del 7% de las líneas de la prueba final.

Lo que lo arregló fue una herramienta llamada Prove2Me, también construida por el equipo de Peng, que proporcionó a cada agente la misma lista de tareas en vivo de qué pruebas más pequeñas aún necesitaban ser realizadas, para que nadie duplicara el trabajo o se desviara. También organizó los archivos para que Lean pudiera verificar todo más rápido y mantuvo notas en inglés sencillo sobre cada resultado para que los agentes pudieran reutilizar el trabajo de los demás en lugar de reinventarlo.

Cuando terminó, Claude había probado más de 30.000 teoremas de apoyo y consumió miles de millones de tokens, funcionando con un modelo de investigación que Anthropic dice que es aproximadamente comparable a Claude Fable 5.1, la versión que luego lanzó al público. La prueba terminada consta de 13 millones de líneas, más de cinco veces el tamaño de Mathlib, la biblioteca compartida que los matemáticos ya utilizan para este tipo de trabajo.

Una novela típica tiene 80.000 palabras. La prueba de Claude es equivalente a 160 novelas de puro argumento lógico.

¿Entonces, esto realmente importa?

Buzzard —cuya propia versión de este proyecto sigue financiada hasta 2029— revisó la prueba de Claude y le dio su aprobación, diciendo que demuestra el teorema "sin más suposiciones que los axiomas de las matemáticas".

Esto no es lo mismo que Claude descubriendo matemáticas completamente nuevas, algo que Anthropic también afirmó con su investigación en criptografía a principios de este año. Wiles ya probó el teorema de Fermat hace tres décadas; Claude simplemente construyó un recibo verificable por máquina para ello. Eso importa porque los matemáticos están cada vez más abrumados con pruebas no verificadas, incluidas las escritas por IA, más rápido de lo que los humanos pueden verificarlas a mano.

Además, este tipo de pruebas son deterministas y no propensas a errores humanos, lo cual es muy importante en matemáticas.

Ese no es un problema nuevo. Una prueba asistida por computadora de la conjetura de Kepler tardó cuatro años antes de que un panel de revisión solo se comprometiera a estar "99% seguro", y la prueba de Grigori Perelman de la conjetura de Poincaré tardó aproximadamente lo mismo en asimilarse por completo.

Si no quieres fiarte de la palabra de Anthropic para todo esto, no tienes por qué hacerlo. La prueba completa de 13 millones de líneas está en GitHub ahora mismo, gratis para cualquier matemático con suficiente tiempo libre para desglosarla, línea por línea.