La inteligencia artificial alcanza ahora capacidades que sorprenden a la comunidad matemática internacional. Además, algunos modelos de lenguaje ya aportan razonamientos innovadores. Por otro lado, especialistas describen estas contribuciones como conexiones inesperadas entre subáreas de las matemáticas. Así lo informó la revista científica Nature.
Thang Luong lidera el equipo de Razonamiento Sobrehumano de Google DeepMind. En consecuencia, señaló que “quizás para 2030” la inteligencia artificial y los matemáticos pudieran ganar juntos una Medalla Fields. Este galardón representa el mayor reconocimiento en matemáticas.
Uno de los casos más destacados ocurrió el mes pasado. Entonces, Liam Price resolvió con ayuda de ChatGPT el problema #1196 de Erdős. Price es un joven del suroeste de Inglaterra sin formación universitaria en matemáticas. La solución se describió en una prepublicación de B. Alexeev y colaboradores en el repositorio arXiv. Posteriormente, atrajo atención por su estrategia para los especialistas.
El problema #1196 fue propuesto por Paul Erdős en 1966. Específicamente, trata sobre conjuntos “primitivos” de números enteros. En estos conjuntos, ninguno de sus elementos divide exactamente a otro. Los números primos son el ejemplo más típico de ese tipo de conjuntos.
El matemático de Stanford Jared Duker Lichtman comparó ese hallazgo con una novedad estratégica en ajedrez. De hecho, escribió en la red social X que era como si una IA hubiera descubierto una apertura inédita. Esta apertura surgió por efecto de la “estética y las convenciones humanas”. La observación resumía una idea central en el debate actual. Por tanto, estos sistemas pueden conectar áreas de formas no anticipadas por la intuición humana. Además, trascienden la mera reproducción de técnicas conocidas.
Varios comentaristas han señalado que quienes intentaron resolver ese problema partían del lenguaje de la teoría de la probabilidad. Por consiguiente, reformulaban así la pregunta. ChatGPT, en cambio, lo resolvió en el lenguaje original del enunciado. Aun así, estableció de forma implícita un vínculo entre números y probabilidad. Así lo señaló Terence Tao, matemático de la Universidad de California en Los Ángeles.
Price había obtenido otras soluciones a problemas de Erdős junto con Kevin Barreto. Barreto es estudiante de grado en matemáticas en la Universidad de Cambridge. Sin embargo, en esos casos se basaron en técnicas ya presentes en la literatura. En el caso del problema #1196, matemáticos detectaron indicios diferentes. Por tanto, el modelo no se limitó a recombinar técnicas existentes. Más bien, produjo conexiones que no estaban en su material de entrenamiento.
“Hace un año, la gente pensaba que tal vez habría algún obstáculo fundamental, que los modelos de lenguaje nunca podrían ir más allá de sus datos de entrenamiento”, dijo Sébastien Bubeck. Bubeck es matemático de OpenAI en San Francisco.
El matemático de la Universidad de Toronto Daniel Litt sostuvo que el resultado es “razonablemente interesante”. Esto contrasta con otros ejemplos recientes de soluciones de IA a problemas de Erdős. Aunque se declaró poco impresionado por buena parte de los avances hasta ahora, reconoció el potencial. Además, criticó la exageración que rodea estos desarrollos. No obstante, sostuvo que los escépticos se equivocan al evaluar el potencial futuro de estos sistemas.
Litt manifestó su desconcierto porque las grandes máquinas de lenguaje no generan descubrimientos mayores. Esto resulta sorprendente dado que tienen un conocimiento sobre las matemáticas existentes. Este conocimiento fue descrito como sobrehumano. Asimismo, muestran capacidad de razonamiento y no sufren cansancio ni desmotivación. “Parte del misterio es que no sabemos qué hace bueno a un matemático humano en matemáticas”, explicó.
Uno de los límites actuales de la producción matemática de IA es la extensión de las demostraciones. En efecto, los modelos disponibles pueden generar pruebas de 3 o 4 páginas como máximo. Luong indicó que modelos evaluados internamente ya superan ese umbral. Por tanto, podrían llegar pronto a 10 páginas.
“100 no está ahora dentro de sus capacidades, pero estamos trabajando hacia eso y vemos mejoras”, señaló Luong. Ese avance, argumentó, genera nuevos retos. De hecho, la revisión humana de textos matemáticos generados por IA ya había alcanzado todo su margen. Esto ocurrió antes de la explosión actual de estos sistemas.
La matemática de la Universidad de Harvard Lauren Williams declaró que estos modelos pueden producir trabajos “muy convincentes”. Sin embargo, su verificación requiere mucho tiempo para detectar si contienen errores. También alertó sobre la proliferación de contenido generado por IA de baja calidad. Incluso, este contenido puede ser directamente erróneo. Williams describió este fenómeno como “basura de IA”. Además, remarcó que varios editores de revistas matemáticas ya se enfrentan a ese fenómeno.
Una respuesta frecuente consiste en pedirle a otro modelo que revise la demostración. Incluso, se puede usar el mismo modelo para esta tarea. Price y Barreto, por ejemplo, reintroducen en ChatGPT las soluciones propuestas. Entonces, el sistema encuentra sus propios errores y rehace el intento. Este proceso continúa hasta que la prueba parezca correcta. Muchos matemáticos ya usan ese método también con textos propios. A pesar de ello, los modelos aún dejan pasar fallos. A veces, detectan otros inexistentes.
Google desarrolló un sistema especializado de múltiples agentes llamado Aletheia. Este sistema incorpora un módulo verificador para texto matemático. Aun así, la alternativa considerada más fiable por varios investigadores es traducir las pruebas al lenguaje formal Lean. Lean es un sistema de código abierto que permite verificaciones automáticas.
El matemático computacional Bin Dong y sus colaboradores aplicaron ese enfoque a la resolución de un problema de álgebra. Por su parte, la empresa californiana Math, Inc. utilizó un traductor de ese tipo. Su objetivo era acelerar la formalización en Lean del trabajo premiado con la Medalla Fields de Maryna Viazovska. Este fue el primer resultado de alto perfil trasladado a ese lenguaje.
Otra opción es que la IA redacte directamente las pruebas en Lean o en sistemas similares. Esta técnica la inauguró AlphaProof, un sistema de Google DeepMind. Sin embargo, el alcance de las matemáticas que hoy pueden escribirse o traducirse a Lean aún es reducido.
La solución de ChatGPT al problema #1196 fue un caso poco común. De hecho, sí pudo formalizarse y certificarse automáticamente. Barreto llevó a cabo esta tarea mediante el software desarrollado por Math, Inc. Luong declaró que la expansión de Lean requiere un trabajo lento y detallado de equipos de voluntarios. Por ahora, “solo hay un puñado de problemas que se pueden formalizar; para el resto, se necesita lenguaje natural”.
Esa limitación se evidenció a comienzos de febrero. Entonces, investigadores realizaron una primera prueba de First Proof. Este es un banco de pruebas para IA en matemáticas documentado en una prepublicación de M. Abouzaid y colaboradores. Expertos de distintas áreas aportaron preguntas cuyas respuestas solo ellos conocían. Esto fue posible porque trabajos inéditos propios ya habían adelantado la validez o falsedad de los enunciados.
Cualquiera podía presentar soluciones generadas por IA. Casi todas se redactaron en lenguaje natural. Solo una se verificó en Lean. Algunas se comprobaron manualmente. En otras aún no está claro si son correctas.
En junio, los organizadores de First Proof someterán un nuevo conjunto de preguntas a varios sistemas de IA. Luego, verificarán las respuestas de forma manual. Williams, una de las organizadoras, indicó que la prueba se centrará en modelos de acceso público. Estos son los más habituales para la mayoría de matemáticos. “Esperamos que lo que hagamos sea un servicio para la comunidad de matemáticos”.
A pesar del ritmo de los cambios, el consenso entre los investigadores es claro. Los matemáticos humanos seguirán al frente de la disciplina durante algún tiempo. “Qué problemas estudiar es más una cuestión de juicio. Durante un tiempo, serán los humanos quienes lo hagan”, afirmó Mark Sellke. Sellke es matemático de OpenAI.
El matemático de la Universidad Brown Javier Gómez-Serrano graficó la velocidad de este cambio con una advertencia. “Ahora ni siquiera me atrevo a pensar cómo será el futuro dentro de cinco años”.
Para Jeremy Avigad, matemático de Carnegie Mellon University, el criterio central permanece otro. “En última instancia, el objetivo de las matemáticas es entender los fenómenos matemáticos. Para eso, necesitamos seguir dentro del circuito”.