Navier-Stokes resuelto por un enjambre de 10.000 agentes: qué es real, qué costó y quién merece el crédito
TL;DR
- Lo demostrado no es el Problema del Milenio completo: es blowup en tiempo finito para Navier-Stokes 3D con fuerza suave, las sentencias C y D de la formulación de Fefferman. El caso sin fuerza —el que la mayoría de matemáticos consideran “el” problema— sigue abierto, y OpenAI no reclama el millón de dólares de Clay.
- La orquestación sí es un hito: ~10.000 agentes concurrentes, ~88 horas, 2,7 millones de mensajes y unos 130.000 millones de tokens de salida solo para Navier-Stokes. Varios de los grupos en paralelo iban, con retrospectiva, en dirección opuesta a la solución.
- El coste es especulativo: entre “millones de dólares” (OpenAI) y 22,5 millones estimados a precio de lista. No hay factura.
- El crédito quedó feo: el método era de Córdoba y Martínez-Zoroa (ICMAT y CUNEF), según la declaración de Buckmaster hubo presiones de OpenAI para repartir autoría, y 25 ganadores de la Fields firmaron que los objetivos de las empresas de IA y los de las matemáticas están “profundamente desalineados”.
Contexto
El 8 de septiembre de 2026 OpenAI publicó una solución al problema de Navier-Stokes producida por un sistema interno multi-agente. No es una noticia más de “la IA hace algo increíble”: es el run multi-agente más grande documentado hasta la fecha, y el primero que se acerca a un Problema del Milenio.
A un dev le importan tres cosas: cómo se orquestó el enjambre (porque ese patrón es replicable), cuánto costó (porque define si esto es replicable para ti) y quién se queda el crédito (porque define cómo tratan las empresas de IA el trabajo intelectual que les alimentó). Las tres respuestas tienen matices.
Qué se demostró exactamente (y qué no)
Las ecuaciones de Navier-Stokes describen cómo se mueve un fluido tratándolo como medio continuo. La pregunta abierta desde hace ~90 años era si un fluido 3D que empieza suave puede desarrollar una singularidad: velocidades creciendo sin cota en tiempo finito, hasta que la descripción se rompe. En 2000, el Clay Mathematics Institute lo convirtió en Problema del Milenio con un millón de dólares de premio.
El matiz que casi toda la prensa adelgazó: la formulación oficial de Fefferman ofrece cuatro alternativas. Probar regularidad (que no hay singularity) son las sentencias A y B; probar blowup son las C y D. Y hay dos versiones del problema: con fuerza externa suave y sin fuerza. Lo que anuncia OpenAI es blowup para el caso con fuerza suave: “establishing statement C (and also D)”. El caso sin fuerza —el que la mayoría de matemáticos consideran el problema de verdad— sigue abierto. La propia OpenAI lo dice: “We do not intend to claim the Millennium Prize for this result”.
La nota oficial de Clay (11-sep) no entrega premio: habla de un problema “apparently been settled” y de un proceso de evaluación “deliberately unhurried”. Traducción: la comunidad revisará la prueba de ~100 páginas y su formalización en Lean a su ritmo, que es como se hace esto.
Un detalle técnico que importa para la historia: OpenAI resolvió con sus agentes la versión sin fuerza de Euler (el problema límite sin viscosidad) con ~100 agentes y ~50 horas. Buckmaster y Alpöge publicaron el Euler con fuerza, que es más duro. No es el mismo resultado, y la diferencia de dificultad es justo lo que alimenta la disputa de crédito.
Anatomía del enjambre: cómo se orquestaron 10.000 agentes
El patrón, según el post de OpenAI:
- Grupos en paralelo con variantes del problema. A unos grupos les dieron las versiones A y B (apuntar a probar regularidad); a otros, las C y D (apuntar a disproof). Ganó el camino de disproof. Varios de esos frentes iban, con retrospectiva, en dirección opuesta a la solución.
- Resultado intermedio como seed. Cuando los agentes resolvieron el Euler sin fuerza, OpenAI reorientó los agentes de otros Problemas del Milenio hacia Navier-Stokes y les alimentó con ese resultado como punto de partida.
- Consolidación cruzada con Codex. Usaron Codex para destilar los insights más útiles de cada grupo y re-promptar con ellos. El grupo que encontró la solución fue guiado así.
- Lean como gate de verificación. Los agentes llegaron al resultado el 5 de septiembre, ~88 horas tras el lanzamiento; la formalización y verificación en Lean llevó 17 horas más con GPT-6 Astra.
Si montas sistemas multi-agente, esto no es exótico: es tu patrón drafter/reviewer con validación multi-modelo y tus patrones de router, pipeline y blackboard a escala industrial. Variantes paralelas para cubrir el espacio de soluciones, consolidación periódica entre grupos, y un verificador externo que decide qué cuenta como resultado.
La cifra bruta: 4,9 millones de mensajes y ~300.000 millones de tokens de salida en la semana de problemas abiertos; 2,7 millones de mensajes y ~130.000 millones de tokens solo en Navier-Stokes. El modelo interno era “significantly more capable than GPT-6 Astra”, y su entrenamiento empezó el 28 de agosto.
Y sobre “very little human input”: según la declaración de Buckmaster, esa frase se la dijo Sébastien Bubeck a Levent Alpöge —que el modelo había trabajado con “very little human input”— y resultó no ser cierta. En las llamadas del 6 de septiembre (a las que Alpöge no asistió), Buckmaster cuenta que del chat interno de OpenAI emergió que había un equipo entero detrás, que primero habían puesto el modelo en problemas más fáciles (Euler), y que hasta el prompt que le enseñaron lo había escrito prompteando a Codex. El harness no es un detalle de implementación: es el producto.
El coste: cuatro estimaciones y ninguna factura
OpenAI no ha publicado coste. Lo que circula son estimaciones de terceros, y no coinciden:
| Estimación | Cifra | Fuente |
|---|---|---|
| Tokens a precio de lista | ~22,5 M$ | TechCrunch |
| Estimación conservadora | ~10 M$ | BBC |
| Cómputo equivalente | ~15 M$ | New Scientist |
| Estimación propia | ~15 M€ | Diego Córdoba, en El País (10-sep) |
| Cifra oficial | ”millones de dólares” | Noam Brown (OpenAI), en X |
Dos lecturas. La incómoda: son órdenes de magnitud, no facturas; el coste real de cómputo de un lab frontera no es el precio de lista que pagas tú, y ninguna cifra está respaldada por OpenAI. La útil: a precios que un dev normal puede pagar, esto no es replicable. Lo que sí es replicable es el patrón (variantes paralelas + consolidación + gate barato), y la lección presupuestaria:
Varios grupos del enjambre iban hacia probar regularidad, y el resultado vino del camino contrario. Es decir, una parte del cómputo fue exploración que descartó caminos. No fue desperdicio: sin las variantes C y D, quizá no hay solución. Pero si montas algo parecido, presupuesta la exploración como lo que es —el precio del discovery— y no como cómputo productivo. Las mismas lecciones que salieron del presupuesto quemado de Uber con IA para programar aplican aquí multiplicadas por seis cifras. Para cómo controlar el gasto por token, tienes la guía de costes LLM.
La disputa del crédito: lo alegado y lo admitido
Primero lo no disputado: las ideas del programa son de Diego Córdoba (ICMAT-CSIC) y Luis Martínez-Zoroa (CUNEF), que llevan varios años construyendo blowups con fuerza mediante cascadas de capas de vorticidad. La declaración de Buckmaster (7-sep) es explícita: “The credit for the basic idea of this program goes to Diego Córdoba and Luis Martínez-Zoroa”, y añade algo inusual: “I believe Luis Martínez-Zoroa deserves a Fields Medal”. Córdoba, en El País (10-sep), resume el agravio: “Sin nuestra idea, la IA no lo habría resuelto”.
Lo alegado —y subrayo: según la declaración de Buckmaster— es la cronología del 3 al 8 de septiembre:
- 3-sep: con el rumor de que Anthropic había resuelto un problema abierto, Buckmaster escribe a OpenAI para darles los hechos. En el email, que publica íntegro, les cuenta que lleva un año en esto y que los borradores del proyecto pasan por sesiones de Codex, cuyas facturas paga con sus fondos de investigación.
- 6-sep: dos llamadas ese mediodía con Sébastien Bubeck. Según Buckmaster, le dicen que su modelo interno tiene una prueba de blowup con fuerza para las opciones C y D de Fefferman (~100 páginas); le presentan dos propuestas (publicar Euler ellos y NS OpenAI al día siguiente, o que Buckmaster firmara en solitario el paper de NS reconociendo al modelo de OpenAI); le piden dos veces quitar a Alpöge de la autoría por ser empleado de Anthropic; y al negarse, recibe un “Why would you ruin your career?” y un “If you don’t want me to be nice, then I don’t have to be nice”.
- 7-sep: Buckmaster y Alpöge publican tres preprints (IPM, Boussinesq y Euler con fuerza, verificados en Lean, código en GitHub) más la declaración, donde también asume que la calidad de escritura de los papers es mala (“The Euler writeup, in particular, can only be described as AI slop”) porque tuvieron que publicar rápido bajo presión.
- 8-sep: OpenAI publica su resultado.
La respuesta de OpenAI, en el mismo post del 8-sep y su actualización del 10-sep: que ni sus investigadores ni sus agentes vieron el trabajo de Buckmaster y Alpöge hasta la publicación pública, que una investigación interna confirmó que los prompts de Codex de Buckmaster “could not have influenced the system in any way, including through training”, y que las pruebas son distintas (Euler sin fuerza vs. con fuerza).
Ahí está el hueco que no cierra. En el post original del 8-sep, OpenAI admitía: “While unlikely, we cannot rule out that de-identified data derived from their usage of our products helped improve our models” —no podemos descartar que datos desidentificados derivados del uso de nuestros productos ayudaran a mejorar nuestros modelos—. La actualización del 10-sep sustituyó esa frase por la confirmación de la investigación (“could not have influenced the system in any way, including through training”), y la admisión ya no aparece en el texto vivo del post. Que la frase desapareciera en dos días refuerza, si cabe, la pregunta que deja: el modelo del resultado empezó a entrenarse el 28 de agosto y los borradores llevaban meses entrando en Codex. Buckmaster, cuidadoso, no acusa: “No sé si nuestros datos fueron utilizados. No estoy acusando a nadie de nada. Estoy diciendo lo que me dijeron, cuándo, y lo que se me propuso”. Eso es exactamente lo que dice su declaración, ni más ni menos.
Y un agravio menor pero revelador: la primera versión del post de OpenAI no citaba a Córdoba ni a Martínez-Zoroa. Las referencias se añadieron después, horas después del anuncio, cuando la comunidad ya había señalado la omisión. El ICMAT y la RSME —en su declaración del 16-sep— han reclamado lo mismo: falta validación completa por la comunidad y reconocimiento justo de las ideas previas.
La carta de los 25 Fields: el problema de fondo
El 11 de septiembre, 25 ganadores de la Medalla Fields publicaron “A Severe Misalignment of AI in Mathematics”. De Pierre Deligne (Fields 1978) a Yu Deng (2026): Tao, Scholze, Viazovska, Maynard, Kontsevich, Villani, entre otros. En las primeras 24 horas se sumaron más de 3.000 adhesiones vía ORCID o correo académico, según los organizadores.
El texto no nombra empresas y no propone reglas concretas (a diferencia de la Declaración de Leiden de junio, que sí traía recomendaciones). Su peso está en dos frases: “los objetivos de las empresas de IA y los de la comunidad matemática están profundamente desalineados”, y que “resolver problemas es solo una herramienta y un medio para alcanzar el objetivo principal: la comprensión conceptual y la introspección”.
Terence Tao, firmante, había resumido el problema en una frase al día siguiente del anuncio: los problemas se están “strip-mining” —explotando a cielo abierto— por sus soluciones, descartando el proceso. Su tesis (la desarrolló en el ICM de julio): sin proceso, contexto y comprensión, un resultado no llega a canonizarse en libros de texto, que es donde el conocimiento se vuelve útil para todos los demás. Un enjambre que produce una prueba de 100 páginas en 88 horas produce respuestas; la comprensión sigue siendo el cuello de botella humano.
Si la carta tiene razón, esto no va de matemáticas. El mismo patrón —el valor se va con la respuesta, el proceso y el reconocimiento se quedan atrás— aplica a cualquier trabajo intelectual medido por entregables. La supervisión de agentes que ya fractura a los usuarios de herramientas de delegación masiva es la versión doméstica del mismo conflicto.
Qué aprende un dev de esto
El harness importa más que el modelo. El resultado no lo produjo “un modelo inteligente” solitario: lo produjeron prompts variantes por grupo, un seed de resultado intermedio, consolidación cruzada entre grupos y un gate formal. Cuando OpenAI contó la versión simple (“al modelo le dimos el enunciado”), resultó haber un equipo humano dirigiendo detrás. Si estás diseñando un sistema multi-agente, tu ventaja competitiva está en esa orquestación, no en el modelo de turno.
Sin gate verificable no hay resultado, hay una afirmación cara. Lo que convierte 130.000 millones de tokens en un teorema es la verificación en Lean: 17 horas de un sistema comprobando cada paso. El equivalente en tu stack son los tests, las evals automáticas y la CI. Un agente que “resuelve” algo sin verificador externo produce texto convincente, no conocimiento. Clay lo va a revisar “deliberadamente unhurried” y con razón: la prueba existe como claim hasta que alguien la reproduce.
La exploración paralela tiene precio, y hay que presupuestarla. Parte del cómputo fue a caminos que no dieron la solución. En tu escala eso es un buen resultado, no un fracaso —descartar caminos es información—, pero hazlo con presupuesto explícito, no esperando que cada agente produzca.
La lección de privacidad es la más incómoda. Buckmaster y Alpöge pusieron todos sus borradores en Codex durante meses, pagando de su bolsillo. El 8-sep, en el propio post del anuncio, OpenAI decía que ni sus investigadores ni sus agentes habían visto el trabajo, y a la vez admitía que no podía descartar que datos de uso desidentificados mejoraran modelos cuyo entrenamiento empezó mientras ellos trabajaban. Las dos cosas pueden ser técnicamente ciertas, y la segunda es la que debería preocuparte si haces investigación no publicada o tu startup tiene su ventaja en datos propios. La pregunta no es “¿usan mis datos?”, es “¿puedo demostrar que no?”. Si la respuesta es no, revisa privacidad vs. cloud APIs para agentes antes de subir lo siguiente.
Metodología
Pieza de análisis basada en fuentes primarias verificadas el 21 de septiembre de 2026: el post de OpenAI con su actualización del 10-sep, la declaración de Buckmaster completa (4 páginas), la nota de Clay (11-sep), mathandai.org (declaración de los Fields, 11-sep), El País (10-sep) y ICMAT. Todas las alegaciones de la disputa se atribuyen explícitamente a la declaración de Buckmaster; las cifras de coste se presentan como estimaciones de sus fuentes, no como datos de OpenAI. No hemos leído la prueba ni la formalización en Lean; nuestra evaluación es sobre el proceso, el coste y la disputa, no sobre la corrección matemática, que corresponde a la evaluación de Clay y la comunidad.
Conclusión
El run es real y lo replicable no es el modelo, es el patrón: variantes en paralelo, consolidación cruzada, seed de resultados intermedios y un gate de verificación barato que decide qué cuenta. Eso lo puedes aplicar con tu presupuesto, y probablemente deberías: es la diferencia entre un agente que escribe convincente y un sistema que produce resultados comprobables.
Lo demás está abierto. Clay evaluará “sin prisa”. La cronología que Buckmaster puso sobre la mesa sigue sin respuesta detallada más allá de las negativas de OpenAI, y la carta de los 25 Fields es la primera respuesta institucional organizada a lo que significa resolver problemas sin comprenderlos. La pregunta de los 22,5 millones de dólares (o los 15 millones de euros, o los “millones” oficiales) no es si la IA puede resolver Navier-Stokes. Es quién se queda la idea, los datos y la narrativa cuando lo hace.
Fuentes: OpenAI — On the Navier–Stokes Millennium Prize Problem (8-sep-2026, actualizado 10-sep) · Tristan Buckmaster — Statement (7-sep-2026, PDF) · Clay Mathematics Institute — Navier-Stokes Announcement (11-sep-2026) · Math and AI — A Severe Misalignment of AI in Mathematics (11-sep-2026) · Terence Tao — What’s new (11-sep-2026) · El País — Un año de trabajo de dos matemáticos españoles frente a 88 horas y 15 millones de OpenAI (10-sep-2026) · ICMAT — The Spanish mathematical programme behind AI’s potential advances (11-sep-2026) · RSME — Declaración ante los recientes avances en IA y la resolución de Navier-Stokes (16-sep-2026) · GitHub — tristanbuckmaster/fluid_lean · IBM Think — Terence Tao sobre Navier-Stokes y “strip-mining” (10-sep-2026) · Marginal Revolution — Some Navier-Stokes updates (8-sep-2026)