OpenAI enfrenta una disputa por un esfuerzo de prueba de Navier–Stokes asistido por IA

Un matemático dice que OpenAI usó la dirección de investigación de su equipo para perseguir una controvertida prueba de Navier–Stokes, lo que plantea preguntas sobre la ética de la investigación en IA.

AI News

El profesor de matemáticas de NYU Tristan Buckmaster dice que OpenAI pasó a perseguir un enfoque líder para el problema de existencia y suavidad de Navier-Stokes después de enterarse del trabajo que él estaba completando con el matemático de Anthropic Levent Alpöge. La disputa surgió cuando Buckmaster y Alpöge anunciaron resultados preliminares y OpenAI publicó lo que describió como una prueba completa del mismo problema central.

El episodio combina un desarrollo matemático potencialmente importante con una pregunta difícil para la investigación en IA: cuando un equipo asistido por un modelo se entera de que investigadores externos han encontrado una vía prometedora, ¿cuánto puede usar esa dirección sin apropiarse indebidamente del trabajo de los investigadores? La evidencia disponible consiste principalmente en el relato de Buckmaster y en la propia declaración de OpenAI. No hay confirmación independiente en el material fuente de que la prueba de OpenAI sea correcta o de que haya utilizado datos confidenciales de usuarios.

Una carrera alrededor de un problema matemático de 1 millón de dólares

El problema de existencia y suavidad de Navier-Stokes es uno de los siete problemas del Premio del Milenio establecidos por el Clay Mathematics Institute. Una solución correcta conlleva un premio de 1 millón de dólares y resolvería una pregunta de larga data sobre el comportamiento matemático de las ecuaciones de flujo de fluidos.

Buckmaster anunció tres pruebas con Alpöge, describiéndolas como hallazgos preliminares que avanzaban hacia el problema más amplio. Su trabajo utilizó varios sistemas de IA, principalmente Codex de OpenAI y Anthropic Claude, pero Alpöge actuaba de manera independiente y no en nombre de Anthropic.

Según la declaración de Buckmaster, los investigadores se enteraron, mientras finalizaban sus resultados, de que información sobre su progreso había llegado a OpenAI. Dice que entonces OpenAI les dijo que ya había obtenido una prueba completa. El propio comunicado de OpenAI afirmó que su esfuerzo más reciente comenzó el 1 de septiembre, después de que circularan rumores de que dos problemas del Premio del Milenio habían sido resueltos.

Ese momento es central para la disputa. Buckmaster sostiene que la ruta particular que siguió su equipo no era una respuesta obvia al enunciado del problema y estaba siendo explorada por relativamente pocos investigadores. Por ello le pareció sospechoso que el equipo de OpenAI adoptara, como él lo describe, la misma dirección poco después de enterarse del trabajo externo.

Lo que Buckmaster alega y lo que dice OpenAI

Buckmaster dice que las conversaciones con OpenAI se volvieron cada vez más confusas cuando preguntó cuándo la empresa había comenzado su trabajo y cuánta guía humana había estado involucrada. Afirma que se asignó un gran equipo al problema y que se usó una cantidad inusualmente grande de poder de cómputo.

También dice que el investigador de OpenAI Sébastien Bubeck le pidió que quitara el crédito de Alpöge como parte de un posible compromiso. Buckmaster además alega que Bubeck le advirtió que no hiciera pública la disputa. Esas afirmaciones son alegatos de Buckmaster, no hechos establecidos de forma independiente en la cobertura disponible.

El relato publicado por OpenAI confirma que su esfuerzo comenzó después del 1 de septiembre y reconoce conversaciones en curso con Buckmaster y Alpöge. La empresa dice que su prueba difiere sustancialmente del trabajo de los investigadores, incluida una distinción entre formulaciones forzadas y no forzadas en el resultado relacionado con Euler.

La empresa también rechazó la idea de que sus investigadores o agentes de IA hubieran visto directamente el trabajo inédito del equipo antes de su publicación. OpenAI dijo que no se accedió a datos específicos de usuarios para resolver el problema. Sin embargo, reconoció que no podía descartar la posibilidad de que datos desidentificados derivados del uso del producto hubieran ayudado a mejorar sus modelos.

Esa salvedad importa porque Buckmaster usó Codex de forma intensiva. OpenAI se reserva la capacidad de entrenar modelos con interacciones de Codex, aunque los usuarios pueden optar por no participar. El material fuente no demuestra que las interacciones de Buckmaster se incluyeran en el entrenamiento, que algún modelo reprodujera su trabajo o que esos datos influyeran en la prueba de OpenAI.

Las afirmaciones sobre la prueba siguen sin verificarse en este relato

OpenAI dice que un modelo de próxima generación aún no publicado descubrió la prueba después de un esfuerzo de una semana que involucró 300.000 millones de tokens de salida. TechCrunch informó una estimación de cómputo de 22,5 millones de dólares basada en los precios de Astra vigentes en ese momento. Se trata de cifras reportadas y afirmaciones vinculadas a la empresa, no de mediciones auditadas de forma independiente.

Del mismo modo, la existencia de una “prueba completa” no debe tratarse como equivalente a una solución aceptada por la comunidad matemática. Las soluciones del Premio del Milenio requieren verificación detallada, y la evidencia fuente no incluye una evaluación revisada por pares, una decisión del Clay Mathematics Institute ni confirmación de matemáticos independientes de que el argumento de OpenAI sea sólido.

Los resultados de Buckmaster y Alpöge también se describen como preliminares. Su importancia puede depender en última instancia de si el trabajo puede completarse, comprobarse y demostrarse que resuelve las condiciones exactas del problema de Navier-Stokes. En matemáticas avanzadas, un argumento generado por IA puede ser valioso sin ser correcto, completo o elegible para un premio formal.

Por lo tanto, el episodio tiene dos afirmaciones separadas que no deben confundirse. Una es matemática: si alguno de los equipos ha producido una solución válida. La otra es procedimental: si OpenAI usó información obtenida a través de conversaciones con los investigadores o adoptó su enfoque de forma injusta. Ninguna de las dos cuestiones queda resuelta solo con las declaraciones disponibles.

Por qué la disputa importa para los equipos de investigación en IA

Para los desarrolladores de IA y las organizaciones de investigación, el conflicto resalta un problema creciente de gobernanza en torno al descubrimiento asistido por modelos. Un científico que usa un sistema de codificación o razonamiento alojado puede generar trabajo novedoso dentro de una plataforma cuyo proveedor conserva cierta capacidad para usar los datos de interacción para mejorar el modelo. Incluso si ningún empleado lee directamente el trabajo privado de un usuario, pueden surgir preguntas sobre la exposición al entrenamiento, la memorización, los controles de acceso y la procedencia de salidas posteriores.

El caso también presiona las prácticas de divulgación. Los equipos que usan sistemas de IA para investigación original pueden necesitar registros más claros de los prompts, las versiones del modelo, los ajustes de retención de datos, las contribuciones humanas y el momento en que surgieron las ideas clave. Esos registros podrían volverse importantes cuando varios grupos informan resultados similares o cuando un modelo produce una prueba después de haber estado expuesto a investigación relacionada.

Para los compradores empresariales, el problema práctico no se limita a las matemáticas. Las mismas preocupaciones se aplican cuando los empleados usan herramientas de IA para desarrollar algoritmos propietarios, diseños de productos, estrategias legales o hallazgos científicos. Las organizaciones querrán claridad contractual sobre el uso para entrenamiento, mayor aislamiento para sesiones sensibles y procedimientos para investigar posibles solapamientos entre el trabajo del cliente y la investigación del proveedor.

La historia también complica la competencia entre laboratorios de IA. El empleo de Alpöge en Anthropic, a pesar de su papel independiente en este proyecto, parece haber añadido tensión institucional. Si los investigadores creen que la afiliación con una empresa rival puede afectar el crédito o el acceso a la colaboración, el trabajo científico entre empresas puede volverse más difícil precisamente cuando la investigación de IA de frontera depende de ello.

Qué vigilar a continuación

La primera señal será la revisión matemática independiente de la supuesta prueba de OpenAI y de los resultados preliminares de Buckmaster y Alpöge. Una presentación formal, detalles técnicos públicos o una evaluación vinculada al Clay Mathematics Institute ayudarían a distinguir una solución genuina de una salida de modelo impresionante pero incompleta.

Los investigadores también deberían vigilar documentación sobre la cronología de los dos esfuerzos: cuándo recibió OpenAI la información relevante por primera vez, qué se mostró a sus sistemas y si algún dato de interacción de Codex era elegible para entrenamiento. La aclaración de los ajustes de retención de datos y exclusión voluntaria utilizados por Buckmaster sería relevante, aunque por sí sola no probaría contaminación del modelo.

Por último, la disputa puede impulsar a los laboratorios de IA y a las instituciones académicas a establecer normas más claras sobre crédito, confidencialidad y prioridad cuando los modelos participan en la investigación. El resultado podría influir en cómo se registran los descubrimientos futuros y en cómo los científicos eligen entre herramientas de IA alojadas y sistemas controlados localmente.

Perspectiva de Creati.ai

La tentación inmediata es presentar esto como una contienda sobre quién resolvió primero un problema famoso. La cuestión más trascendental es si la investigación asistida por IA tiene reglas de procedencia adecuadas cuando el trabajo de un científico pasa por un proveedor comercial de modelos. La negativa de OpenAI a un acceso directo y su admisión de que no se puede descartar una influencia desidentificada dejan una brecha entre la posibilidad técnica y la prueba evidencial.

Hasta que las afirmaciones matemáticas y la cronología de la investigación se examinen de forma independiente, la conclusión responsable es limitada: OpenAI ha informado de un gran esfuerzo de prueba, mientras que Buckmaster ha planteado preguntas serias sobre prioridad, atribución y uso de datos. Para desarrolladores y empresas, el caso es un argumento a favor de flujos de trabajo de IA auditables, no una razón para asumir que los modelos alojados están copiando a los usuarios o que los avances generados por modelos ya están validados.

Anuncios